tradingkey.logo
搜尋

AMD發佈全開源MoE大模型Instella-MoE,16B參數規模挑戰主流開源模型

金色財經2026年7月25日 03:28
facebooktwitterlinkedin

7月25日,AMD宣佈推出全開源混合專家模型(MoE)Instella-MoE,該模型擁有160億總參數,每個Token激活28億參數,號稱在同規模開源語言模型中具備領先性能。AMD 表示,Instella-MoE 完全基於自家 AMD Instinct MI300X 和 MI325X GPU,以及 ROCm 軟件棧從零訓練完成,並採用 Gated Multi-head Latent Attention(Gated MLA)和 FarSkip-Collective 等架構創新,以提升訓練和推理效率。性能測試顯示,Instella-MoE-16B-A3B 基礎模型平均得分達到 76.7 分,在全開源模型中排名領先,超過 SmolLM3-3B、OLMo-3-7B 等模型,並在僅激活 28 億參數的情況下,與更大規模模型競爭。 此外,該模型支持 64K Token 長上下文處理,並完成預訓練、中期訓練、長上下文擴展、監督微調(SFT)、直接偏好優化(DPO)以及強化學習(RL)等完整訓練流程。AMD 此次同步公開 Instella-MoE 全部模型權重、訓練配置、數據配比、中間檢查點及推理代碼,推動開放 AI 模型研究與復現。AMD 表示,Instella-MoE 展示了基於 AMD 硬件和開放軟件生態進行大規模 MoE 模型訓練的能力,未來將繼續推進更大規模、更強推理能力和更高效率的開源語言模型研發。

免責聲明:本網站提供的資訊僅供教育和參考之用,不應視為財務或投資建議。

推薦文章

tradingkey.logo
風險提示:我們的網站和行動應用程式僅提供關於某些投資產品的一般資訊。Finsights 不提供財務建議或對任何投資產品的推薦,且提供此類資訊不應被解釋為 Finsights 提供財務建議或推薦。
投資產品存在重大投資風險,包括可能損失投資的本金,且可能並不適合所有人。投資產品的過去表現並不代表其未來表現。
Finsights 可能允許第三方廣告商或關聯公司在我們的網站或行動應用程式的任何部分放置或投放廣告,並可能根據您與廣告的互動情況獲得報酬。
© 版權所有: FINSIGHTS MEDIA PTE. LTD. 版權所有