從Kimi K3看大模型規模效應的新敘事
2026年7月16日,月之暗面扔出了一顆重磅炸彈。Kimi K3正式發佈,2.8萬億參數,100萬Token上下文窗口,原生視覺理解能力。這不僅是Kimi迄今能力最強的模型,更是全球參數最大的開源模型。消息一出,連埃隆·馬斯克都在X評論區留下了一句“Impressive”。
但真正讓行業震動的,或許不是參數本身。2.8萬億這個數字固然震撼,但大模型行業早就過了那個“誰參數大誰就贏”的蠻荒時代。真正值得追問的是:在這個Scaling Law頻頻被質疑“撞牆”的2026年,Kimi K3到底講述了一個怎樣的規模效應故事?
規模效應從來沒有消失,它只是換了種活法
過去幾年,大模型領域最深入人心的經驗總結莫過於Scaling Law。OpenAI在2020年提出的這條定律,用一句話概括就是:訓練參數量越大、算力越多、數據越多,模型性能就越好。這套邏輯驅動了整整一代AI創業者的軍備競賽,也催生了從千億到萬億、再到數萬億參數的模型迭代。
但進入2026年,情況起了變化。單純通過囤積算力、增加數據量來提升模型能力的收益開始遞減。行業普遍感受到,更大的參數、更多的芯片,已經無法帶來同等比例的智能提升。Scaling Law似乎撞上了一堵高牆——數十億美元砸下去訓練下一代超級大模型,性能的提升卻沒有太大飛躍。
然而,如果說Scaling Law“失效”了,那Kimi K3的出現就是一個有力的反駁。真正在發生的不是Scaling Law失效,而是單一維度的參數堆疊遇到了邊際收益遞減。K3的2.8萬億參數不是簡單的數字遊戲——月之暗面將參數比作人腦裏的神經連接,“近3萬億參數意味着這個模型能把更多的知識和規律裝進'腦子',懂得更多、想得更深、答得更準”。但真正讓這些參數發揮作用的,是模型架構層面的系統性創新。
KDA與稀疏MoE:用更聰明的方式變大
Kimi K3的核心祕密藏在一個叫KDA的技術裏——Kimi Delta Attention混合線性注意力機制。傳統Transformer的注意力計算隨着上下文長度增加呈平方級增長,而KDA通過細粒度的通道級門控和分塊循環更新,實現了更高效的注意力計算。研究顯示,KDA在短上下文、長上下文和強化學習等多種場景中在效率上展現出了與全注意力模型相當甚至更優的表現(據月之暗面內部研究)。
與此同時,K3採用了896個專家的MoE架構,但每次推理只激活其中16個。這就好比一個擁有896名專家的超級智庫,處理任何問題時只調動最對口的16個人——既保證了專業深度,又控制了計算成本。再加上注意力殘差技術——用不到2%的算力換取約25%的訓練效率提升——K3在架構層面的創新形成了一套精密的組合拳。
結果是:Kimi K3相較上一代K2的整體擴展效率提升了約2.5倍。這是一個關鍵數字。規模效應的本質從來不是“大”,而是“大的同時更有效率”。K3證明了一件事:參數規模的擴張可以不再以同等比例的算力消耗爲代價。規模效應正在從“堆規模”轉向“用更聰明的方式實現規模”。
從“能聊天”到“能幹活”:規模效應的價值轉向
如果說參數是K3的“體量”,架構是它的“肌肉”,那真正讓行業興奮的,或許是它展現出的“幹活”能力。
K3的定位非常明確:面向長程編程、知識工作和複雜推理等前沿智能場景。它不是另一個陪你聊天的對話模型,而是一個能持續調用工具、根據運行結果迭代、把複雜任務推進到最終交付的長程Agent。
一組數據可以說明這種能力的分量。在生成AI ASIC行業研究網站的任務中,K3經歷了120輪以上的遞歸改進,完成了2800多次網頁搜索與抓取、1100多次終端數據調用,處理了超過1.1萬頁內容。在引力波分析案例中,它調用了20個以上的併發子Agent處理391個事件。這些任務已經從單輪問答,轉變爲檢索、執行、校驗、繪圖和修改組成的長鏈路流程。(數據來源:月之暗面官方演示案例)
在社區盲測平臺Arena AI的Frontend Code Arena榜單上,K3以1679分超越Claude Fable 5,位居第一。在月之暗面內部評測體系SWE Marathon(測試超長程軟件工程任務能力)中,K3同樣位列第一。更令人印象深刻的是,K3在連續48小時的自主運行中,基於開源EDA工具和45nm工藝庫,獨立完成了芯片的設計、優化與驗證。
規模效應的本質沒有變,但實現的路徑徹底變了
回到最初的問題:從Kimi K3身上,我們看到了大模型規模效應的什麼新敘事?
第一,規模仍然是有效的,但“規模”的內涵變了。 2.8萬億參數不是用來堆砌數字的——它服務於更深層的能力躍遷。參數規模決定了能力上限,但真正把上限兌現爲實際表現的,是架構、訓練方法、數據配方的協同優化。
第二,規模效應的衡量標準變了。 過去我們看參數數量,現在我們要看擴展效率。
2026年7月,當Kimi K3以2.8萬億參數的姿態站上全球開源模型的巔峯時,它證明了一件事:大模型的規模效應遠未走到盡頭,只是我們不能再拿舊地圖去探索新大陸。參數競賽的時代或許正在落幕,但一個關於“如何讓規模真正產生價值”的新時代,纔剛剛開始。









