DeepSeek 的 mHC 首秀在同行驗證前遭遇質疑
在人工智能開發和維護成本不斷上漲以及可用硬件數量有限等問題日益凸顯的當下,DeepSeek 提出了一個開發和擴展人工智能 (AI) 的新計劃。.
這家總部位於中國的初創公司認爲,無需增加芯片數量,從而避免增加功耗,就能打造出性能顯著更優的人工智能模型。儘管其提出的微型人機交互(mHC)概念已引起衆多研究人員的廣泛關注,但普遍認爲它仍處於早期階段。.
還需要進一步研究來確定該方法在開發大型人工智能系統方面的優勢。上週發佈了一篇詳細介紹 mHC 概念的技術論文,該論文由 DeepSeek 的創始人兼首席執行官梁文峯參與撰寫。.
DeepSeek重新思考網絡設計以擴展人工智能
這項工作的主要組成部分之一是重新評估信息如何在多層神經網絡的各個層之間傳遞。.
神經網絡中的每一層都會將處理後的信息傳遞給模型中的下一層,從而形成所謂的“殘差學習網絡”( ResNet )。ResNet 由微軟研究院的何凱明等人於大約十年前開發,爲當今許多最先進的人工智能系統奠定了基礎。
DeepSeek 開發的概念是在字節跳動於 2024 年推出Hyper-Connections。Hyper-Connections 允許信息在網絡中通過多條路徑傳輸,而不是僅僅通過一條主路徑,這可以提高學習速度並豐富體驗。
然而,雖然它們可能帶來益處,但也可能導致matic 出現問題,例如模型訓練不穩定或完全失敗。.
據宋林奇(香港城市大學)稱,DeepSeek 的研究是對現有理念的推進,是 DeepSeek 審視其他公司工作方式的延續,而不是從零開始發明創造。.
ResNet 被比作單車道高速公路,而 Hyper-Connections 則類似於多車道高速公路;然而,宋警告說,多車道且沒有適當的規則可能會導致更多碰撞。.
香港科技大學郭松教授認爲,這篇研究論文可能預示着人工智能研究。他認爲,未來的研究方向可能不再是繼續對現有模型進行小幅修改,而是基於理論構建開發全新模型。
研究人員對mHC進行測試,但提出了實際問題
儘管mHC在深度學習測試方面取得的最新進展令人振奮,但專家強調,這項研究尚未完成。DeepSeek提供的測試僅使用了四條數據路徑,而模型參數卻高達270億。
“這些實驗驗證了參數高達 270 億的模型,但是對於如今參數規模大一個數量級的尖端模型,它的表現又會如何呢?”
郭松教授。.
與幾年前的標準參數數僅爲 300 億相比,如今可用的 AI 模型規模更大,通常擁有數千億個參數。.
郭也表達了類似的觀點,並指出目前尚無法斷定移動人機交互(mHC)能否在人工智能技術的前沿領域發揮作用。他還表示,mHC運行所需的基礎設施可能過於複雜,小型研究機構難以使用,企業也難以在移動設備上應用。.
據Cryptopolitan,DeepSeek 的流行源於其發佈的 DeepSeek V3 大型語言模型,以及隨後在短短几周後發佈的 DeepSeek-R1 推理模型。
在基準測試中,將模型結果與競爭對手進行比較時,儘管這兩個模型僅使用了其他競爭語言模型的一小部分訓練數據,但它們仍然能夠達到或超過競爭對手的結果。.
立即註冊 Bybit,即可免費獲得 50 美元








