tradingkey.logo
搜尋

Terminal-Bench 4.0:GLM-5.3衝到第三,超過GPT-5.6 Sol

金色財經2026年8月29日 14:15
facebooktwitterlinkedin

8月29日消息,Terminal-Bench發佈4.0,重新校準Agent執行任務時的時間、CPU和內存,並修復19個任務、移除8個存在飽和、拒答、公開解法或質量問題的任務。所有任務的最長執行時間統一到8小時,主要是減少超時和環境問題對成績的干擾。最新榜單裏,Opus5+ClaudeCode以51.8%排第一,Fable5以44.5%第二。GLM-5.3+ClaudeCode拿到41.8%,衝到第三,超過GPT-5.6Sol+Codex的37.3%。前三名裏,GLM-5.3是唯一不是Anthropic的模型。在Terminal-Bench3.0中,GLM-5.3還是32.4%排第四,落後GPT-5.6Sol的34.6%;到了4.0,GLM-5.3升到第三,反過來領先Sol4.5個百分點。

免責聲明:本網站提供的資訊僅供教育和參考之用,不應視為財務或投資建議。

推薦文章

tradingkey.logo
風險提示:我們的網站和行動應用程式僅提供關於某些投資產品的一般資訊。Finsights 不提供財務建議或對任何投資產品的推薦,且提供此類資訊不應被解釋為 Finsights 提供財務建議或推薦。
投資產品存在重大投資風險,包括可能損失投資的本金,且可能並不適合所有人。投資產品的過去表現並不代表其未來表現。
Finsights 可能允許第三方廣告商或關聯公司在我們的網站或行動應用程式的任何部分放置或投放廣告,並可能根據您與廣告的互動情況獲得報酬。
© 版權所有: FINSIGHTS MEDIA PTE. LTD. 版權所有