Terminal-Bench 4.0:GLM-5.3衝到第三,超過GPT-5.6 Sol
8月29日消息,Terminal-Bench發佈4.0,重新校準Agent執行任務時的時間、CPU和內存,並修復19個任務、移除8個存在飽和、拒答、公開解法或質量問題的任務。所有任務的最長執行時間統一到8小時,主要是減少超時和環境問題對成績的干擾。最新榜單裏,Opus5+ClaudeCode以51.8%排第一,Fable5以44.5%第二。GLM-5.3+ClaudeCode拿到41.8%,衝到第三,超過GPT-5.6Sol+Codex的37.3%。前三名裏,GLM-5.3是唯一不是Anthropic的模型。在Terminal-Bench3.0中,GLM-5.3還是32.4%排第四,落後GPT-5.6Sol的34.6%;到了4.0,GLM-5.3升到第三,反過來領先Sol4.5個百分點。
免責聲明:本網站提供的資訊僅供教育和參考之用,不應視為財務或投資建議。
讚








