tradingkey.logo
搜尋

Opus 5以微弱優勢登頂智能榜,單任務成本比Fable 5低26%

金色財經2026年7月25日 05:20
facebooktwitterlinkedin

7月25日消息,第三方評測機構 Artificial Analysis 公佈 Claude Opus 5 成績。它在綜合 9 項測試的智能指數中得 61 分,窄幅領先 Fable 5 的 60 分。GPT-5.6 Sol 得 59 分,Kimi K3 得 57 分。 Opus 5 每項任務平均成本爲 2.03 美元,比 Fable 5 的 2.75 美元低 26%。它在 GDPval-AA v2 和 AA-Briefcase 兩項知識工作評測中登頂,搭配 Claude Code 後也並列拿下編程 Agent 指數第一。Terminal-Bench v2.1 得分爲 89%,大致追平 GPT-5.6 Sol。 模型提供 5 檔推理強度。從 low 到 max,輸出 Token 相差約 8 倍,GDPval-AA v2 成績相差 407 Elo。用戶可以用更多 Token 換取更強性能,也可以主動壓低成本。 短板同樣明顯。Opus 5 的事實知識仍落後 Fable 5。在 AA-Omniscience 測試中,它的幻覺率升至 50%,比 Opus 4.8 高 14 個百分點。低推理檔位的性價比也仍略遜於 GPT-5.6 系列。

免責聲明:本網站提供的資訊僅供教育和參考之用,不應視為財務或投資建議。

推薦文章

tradingkey.logo
風險提示:我們的網站和行動應用程式僅提供關於某些投資產品的一般資訊。Finsights 不提供財務建議或對任何投資產品的推薦,且提供此類資訊不應被解釋為 Finsights 提供財務建議或推薦。
投資產品存在重大投資風險,包括可能損失投資的本金,且可能並不適合所有人。投資產品的過去表現並不代表其未來表現。
Finsights 可能允許第三方廣告商或關聯公司在我們的網站或行動應用程式的任何部分放置或投放廣告,並可能根據您與廣告的互動情況獲得報酬。
© 版權所有: FINSIGHTS MEDIA PTE. LTD. 版權所有