tradingkey.logo
搜尋

Qwen3.8 Max重測後追平Opus 4.8

金色財經2026年8月7日 03:07
facebooktwitterlinkedin

8月7日消息,評測機構 Artificial Analysis 重測 Qwen3.8 Max 後,將其 Intelligence Index 從 53 分上調到 56 分。此前測試接口出現間歇性異常,這次改用阿里雲官方 API 重跑。新成績追平 Claude Opus 4.8,但仍比 Kimi K3 低 1 分。 千問進步最明顯的是 Agent 任務。GDPval-AA 得分達到 1739,超過 Kimi K3 的 1685 和 GPT-5.6 Sol 的 1730,僅落後 Claude Opus 5。終端操作、科學推理和編程評測也普遍上漲。 代價是更費 Token。Qwen3.8 Max 的 Token 單價比上一代更低,但完成一道綜合評測任務的平均成本,仍從 0.53 美元漲到 1.14 美元,高於 Kimi K3 的 0.86 美元。主要原因是它在 Agent 任務中調用更多輪次,生成的內容也更多。 它的知識可靠性還出現倒退。AA-Omniscience 準確率基本沒變,幻覺率卻從上一代的 23% 升到 40%。

免責聲明:本網站提供的資訊僅供教育和參考之用,不應視為財務或投資建議。

推薦文章

tradingkey.logo
風險提示:我們的網站和行動應用程式僅提供關於某些投資產品的一般資訊。Finsights 不提供財務建議或對任何投資產品的推薦,且提供此類資訊不應被解釋為 Finsights 提供財務建議或推薦。
投資產品存在重大投資風險,包括可能損失投資的本金,且可能並不適合所有人。投資產品的過去表現並不代表其未來表現。
Finsights 可能允許第三方廣告商或關聯公司在我們的網站或行動應用程式的任何部分放置或投放廣告,並可能根據您與廣告的互動情況獲得報酬。
© 版權所有: FINSIGHTS MEDIA PTE. LTD. 版權所有