tradingkey.logo
搜尋

Kimi開源PerceptionBench視覺感知基準,GPT-5.6-Sol準確率居首但無模型突破60%

金色財經2026年7月28日 14:37
facebooktwitterlinkedin

金色財經報道,Kimi Team宣佈開源多模態大模型視覺感知評測基準PerceptionBench,旨在將視覺感知能力拆解爲10項原子級能力進行獨立評估,涵蓋視覺關係、計數、屬性、深度與3D、定位、比較、細粒度識別、上下文整合、OCR及幻覺識別等維度。該基準基於42個現有評測集中的模型失敗案例構建,共包含3000道經人工驗證的問題,每題僅考察單一視覺能力,無需推理或外部知識。 評測結果顯示,在16款前沿多模態大模型中,沒有任何模型整體準確率超過60%。GPT-5.6-Sol以59.7%的準確率排名第一,Kimi K3(58.5%)、Claude-Fable-5(57.2%)、Gemini-3.1-Pro(56.2%)和GPT-5.5(55.8%)位列前五。報告指出,視覺幻覺(Hallucination)仍是各模型表現最弱的能力,整體感知能力仍存在顯著提升空間。

免責聲明:本網站提供的資訊僅供教育和參考之用,不應視為財務或投資建議。

推薦文章

tradingkey.logo
風險提示:我們的網站和行動應用程式僅提供關於某些投資產品的一般資訊。Finsights 不提供財務建議或對任何投資產品的推薦,且提供此類資訊不應被解釋為 Finsights 提供財務建議或推薦。
投資產品存在重大投資風險,包括可能損失投資的本金,且可能並不適合所有人。投資產品的過去表現並不代表其未來表現。
Finsights 可能允許第三方廣告商或關聯公司在我們的網站或行動應用程式的任何部分放置或投放廣告,並可能根據您與廣告的互動情況獲得報酬。
© 版權所有: FINSIGHTS MEDIA PTE. LTD. 版權所有