千問查漏洞3輪召回率追平Opus5,成本只有一半
金色財經報道,8月5日消息,安全公司 Aikido 用代碼審計 Agent 測試了 7 款模型,包括 Qwen3.8-Max、Claude Opus 5、Kimi K3 Max、DeepSeek V4 Flash,以及 GPT-5.6 Sol、Luna 和 Terra。測試包含 32 個近期公開漏洞,每款模型運行 3 次。 Qwen3.8-Max 三輪合計找到 26 個漏洞,召回率達到 81.3%,與 Opus 5 並列第一。它的 F1 綜合分(兼顧漏報和誤報)爲 83.2%,略低於 Opus 5、Kimi K3 Max 和 GPT-5.6 Sol。 千問的問題是單次發揮不穩定。26 個漏洞中,只有 10 個連續三輪都能找到,Opus 5 和 Sol 都有 19 個。不過,千問總成本約 821 美元,只有 Opus 5 和 Sol 的一半,但仍是 DeepSeek V4 Flash 的 5 倍。
免責聲明:本網站提供的資訊僅供教育和參考之用,不應視為財務或投資建議。
讚










