tradingkey.logo
搜尋

SpaceXAI發布Grok 4.7:面向程式設計與知識工作的一代旗艦,價格與Grok 4.6持平

TradingKey
作者Andy Chen
2026年9月21日 17:43

AI 播客

facebooktwitterlinkedin

SpaceXAI於9月21日發布Grok 4.7,定價維持輸入2美元、輸出6美元/百萬token,並提供輸出翻倍的fast版本。該模型聚焦長任務程式設計與專業文件產出,在CursorBench 4.0與Terminal-Bench 4.0等基準測試中顯著提升。憑藉強化的自我檢查與長上下文管理能力,其在維持低遷移成本的同時,展現出同價位段的性價比前沿優勢。

該摘要由AI生成

Tradingkey - SpaceXAI(SPXC旗下 AI 部門,原 xAI)於 9 月 21 日發布 Grok 4.7,官方將其定位為目前面向程式設計與知識工作能力最強的一代模型,定價與 Grok 4.6 保持一致:輸入 2 美元 / 百萬 token,輸出 6 美元 / 百萬 token。在專門考驗長時間程式設計任務的 CursorBench 4.0 上,Grok 4.7 取得 46.3%,比 Grok 4.6 高出 5.9 個百分點,官方稱其在該基準上處於同價位段的性價比前沿。

過去兩年,旗艦模型的能力提升通常以更貴的 token 單價收尾:換代、漲價,然後等產業慢慢消化推理成本。Grok 4.7 走的是另一條路,能力上探的同時,價格與推理速度都停在 Grok 4.6 的水準線上,並額外提供一個輸出速度翻倍的 fast 版本。

官方披露的細節集中在四個方面:基座模型與強化學習訓練的變化、七項基準的橫豎對比、長任務下的成本結構,以及一套完全重寫的安全防護堆疊。此外,模型即日起在 Cursor、Grok Build、Grok API 以及第三方程式設計框架與模型路由平台上同步開放。

Grok 4.7 的核心主張落在長任務程式設計、專業文件產出與安全防護三項能力上。三者共用同一條價格線,與前代同價、同速,並用 fast 版本覆蓋對延遲敏感的場景。

官方基準顯示,這一代模型的進步是連續的:CursorBench 4.0 提升 5.9 個百分點,Terminal-Bench 4.0 接近翻倍,AA Briefcase 增加 111 分,生物安全基準取得公司最高分。同時,法律基準 19.6% 的絕對水準、以及 Fable 5.1 在四項基準上的領先,說明這仍是互有勝負的一輪競爭,而不是單方面的替代。

定價與速度維持不變

Grok 4.7 的起步價為每百萬輸入 token 2 美元、每百萬輸出 token 6 美元,與 Grok 4.6 完全一致,推理速度也維持在同一水準。官方另外提供一個 fast 版本,輸出速度為標準版的兩倍,價格同步翻倍。

這一定價在同類模型中處於低位。作為對照,GPT-5.6 Sol 在 max 檔位為輸入 4 美元、輸出 20 美元;Fable 5.1 在 max 檔位為輸入 10 美元、輸出 50 美元。僅比較輸出單價,Grok 4.7 約為前者的三分之一,約為後者的八分之一。

價格不動帶來的現實影響是遷移成本可控。已經在使用 Grok 4.6 的團隊,可以直接在 Cursor 或 Grok Build 中切換模型,用現成的任務集跑一次對比,介面與呼叫方式都不需要改動。

模型改進

Grok 4.7 強化學習階段的訓練時間也更長,訓練任務的難度組合整體上移,權重向需要數小時才能完成的問題傾斜。官方給出的直接結果是:模型更能核對自己的產出,也更能管理長上下文。

另一處改動發生在訓練目標中。Grok 4.7 被訓練成原生理解 Grok Bot 的執行框架 (harness),因此在對話類任務與通用知識工作上的表現更好。SpaceXAI 於 8 月 11 日推出 Grok Bot,將其描述為一組常駐運行、各自擁有電腦、可以在工具與應用程式內部工作的智慧體。

文件與簡報的生成能力被單獨提出來。官方稱 Grok 4.7 在這兩類產出上比 Grok 4.6 有明顯改進,與其他前沿模型表現相當。

七項基準的成績單

Grok 4.7 在建立文件與簡報方面表現更佳。在 GDPval 和 AA Briefcase 測試中,人工智慧需要完成律師、護理師和金融分析師等專業人士的工作。Grok 4.7 在這兩項基準測試中均優於 Grok 4.6,並且與其他前沿模型性能相當。

4-f85d422bc90543a498f2bd733762b144

【官方比較表涵蓋程式設計、終端機操作、電機工程、法律、臨床推理與辦公任務,來源:x.ai】

法律與終端機操作是提升幅度最大的兩類。在 Harvey Legal Agent Benchmark 上,Grok 4.7 的 19.6% 為本組最高,而 GPT-5.6 Sol 只有 2.5%;在 Terminal-Bench 4.0 上,Grok 4.7 從 Grok 4.6 的 20.3% 提升至 38.0%,接近翻倍。臨床推理提升 8.2 個百分點,辦公任務分數增加 111 分。

長任務下的成本曲線

CursorBench 4.0 的官方頁面把三張圖並排呈現:每任務平均成本、平均輸出 token、平均步數,縱軸統一為同一套得分。圖中的參考點被標在 Sonnet 5(high 預設檔)上:得分 30.8%、每任務 3.48 美元、約 6.1 萬輸出 token、85 步,作為成本效率的比較基準。

5-7db9b361e8984e1f905267db471081e0

【來源:X.ai】

從成本曲線看,Fable 5.1 的得分最高,代價是每任務成本接近 18 美元;GPT-5.6 Sol 位於低成本一側,得分隨成本下降滑落得更快。Grok 4.7 落在兩者之間,官方稱其在該基準上處於性價比前沿。輸出 token 與步數兩張圖的形狀與成本圖一致,說明成本差異主要來自完成任務所需的推理長度,而不是單價本身。

設想一個 6 人的後端團隊要把一套 40 萬行的服務從舊框架遷到新框架。這類任務拆成單步提交沒有意義,模型必須連續工作數小時,並在中途自己檢查前一步的結果,這正是 CursorBench 4.0 與 Terminal-Bench 4.0 試圖衡量的場景。當一個任務的成本從十幾美元降到幾美元,團隊才可能把它放進日常排程,而不是等到週末集中處理。

安全與網路安全

Grok 4.7 使用了一套全新的安全防護堆疊。官方稱它是公司測試過、在拒答與抗越獄兩項上表現最強的模型。

在網路安全與生物等雙用途領域,官方數據同時涵蓋兩面:對合法任務保持可用,對危險請求保持拒答。生物安全方向,Grok 4.7 在 LatchBio 的生物安全基準上取得 62.4%,為該基準上的最高分。網路安全方向,自建基準 HackerBench v0.3 顯示模型僅放行了 3.3% 的高風險雙用途提示詞,同時很少攔截合法的安全研究工作。

SpaceXAI 還表示,已開始向部分網路安全合作夥伴提供 Grok 4.7 紅隊能力的邀請制存取權限,用於防禦性研究。

本內容經由 AI 翻譯並經人工審閱,僅供參考與一般資訊用途,不構成投資建議。

查看原文
免責聲明: 本文內容僅代表作者個人觀點,不代表Tradingkey官方立場,也不能作為投資建議。文章內容僅供參考,讀者不應以本文作為任何投資依據。 Tradingkey對任何以本文為交易依據的結果不承擔責任。 Tradingkey亦不能保證本文內容的準確性。在做出任何投資決定之前,您應該尋求獨立財務顧問的建議,以確保您了解風險。

推薦文章

tradingkey.logo
風險提示:我們的網站和行動應用程式僅提供關於某些投資產品的一般資訊。Finsights 不提供財務建議或對任何投資產品的推薦,且提供此類資訊不應被解釋為 Finsights 提供財務建議或推薦。
投資產品存在重大投資風險,包括可能損失投資的本金,且可能並不適合所有人。投資產品的過去表現並不代表其未來表現。
Finsights 可能允許第三方廣告商或關聯公司在我們的網站或行動應用程式的任何部分放置或投放廣告,並可能根據您與廣告的互動情況獲得報酬。
© 版權所有: FINSIGHTS MEDIA PTE. LTD. 版權所有