SpaceXAI發布Grok 4.7:面向程式設計與知識工作的一代旗艦,價格與Grok 4.6持平
SpaceXAI於9月21日發布Grok 4.7,定價維持輸入2美元、輸出6美元/百萬token,並提供輸出翻倍的fast版本。該模型聚焦長任務程式設計與專業文件產出,在CursorBench 4.0與Terminal-Bench 4.0等基準測試中顯著提升。憑藉強化的自我檢查與長上下文管理能力,其在維持低遷移成本的同時,展現出同價位段的性價比前沿優勢。

Tradingkey - SpaceXAI(SPXC旗下 AI 部門,原 xAI)於 9 月 21 日發布 Grok 4.7,官方將其定位為目前面向程式設計與知識工作能力最強的一代模型,定價與 Grok 4.6 保持一致:輸入 2 美元 / 百萬 token,輸出 6 美元 / 百萬 token。在專門考驗長時間程式設計任務的 CursorBench 4.0 上,Grok 4.7 取得 46.3%,比 Grok 4.6 高出 5.9 個百分點,官方稱其在該基準上處於同價位段的性價比前沿。
過去兩年,旗艦模型的能力提升通常以更貴的 token 單價收尾:換代、漲價,然後等產業慢慢消化推理成本。Grok 4.7 走的是另一條路,能力上探的同時,價格與推理速度都停在 Grok 4.6 的水準線上,並額外提供一個輸出速度翻倍的 fast 版本。
官方披露的細節集中在四個方面:基座模型與強化學習訓練的變化、七項基準的橫豎對比、長任務下的成本結構,以及一套完全重寫的安全防護堆疊。此外,模型即日起在 Cursor、Grok Build、Grok API 以及第三方程式設計框架與模型路由平台上同步開放。
Grok 4.7 的核心主張落在長任務程式設計、專業文件產出與安全防護三項能力上。三者共用同一條價格線,與前代同價、同速,並用 fast 版本覆蓋對延遲敏感的場景。
官方基準顯示,這一代模型的進步是連續的:CursorBench 4.0 提升 5.9 個百分點,Terminal-Bench 4.0 接近翻倍,AA Briefcase 增加 111 分,生物安全基準取得公司最高分。同時,法律基準 19.6% 的絕對水準、以及 Fable 5.1 在四項基準上的領先,說明這仍是互有勝負的一輪競爭,而不是單方面的替代。
定價與速度維持不變
Grok 4.7 的起步價為每百萬輸入 token 2 美元、每百萬輸出 token 6 美元,與 Grok 4.6 完全一致,推理速度也維持在同一水準。官方另外提供一個 fast 版本,輸出速度為標準版的兩倍,價格同步翻倍。
這一定價在同類模型中處於低位。作為對照,GPT-5.6 Sol 在 max 檔位為輸入 4 美元、輸出 20 美元;Fable 5.1 在 max 檔位為輸入 10 美元、輸出 50 美元。僅比較輸出單價,Grok 4.7 約為前者的三分之一,約為後者的八分之一。
價格不動帶來的現實影響是遷移成本可控。已經在使用 Grok 4.6 的團隊,可以直接在 Cursor 或 Grok Build 中切換模型,用現成的任務集跑一次對比,介面與呼叫方式都不需要改動。
模型改進
Grok 4.7 強化學習階段的訓練時間也更長,訓練任務的難度組合整體上移,權重向需要數小時才能完成的問題傾斜。官方給出的直接結果是:模型更能核對自己的產出,也更能管理長上下文。
另一處改動發生在訓練目標中。Grok 4.7 被訓練成原生理解 Grok Bot 的執行框架 (harness),因此在對話類任務與通用知識工作上的表現更好。SpaceXAI 於 8 月 11 日推出 Grok Bot,將其描述為一組常駐運行、各自擁有電腦、可以在工具與應用程式內部工作的智慧體。
文件與簡報的生成能力被單獨提出來。官方稱 Grok 4.7 在這兩類產出上比 Grok 4.6 有明顯改進,與其他前沿模型表現相當。
七項基準的成績單
Grok 4.7 在建立文件與簡報方面表現更佳。在 GDPval 和 AA Briefcase 測試中,人工智慧需要完成律師、護理師和金融分析師等專業人士的工作。Grok 4.7 在這兩項基準測試中均優於 Grok 4.6,並且與其他前沿模型性能相當。

【官方比較表涵蓋程式設計、終端機操作、電機工程、法律、臨床推理與辦公任務,來源:x.ai】
法律與終端機操作是提升幅度最大的兩類。在 Harvey Legal Agent Benchmark 上,Grok 4.7 的 19.6% 為本組最高,而 GPT-5.6 Sol 只有 2.5%;在 Terminal-Bench 4.0 上,Grok 4.7 從 Grok 4.6 的 20.3% 提升至 38.0%,接近翻倍。臨床推理提升 8.2 個百分點,辦公任務分數增加 111 分。
長任務下的成本曲線
CursorBench 4.0 的官方頁面把三張圖並排呈現:每任務平均成本、平均輸出 token、平均步數,縱軸統一為同一套得分。圖中的參考點被標在 Sonnet 5(high 預設檔)上:得分 30.8%、每任務 3.48 美元、約 6.1 萬輸出 token、85 步,作為成本效率的比較基準。

【來源:X.ai】
從成本曲線看,Fable 5.1 的得分最高,代價是每任務成本接近 18 美元;GPT-5.6 Sol 位於低成本一側,得分隨成本下降滑落得更快。Grok 4.7 落在兩者之間,官方稱其在該基準上處於性價比前沿。輸出 token 與步數兩張圖的形狀與成本圖一致,說明成本差異主要來自完成任務所需的推理長度,而不是單價本身。
設想一個 6 人的後端團隊要把一套 40 萬行的服務從舊框架遷到新框架。這類任務拆成單步提交沒有意義,模型必須連續工作數小時,並在中途自己檢查前一步的結果,這正是 CursorBench 4.0 與 Terminal-Bench 4.0 試圖衡量的場景。當一個任務的成本從十幾美元降到幾美元,團隊才可能把它放進日常排程,而不是等到週末集中處理。
安全與網路安全
Grok 4.7 使用了一套全新的安全防護堆疊。官方稱它是公司測試過、在拒答與抗越獄兩項上表現最強的模型。
在網路安全與生物等雙用途領域,官方數據同時涵蓋兩面:對合法任務保持可用,對危險請求保持拒答。生物安全方向,Grok 4.7 在 LatchBio 的生物安全基準上取得 62.4%,為該基準上的最高分。網路安全方向,自建基準 HackerBench v0.3 顯示模型僅放行了 3.3% 的高風險雙用途提示詞,同時很少攔截合法的安全研究工作。
SpaceXAI 還表示,已開始向部分網路安全合作夥伴提供 Grok 4.7 紅隊能力的邀請制存取權限,用於防禦性研究。
本內容經由 AI 翻譯並經人工審閱,僅供參考與一般資訊用途,不構成投資建議。











