OpenAI 在發佈新的 GPT-5.5 AI 模型時展示了其智能體能力
OpenAI 於 2026 年 4 月 23 日正式發佈了 GPT-5.5,該模型專爲理解用戶在實際使用中的意圖而設計。它具備通用原生功能,能夠導航桌面應用程序、點擊按鈕以及輸入文本,從而完成多步驟工作流程。.
OpenAI團隊表示,GPT-5.5結合了原生計算機操作和高級推理能力,能夠自主操控完成高級專業任務所需的軟件工具。該模型約110萬個詞元的上下文窗口使其能夠處理以往需要人工分塊的海量金融數據集。.
OpenAI 的金融團隊使用 GPT-5.5 審覈了 24,771 份 K-1 稅表(71,637 頁),比上一年提前兩週完成了這項任務。.
GPT-5.5 在內部投資銀行建模任務中得分 88.5%,在 FinancialAgent v1.1 基準測試中得分 60%,比 GPT-5.4 高出 4 分。市場推廣團隊的一名員工證實,每週業務報告的自動化將節省大約 5-10 小時的人工工作時間。.
GPT-5.5 有助於爲其自身的服務器基礎設施編寫代碼
值得注意的是,OpenAI 表示,他們利用 GPT-5.5 來輔助編寫自身服務基礎設施的代碼。該模型通過分析生產環境的流量模式,編寫自定義的負載均衡啓發式算法,實現了“系統級優化”,並將自身令牌生成速度提升了 20%。.
在一項測試中,一位開發者要求模型“重新設計一個 Markdown 編輯器”。模型返回了一個幾乎完整的 12 級差異堆棧,僅需少量人工校正。OpenAI 指出,新模型效率更高,只需更少的迭代次數即可得出正確答案,並且在完成相同的 Codex 任務時,使用的標記數量減少了 40%。然而,其每個標記的價格是 GPT-5.4 的兩倍。
與此同時,Every 的創始人兼首席執行官 Dan Shipper 將 GPT-5.5 描述爲第一個具有“真正概念清晰性”的編碼模型。爲了測試 GPT-5.5,Shipper 和他的首席工程師在花費數天時間調試應用程序發佈後出現的問題,並重寫了部分系統代碼後,引入了 GPT-5.5。.
他表示,GPT-5.5 實現了 GPT-5.4 未能實現的目標:它分析了存在問題的代碼,並生成了工程師最終選定的重寫版本。該模型能夠“記住”並交叉引用整個信息庫而不會丟失位置,從而減少了困擾早期版本的“幻覺”現象。.
OpenAI還聲稱 GPT-5.5 針對“自我糾錯”和自主性進行了優化。它更擅長理解模糊的指令,並能利用計算機界面(點擊、輸入、瀏覽)在無需人工干預的情況下完成目標。
然而,最令人興奮的是 GPT-5.5 向智能體自主性的轉變。當需要智能體來操作軟件、管理終端密集型工作流程,或以高檢索準確率對整個代碼庫(超過 50 萬個詞元)進行推理時,該模型將變得尤爲有用。.
OpenAI 表示,“GPT-5.5 思維”能夠更快地幫助解決更復雜的問題。
在ChatGPT表示,“GPT-5.5 思維”能夠更快地幫助用戶解決更復雜的問題。該功能提供更智能、更簡潔的答案,幫助用戶更高效地完成複雜任務。它尤其擅長信息綜合與分析、編碼以及研究等需要處理大量文檔的任務,尤其是在使用插件的情況下。
與此同時,早期 GPT-5.5 Pro 測試者表示,ChatGPT 的響應質量和處理任務的難度都得到了顯著提升。其更低的延遲使其比 GPT-5.4 Pro 更適合處理高難度任務。GPT-5.5 Pro 的回覆結構清晰、切題、實用且準確。它們在法律、數據科學、商業和教育領域表現尤爲出色。
因此,GPT-5.5 在 GDPval 測試中獲得了 84.9% 的分數,該測試旨在檢驗智能體在 44 個職業領域中完成特定知識工作的能力。在 OSWorld-Verified 測試(衡量模型自主執行真實計算機操作的能力)中,該模型達到了 78.7% 的分數。此外,它在 Tau2-bench Telecom 測試中獲得了高達 98% 的分數,該測試旨在檢驗極其複雜的客戶服務工作流程。.
然而,性能的飛躍也帶來了高昂的定價。雖然有基礎版本可供選擇,但功能最強大的版本(GPT-5.5 Pro)個人用戶每月需支付 100 美元。.
另一方面,對於企業而言,即使代幣效率提高了 40%,其每個輸出代幣的成本也大約是 GPT-5.4 的兩倍。大規模智能體部署的總支出可能相當可觀。此外,人們 越來越擔心,最高級別的推理能力將成爲只有資金雄厚的公司才能負擔得起的“奢侈品”,這可能會進一步擴大大型企業和小型初創公司之間的生產力差距。
如果你正在閱讀這篇文章,你已經領先一步了。訂閱我們的新聞簡報,繼續保持領先優勢。








