模型發佈 | 谷歌發佈Gemini 3.8 Live雙模型,強化實時語音AI
谷歌週二推出兩款新模型Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking,重點提升語音對話中的推理能力。
谷歌表示,Gemini 3.8 Live主要面向需要大規模使用的場景,在對話能力、響應速度和視覺理解方面進行了優化。Extended Thinking版本則針對更復雜的任務,可以進行多步驟推理。
兩款模型都支持實時處理視覺信息。Gemini 3.8 Live支持97種語言,並可以在對話過程中自動切換語言。用戶提出請求後,模型還可以在後臺調用工具和API,同時繼續與用戶交流,不必等任務完成後再繼續對話。
對於需要更多計算的任務,Gemini 3.8 Live Extended Thinking可以一邊進行推理,一邊與用戶交流。谷歌表示,模型在執行較複雜的後臺任務時,會通過語音告知用戶當前進展。
在Artificial Analysis的Speech to Speech Quality Index測試中,Gemini 3.8 Live Extended Thinking得分82.6分,排名第一;該模型在Big Bench Audio測試中的得分爲97.7%。Gemini 3.8 Live在Speech Agent Arena中排名第二。

在功能方面,Gemini 3.8 Live可以近實時處理視覺輸入,爲語音交流提供更多上下文。該模型支持97種語言,並能夠在對話過程中自動切換語言。
新模型還可以在後臺執行工具和API調用,同時繼續與用戶對話。例如,用戶提出請求後,模型可以先進行回應,在後臺完成任務,而不必讓用戶等待整個過程結束。
對於需要更復雜推理的任務,Gemini 3.8 Live Extended Thinking可以在思考的同時繼續進行語音交流。谷歌表示,該模型能夠通過“讓我查一下”等語音提示回應用戶,並在執行多步驟後臺任務時實時播報進展。

谷歌表示,兩款模型已開始陸續開放。開發者可以通過Gemini API和Google AI Studio使用,企業客戶可以在Gemini Enterprise中進行預覽。此外,Gemini 3.8 Live已開始在Google Search Live中推出,Extended Thinking版本也開始向Gemini Live用戶開放。
谷歌還表示,其AI產品生成的音頻均加入SynthID水印,以便識別AI生成內容。










