tradingkey.logo
搜索

模型发布 | 谷歌发布Gemini 3.8 Live双模型,强化实时语音AI

老虎资讯2026年9月16日 02:00
facebooktwitterlinkedin

谷歌周二推出两款新模型Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking,重点提升语音对话中的推理能力。

谷歌表示,Gemini 3.8 Live主要面向需要大规模使用的场景,在对话能力、响应速度和视觉理解方面进行了优化。Extended Thinking版本则针对更复杂的任务,可以进行多步骤推理。

两款模型都支持实时处理视觉信息。Gemini 3.8 Live支持97种语言,并可以在对话过程中自动切换语言。用户提出请求后,模型还可以在后台调用工具和API,同时继续与用户交流,不必等任务完成后再继续对话。

对于需要更多计算的任务,Gemini 3.8 Live Extended Thinking可以一边进行推理,一边与用户交流。谷歌表示,模型在执行较复杂的后台任务时,会通过语音告知用户当前进展。

在Artificial Analysis的Speech to Speech Quality Index测试中,Gemini 3.8 Live Extended Thinking得分82.6分,排名第一;该模型在Big Bench Audio测试中的得分为97.7%。Gemini 3.8 Live在Speech Agent Arena中排名第二。

在功能方面,Gemini 3.8 Live可以近实时处理视觉输入,为语音交流提供更多上下文。该模型支持97种语言,并能够在对话过程中自动切换语言。

新模型还可以在后台执行工具和API调用,同时继续与用户对话。例如,用户提出请求后,模型可以先进行回应,在后台完成任务,而不必让用户等待整个过程结束。

对于需要更复杂推理的任务,Gemini 3.8 Live Extended Thinking可以在思考的同时继续进行语音交流。谷歌表示,该模型能够通过“让我查一下”等语音提示回应用户,并在执行多步骤后台任务时实时播报进展。

谷歌表示,两款模型已开始陆续开放。开发者可以通过Gemini API和Google AI Studio使用,企业客户可以在Gemini Enterprise中进行预览。此外,Gemini 3.8 Live已开始在Google Search Live中推出,Extended Thinking版本也开始向Gemini Live用户开放。

谷歌还表示,其AI产品生成的音频均加入SynthID水印,以便识别AI生成内容。

免责声明:本网站提供的信息仅供教育和参考之用,不应视为财务或投资建议。

推荐文章

tradingkey.logo
风险提示:我们的网站和移动应用程序仅提供关于某些投资产品的一般信息。Finsights 不提供财务建议或对任何投资产品的推荐,且提供此类信息不应被解释为 Finsights 提供财务建议或推荐。
投资产品存在重大投资风险,包括可能损失投资的本金,且可能并不适合所有人。投资产品的过去表现并不代表其未来表现。
Finsights 可能允许第三方广告商或关联公司在我们的网站或移动应用程序的任何部分放置或投放广告,并可能根据您与广告的互动情况获得报酬。
© 版权所有: FINSIGHTS MEDIA PTE. LTD. 版权所有