谷歌Gemini 3.8 Live发布:质量评测登顶,用户偏好仍被老款压制

2026年9月15日,谷歌发布Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking两款实时语音模型,并于9月17日向开发者推送API访问。Extended Thinking版在Artificial Analysis语音对语音质量指数中以82.6%得分夺冠,τ-Voice智能体任务完成率68.6%,Big Bench Audio推理得分97.7%。然而据

2026年9月15日,谷歌正式发布Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking,定位为迄今最先进的实时对话模型,并于两天后开放API推送。据Artificial Analysis语音对语音质量指数,Extended Thinking版以82.6%得分排名全球第一;在τ-Voice智能体任务完成率基准中达68.6%,在Sierra的τ-Voice-banking金融场景基准中达35.1%,Big Bench Audio推理测试得分97.7%。这是谷歌首次将实时推理能力与语音对话合并进同一模型,两款产品通过Gemini API和Google AI Studio向开发者开放。

两款模型的技术分工

谷歌此次并非推出单一产品,而是按场景分拆:Gemini 3.8 Live面向规模部署与成本效率,定位高并发场景的主力引擎;Extended Thinking版针对高复杂度任务,配备更强的多步推理能力。谷歌官方博客将两款模型的定位描述为“一款给开发者和企业提供可靠、生产就绪的语音代理基础,另一款让对话更流畅、协作更直观”。

Extended Thinking版最关键的突破在于“推理与发言同步”。在需要多步后台处理的任务中,模型不会陷入沉默,而是通过“让我确认一下……”这类自然语言提示告知用户当前进度,同时在后台持续推演逻辑。谷歌官方博客将此描述为“不以牺牲对话流畅度为代价的实时讲解多步后台任务进度”。

基础版Gemini 3.8 Live的亮点侧重广度:支持近实时视觉输入,可在对话中自动检测并切换97种支持的语言,同时在后台执行工具与API调用且不中断对话。

谷歌还为所有AI生成音频嵌入了SynthID隐形水印,直接写入音频输出,可供后续检测AI生成内容。

基准测试数字的多面性

谷歌选择以Artificial Analysis的得分作为主打宣传数据:82.6%的语音对语音质量指数位居当前榜首,且Artificial Analysis是独立第三方评测机构。τ-Voice 68.6%和Big Bench Audio 97.7%的推理得分构成一套完整的强项组合。

在Speech Agent Arena的真实用户偏好Elo排行中,Gemini 3.8 Live以1083积分位居第二,第一名是Gemini 3.1 Flash Live(1096积分)。在真人对话评测中,上一代模型的老款版本仍然压过了新品。OpenAI的GPT-Live-1(Sol低配版)以1053积分位列第三。

用户偏好Arena通常综合反映语音自然度、响应节奏、对话连贯性等感知维度,这些维度与推理准确率之间并不存在线性关系。新模型在推理任务上更强,但若语音韵律或打断处理不够自然,用户体验得分就会相应打折。这说明谷歌目前优先优化了“更聪明”而非“更像人”,两者是可分离的工程方向。

在任务成功率维度,Grok Voice Think Fast 2.0 High以94.6%居首,Gemini 3.8 Live以93.2%紧随其后。三个榜单上没有一款模型同时排名第一,当前语音AI赛道仍处于多维度分化阶段。

Sierra τ-Voice-banking 35.1%的得分专门测试金融场景的多步业务流程处理能力,是行业公认的高难度基准,35.1%并非低分,但它也意味着该场景距离全面无干预商用仍存在可见的工程化差距。谷歌将企业客户引导至“抢先体验”通道,而非立即全面开放。

开发者与企业的产业影响

对开发者而言,此次发布的实质价值在于生态接入路径的完备程度。谷歌已与Agora(声网)、Fishjam、LiveKit、Pipecat、Vercel、Vision Agents等主流开发平台完成集成,开发者可在熟悉的工具链中调用Gemini Live API,无需重建基础设施。谷歌官方同时提及Gemini 3.8 Live“保持有竞争力的定价”,但未在发布材料中公布具体数字。

在企业侧,谷歌宣布与Salesforce、Genspark、Lumeris合作推进生态建设,分别指向CRM客服自动化、智能助理平台和医疗健康场景。Salesforce的合作尤为关键——Salesforce拥有规模庞大的企业客户基础,若Gemini 3.8 Live能深度嵌入其客户服务平台,即可在不依赖独立销售动作的前提下触及海量真实业务场景。

消费者侧,谷歌构建了一条从免费到付费的完整使用梯队:所有用户可在Search Live体验基础版语音功能;Gemini Live用户可调用Extended Thinking版;Google AI Pro/Ultra订阅者可在Workspace的Docs中使用推理版;Gmail和Keep则对全体Google AI订阅者开放。

战略判断

谷歌此次发布揭示了一个明确的产品赌注:在语音AI的下一场竞争中,“并行推理”而非“更快响应”将成为差异化的核心战场。当主流语音模型的延迟都进入可接受区间之后,能否在不中断对话的前提下完成多步复杂任务,将成为企业客户选型的真正分水岭。Extended Thinking的“边想边说”机制,本质上是在为这个判断提前压注。

τ-Voice-banking 35.1%的得分能否通过后续迭代快速提升,将直接决定金融、保险等高监管行业的商用节奏;Gemini 3.1 Flash Live在用户偏好Arena中压制新款的现象能否在未来数月内逆转——如果始终无法逆转,则说明谷歌在语音感知维度存在系统性的调校问题,而非算法能力本身的差距,两者需要截然不同的修复路径。

Salesforce的集成进展是另一个节点。如果这一合作在2026年底前实现规模化部署,将是语音AI进入传统企业软件主流渠道的标志性事件,其示范效应将远大于任何单一技术基准分数的提升。