2026年8月26日,谷歌正式发布Gemini 3.5 Transcribe,通过Gemini API向外部开发者开放这款语音转文本模型。据谷歌官方博客引用Artificial Analysis独立测评,该模型在非流式场景下的词错率(WER)为2.6%,实时流式场景为4.0%,流式延迟在语音结束后0.4秒内输出最终结果。模型已在Google AI Studio和Gemini Enterprise Agent Platform上线,Artificial Analysis数据显示定价约为每千分钟5美元。此次发布与Gemini 3.5 Live及Gemini 3.5 Live Experimental同日推出,共同构成谷歌新的Gemini Audio产品系列,负责人为谷歌Gemini Audio工程高级总监Diego Melendo Casado。
两个端点,差异远比宣传材料揭示的更大
Gemini 3.5 Transcribe在架构上拆分为两个独立端点,服务截然不同的使用场景,而两者的能力差异在营销层面并未被充分强调。
录制音频端点(gemini-3.5-transcribe)面向离线批量处理,单次最长支持1小时音频,提供说话人识别(最多8路)和逐词时间戳功能。一旦启用说话人识别或时间戳,单次处理上限立即从1小时降至30分钟。此外,3路以上说话人的识别标注在谷歌文档中被明确标注为“实验阶段”——对于多人会议转录场景,这是一个实质性约束。
实时流式端点(gemini-3.5-transcribe-live)通过WebSocket实现双向传输,主打低延迟语音应用,但单次会话上限仅为10分钟,且不支持说话人识别和时间戳。这意味着希望同时获得实时性和说话人标注功能的开发者,在当前版本中无法通过单一端点实现。超过10分钟的连续语音场景,需要在应用层自行实现分段续连逻辑,工程复杂度随之上升。
自定义词汇功能允许输入最多1,000个领域专属术语,谷歌文档同时注明“通常建议不超过100个以获得最佳效果”。这100个词的实际建议上限,对需要覆盖大量药品名、法律术语或金融产品代码的垂直行业而言,是一道需要用户自行评估的门槛。
智能转录:从“逐字记录”到“意图理解”
Gemini 3.5 Transcribe最具差异化的能力,不在于语言覆盖数量,而在于谷歌称之为“智能转录”(Smart Transcription)的处理层。传统语音识别逐字输出,说话人自我修正、口头禅、非结构化口语原样保留;而Gemini 3.5 Transcribe在转录过程中介入了一层语义理解。
具体表现为:模型可识别说话人的自我修正(将“周二——不,周三见面”处理为最终意图而非两段并列输出);自动过滤“嗯”“啊”等填充词;将口语表达格式化为结构化文本,包括正确处理邮政编码、订单号等字母数字混合实体。这一能力已在谷歌自家产品中得到内部验证——Gboard的Android版Rambler语音输入功能和macOS版Gemini应用均已基于该模型运行。内部大规模部署是外部开发者在实验室数据之外可以参考的可信度依据。
另有一项能力目前处于受限状态:函数调用(Function Calling)可将复杂任务委托给其他Gemini模型执行(如图像生成、文件分析),谷歌文档显示该功能当前仅在Gemini macOS应用中可用,尚未向API开发者开放。
竞争格局:中档入场,非最优选
对于Deepgram、AssemblyAI等现有语音转文本初创公司,谷歌此次发布在其核心业务地带正面施压:低延迟实时流、说话人识别、自定义词汇——三项能力全部覆盖。从价格来看,据Artificial Analysis数据,AssemblyAI流式端点约合每千分钟7.5美元,Deepgram流式服务约为每千分钟7.7美元,谷歌的5美元在中端产品中具备一定竞争力。
但这场竞争的格局并不是谷歌一面倒碾压。Artificial Analysis的非流式排行榜在发布当日显示,Gemini 3.5 Transcribe以2.6%的词错率位列第五:排在它前面的ElevenLabs Scribe v2词错率为2.2%,价格为每千分钟3.67美元——精准度更高、价格更低,两个维度均领先谷歌。微软MAI-Transcribe-1.5以2.4%的词错率排名第三,虽然定价6美元高于谷歌,但精准度同样更优。
谷歌的纵向对比数据则更具说服力:据Artificial Analysis数据,与谷歌前一代Chirp 3模型相比,Gemini 3.5 Transcribe在“语音结束到最终转录输出”的耗时上压缩了70%。这一数字反映的是同一厂商内部的代际迭代幅度,对于已在使用谷歌语音服务的存量用户,升级价值明确。
精准度数字背后的使用条件
谷歌博客引用的2.6%和4.0%均来自Artificial Analysis的标准化基准测评,测评集覆盖约8小时音频,跨三个数据集加权平均。这是目前可获得的最为独立和透明的评测来源。但基准数字所代表的录音质量、语种分布和领域覆盖,与具体商业场景之间存在差距——医疗问诊的专业术语密度、客服录音中的背景噪声、多方会议中的口音交叠,均可能使实际词错率显著偏离基准。
这也是为什么谷歌的自定义词汇功能在定价层面属于基础能力包含项,而非付费附加项——领域适配能力的优劣,在真实部署中往往比通用基准数字更能决定实际体验。
谷歌的真实战略:API是入口,Chrome才是终局
从谷歌的公开动作来看,API开放并非这次发布的核心战略目标,而是其更大布局的一个组成部分。谷歌已宣布将Gemini 3.5 Transcribe引入Chrome浏览器,届时用户可在任何网页文本输入框内直接通过语音输入内容——覆盖回复消息、撰写帖子、向AI发出指令等日常场景。
Chrome在全球浏览器市场长期维持超过60%的占有率,如果语音输入在Chrome层面实现无感嵌入,改变用户输入习惯的门槛将大幅降低。对谷歌而言,这条路线的战略逻辑是:将语音从“特定应用内的功能”升级为“操作系统级的交互层”。每一次语音交互所产生的真实世界音频数据,理论上又将反哺模型的精准度迭代,形成封闭的数据飞轮。
Gemini 3.5 Transcribe与Gemini 3.5 Live的同日发布,也印证了谷歌构建完整语音基础设施的方向:前者主攻转录精准,后者主攻实时对话,两者共同覆盖“说→理解→执行”链条的不同环节。
对开发者和企业的可执行建议
以下为基于当前已知信息的实操建议:
- 快速原型验证场景:Google AI Studio提供免费额度,适合用自己的实际音频样本测试精准度,而非仅凭基准数字做选型决策。尤其建议在领域专属音频(医疗、法律、客服等)上跑对比实验。
- 实时语音应用:10分钟会话上限是当前版本的硬性约束,超时场景需要评估分段续连的工程成本,再决定是否采用实时流端点。
- 会议记录/通话分析:批量处理端点在说话人数量≤2路、无需实时输出的场景下表现最稳定;3路以上说话人需确认实验性标注是否满足业务容差。
- 已有供应商合同的企业:Artificial Analysis排行榜显示ElevenLabs Scribe v2在精准度和价格上均优于谷歌当前版本,换供应商前值得同步评测,而非默认平台溢价。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接