谷歌发布三款Gemini模型 3.6 Flash成主力但3.5 Pro仍推迟

谷歌于2026年7月21日发布Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber三款模型,聚焦AI代理的效率、延迟与成本控制。Gemini 3.6 Flash输出Token平均减少17%,Gemini 3.5 Flash-Lite输出速度达每秒350个Token,Gemini 3.5 Flash Cyber针对网络安全优化。同

2026年7月21日,谷歌发布Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber三款模型,Gemini 3.6 Flash成为新主力,Gemini 3.5 Pro发布时间仍未确定。

事实还原

谷歌DeepMind于2026年7月21日推出上述三款模型,Gemini 3.6 Flash基于Gemini 3.5 Flash反馈优化,编程、知识处理和多模态能力提升,Artificial Analysis Index测试显示输出Token平均减少17%。价格调整为每百万输入Token 1.5美元、输出Token 7.5美元。Gemini 3.5 Flash-Lite定位低延迟高吞吐场景,输出速度达每秒350个Token,价格降至每百万输入Token 0.3美元、输出Token 2.5美元。Gemini 3.5 Flash Cyber针对漏洞发现、验证和自动修复微调,初期通过CodeMender平台向政府及可信伙伴开放试点。

机制拆解

此次发布围绕生产级AI代理的实际运行需求展开。开发者构建大规模Agent工作流时,Token消耗、响应延迟和工具调用次数直接决定成本。Gemini 3.6 Flash通过减少无效代码修改和重复执行循环,降低整体推理步骤。Gemini 3.5 Flash-Lite支持不同思考深度配置,开发者可在低延迟与复杂推理间权衡,并内置Computer Use能力,支持跨浏览器、移动端和桌面执行任务。Gemini 3.5 Flash Cyber则在CBRN及网络攻击领域强化安全防护,降低越狱攻击风险,同时减少对正常场景的误拒绝。

产业影响

对竞争格局而言,谷歌通过Flash系列模型填补高性能与低成本之间的空白,迫使其他厂商在Agent效率指标上跟进。对开发者而言,Gemini 3.6 Flash和Gemini 3.5 Flash-Lite已上线Gemini API、Google AI Studio和Android Studio,可直接调用构建生产级应用。对企业用户而言,Gemini Enterprise Agent Platform开放接入,文档处理、搜索和代码维护场景的调用成本下降。对上下游硬件与云服务商而言,低Token消耗模型可能减少对高端GPU的依赖,但网络安全专用模型可能增加对可信计算环境的采购。

对照与先例

与此前围绕模型能力上限的竞争不同,此次更新更强调运行效率。Gemini 3.5 Flash-Lite在部分Agent和编程评测中超过Gemini 3 Flash,显示轻量模型在特定场景已具备替代潜力。Gemini 3.5 Pro原计划6月推出,因内部测试未达目标尤其是代码生成能力不足而推迟,目前仍在合作伙伴测试阶段。

战略判断

谷歌已启动Gemini 4迄今规模最大的预训练工作,下一阶段最可能出现Gemini 3.5 Pro正式发布与Gemini 4早期基准对比。