2026年9月1日,Google在Gemini 3.7 Flash、3.6 Flash及3.5 Flash-Lite三款模型上同步推出智能体视频理解能力,通过Gemini API在Google AI Studio和企业平台上线,标准视频分析基准上Token消耗最高下降88%,成本最高降低66%,准确率最高提升7%。
事实还原
此次更新覆盖Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite三款模型。功能支持视频上传和YouTube视频处理,开发者可通过API配置将processing设为"agentic"启用。官方基准显示,长形式视频场景下效率提升最为明显,Gemini 3.7 Flash在启用后达到准确率与成本的帕累托前沿。
机制拆解
传统静态处理以固定帧率(如默认1 FPS)摄入视频流。智能体视频理解则让模型通过内部工具循环,自主决定观看哪段内容、以何种速度扫描,以及选择画面、音频或字幕通道,仅加载必要片段。Gemini 3.7 Flash可在需要时动态调整FPS,实现亚秒级时刻检索和快速动作计数,同时避免全量Token消耗。
产业影响
对构建AI视频Agent的开发者而言,长视频处理成本大幅压缩。10分钟教程至多小时录像场景下,静态方式常迫使开发者在高成本与丢帧之间取舍,新功能则通过目标导向扫描降低开销,同时支持异常检测和物体计数等应用。早期接入伙伴已在多小时视频的复杂查询中验证了Token节省效果。
战略判断
【分析】Gemini 3.7 Flash凭借该能力在准确率-成本曲线上的位置,可能改变视频理解Agent的开发优先级。开发者可将更多预算转向模型迭代而非基础设施,但实际落地仍需结合具体任务验证长期稳定性。相比历史静态处理模式,此次更新体现了从被动摄入向主动工具调用的范式迁移。
功能已通过标准Gemini API定价开放,无额外费用。开发者可参考官方指南快速接入。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接