EmbeddingGemma 2发布:740M参数统一五模态,开源端侧嵌入模型进入新阶段

2026年10月6日,Google DeepMind发布EmbeddingGemma 2,这是首个原生多模态端侧开源嵌入模型,仅7.4亿参数即可将文本、代码、图像、视频帧与音频统一映射至同一768维向量空间。模型采用Apache 2.0许可证,全模态配置在Pixel 11 Pro上仅需约567MB内存,文本模

2026年10月6日,Google DeepMind发布EmbeddingGemma 2,这是该公司第一个原生多模态开源嵌入模型,专为端侧本地运行设计。模型共7.4亿参数,将文本、代码、图像、视频帧与音频五种模态统一映射至同一个768维向量空间,采用Apache 2.0许可证公开发布,即日起可在Hugging Face和Kaggle下载使用。

EmbeddingGemma 2基于Gemma 4底座构建,采用独立的模块化编码器结构。七亿参数的总量由三个独立部分组成:2.7亿参数的文本模型(含1.3亿参数Transformer主干与1.4亿参数嵌入层)、1.7亿参数的视觉编码器、以及3亿参数的音频编码器。三个编码器各自独立,但共享同一个768维输出空间。

实际部署时,开发者可以只加载自己需要的部分:纯文本和代码场景只需加载2.7亿参数,文本加视觉需要4.4亿,文本加音频需要5.7亿,全模态才是完整的7.4亿。在Google Pixel 11 Pro上,文本模式仅需约191MB活跃内存,全模态配置约567MB。

这种设计把此前需串联图像描述模型、语音转文本模型和文本嵌入模型三条独立管线的流程,压缩成一个共享向量空间,开发者只需调用一个模型,查询与内容直接在同一空间中比较余弦相似度。

一个8192 token窗口能装下多少内容

模型的上下文窗口为8192 token,是第一代EmbeddingGemma的四倍。不同模态的token消耗率有明确的固定比率:每张图像消耗280 token,每个视频帧消耗140 token,每秒音频消耗25 token。按这个换算,单次输入最多可以容纳29张图像、58个视频帧,或5.5分钟的音频。输入可以交叉混合:文本加图像加音频同时存在,图像位置用占位符标记。

上下文容量的扩大,使“用语音备忘录检索一段特定视频片段”这类操作可以在单次推理中完成,而不需要拆成多步。

被低估的零样本路由能力

EmbeddingGemma 2可以直接把用户输入和分类标签、描述进行匹配,不需要任何训练数据或微调,在毫秒级延迟内完成零样本意图路由。这使其可以充当超低延迟的端侧决策引擎,判断用户输入属于哪个意图类别,然后触发对应的本地工作流,全程不经过云端。

基准数字:胜在哪里,弱在哪里

据Google官方模型卡数据,EmbeddingGemma 2在代码检索上的MTEB Code评分从第一代的68.76提升至78.68,涨幅9.92分。多语言文本上,MTEB多语言v2得分61.36,持平第一代水平。其余各模态评分:MIEB lite 64.64、MMEB v2图像检索57.28、视觉文档检索67.84、视频检索50.67、MSEB音效检索69.54、MAEB音频任务49.39。

该模型在参数量10亿以下的多模态嵌入器中达到领先水平,并在部分专项任务上超越了规模超过其两倍的专用模型。横向看竞品,阿里的Qwen3-VL-Embedding-8B在MMEB-V2上达到77.8分,但参数量约80亿,是EmbeddingGemma 2的11倍。

视频检索50.67分是目前各项评测中最低的一项,音频两项得分分布较宽(MSEB 69.54对MAEB 49.39),不同音频任务类型的表现存在差距。

前代产品的2000万下载基数

2025年发布的第一代EmbeddingGemma已超过2000万次下载,主要使用场景集中在端侧搜索工具和注重隐私的检索增强生成(RAG)管线。第一代只支持文本嵌入。此次升级到多模态,是在已验证过市场需求的下载基数上进行扩展。

EmbeddingGemma在端侧文本嵌入领域已经建立了一定的开发者惯性,EmbeddingGemma 2直接在同一个检查点里提供多模态能力,不改变接口习惯,降低了迁移成本。

接下来的几周:ML Kit与NPU加速

Google AI Edge团队披露,未来数周内将通过ML Kit将EmbeddingGemma 2作为服务提供给安卓开发者,并启用NPU加速,覆盖更广泛的设备型号。NPU加速意味着推理功耗和延迟将进一步下降,对电池容量有限的手机设备尤其重要。

ML Kit是安卓开发者最常用的机器学习集成框架之一,不需要开发者手动管理模型部署。一旦EmbeddingGemma 2以ML Kit服务形式落地,目标受众将从机器学习工程师扩展到更广泛的安卓应用开发者群体。

判断

EmbeddingGemma 2解决的核心问题,是让端侧多模态检索从工程上变得可行。此前要在手机上实现文图音频的联合本地搜索,需要维护多个模型、协调多条推理管线,开发复杂度远超大多数应用团队的承受范围。EmbeddingGemma 2把这个复杂度压缩成了一个567MB的模型文件和一个Apache 2.0许可证。

EmbeddingGemma 1的2000万下载量表明端侧嵌入需求真实存在。EmbeddingGemma 2把这个需求从文本延伸到了五种模态。视频检索评分偏低和音频任务表现不均,提示这个统一向量空间在处理时序密集型内容时仍有代价。