
更新概览EmbeddingGemma 2 是第二代版本核心变化从纯文本嵌入扩展到多模态支持。模型参数量 740M基于 Gemma 4 架构原生处理文本、代码、图像、视频、音频映射到统一嵌入空间。上下文窗口从 2K 扩展到 8K token可处理最长 5.5 分钟音频、29 张图像、58 帧视频或这些内容的交错组合。采用模块化设计文本编码器 270M 参数视觉编码器 170M 参数音频编码器 300M 参数开发者可按需加载。输出向量维度 768通过 Matryoshka Representation LearningMRL可动态截断至 512、256 或 128 维存储空间最多减少 6 倍。量化后在 Google Pixel 11 Pro 上纯文本模型需约 191MB 活跃内存完整多模态模型需约 567MB。新能力详解在 MTEB Code 基准中代码嵌入性能从 68.76 分提升到 78.68 分提升 9.92 个百分点适合本地代码库索引、语义代码搜索和编码智能体检索。在图像、视频、文档和音频任务上该模型在小于 1B 参数的多模态嵌入模型中达到质量-参数比最高水平在 MTEB 和 MAEB 等基准上取得同规模模型领先分数部分任务超越参数量两倍以上的专用模型。与 Gemma 4 共享文本分词器和音频编码器两者同时运行时总内存占用更低。可配合 Gemma 4 构建完全在设备端运行的 RAG 管道。多模态能力支持跨模态检索用文本或图像在媒体库中查找语义相似内容用文本或音频定位视频特定时刻或基于语音备忘录查找视频片段。这些操作由单一模型处理无需多个独立编码器。怎么用与迁移模型权重已在 Hugging Face 和 Kaggle 发布设备端优化版本可在 LiteRT Community on Hugging Face 下载。开发者可使用 Google AI Edge MediaPipe 跨平台开发或使用 LiteRT 自定义集成。浏览器端可通过 transformers.js 或 WebGPU 部署。服务端支持transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 和 LMStudio。向量存储可使用 Qdrant。Unsloth 提供微调指导。迁移注意事项上下文窗口从 2K 扩展到 8K输出向量维度保持 768新增 MRL 截断选项。仅处理文本可继续使用 270M 参数文本编码器需支持多模态需加载对应模块。量化后内存占用数据基于 Google Pixel 11 Pro其他设备可能有差异。局限与注意素材未提及具体任务的绝对精度数值仅强调领先和质量-参数比最高实际应用需根据具体基准评估。模型卡包含完整评测指标建议生产部署前查阅。8K token 上下文窗口对长视频或大型文档仍有限制超出最长 5.5 分钟音频或 58 帧视频范围需分段处理。MRL 动态截断虽减少存储空间但截断后向量维度512、256、128在语义表达能力上有损失需在存储效率和检索精度间权衡。素材未说明不同截断级别对性能的具体影响。Apache 2.0 许可证商业友好但素材未明确训练数据许可限制以及能否将模型嵌入其他开源项目。设备端推理内存占用数据是量化后结果原始精度下内存需求更高且量化可能影响嵌入质量。对开发者的意义740M 参数规模和模块化设计使 EmbeddingGemma 2 成为首个实用的设备端多模态嵌入模型。本地推理消除网络延迟保护数据隐私支持离线工作。构建隐私优先 RAG 管道可在消费级硬件上完成用 EmbeddingGemma 2 索引本地文件用 Gemma 4 推理无需上传敏感数据。共享分词器和音频编码器进一步降低组合使用内存成本。代码嵌入性能提升 9.92 个百分点使本地代码库语义搜索可行IDE 插件和编程辅助工具可不依赖云服务提供智能代码检索。跨模态检索能力让媒体管理应用用自然语言查询本地照片、视频和录音或用图片找相似视频片段。广泛生态支持transformers、vLLM、llama.cpp、Ollama 等降低集成门槛。LiteRT 和 MediaPipe 的移动端和浏览器端部署方案使跨平台开发者快速整合多模态嵌入能力。从第一代 2000 万次下载看轻量级本地嵌入模型满足实际需求多模态扩展将进一步拓宽应用边界。