Google 以 Apache 2.0 协议开源 EmbeddingGemma 2
Google以Apache 2.0开源EmbeddingGemma 2,可将文本、代码及多种媒体映射到统一嵌入空间。
AI 深度解读
Google 官方文档显示,EmbeddingGemma 2 已作为 7.4 亿参数的开放权重嵌入模型发布,采用 Apache 2.0 许可证,关注价值在于其试图把文本、代码、图像、音频和视频映射到统一向量空间。
- 官方称模型输出 768 维向量,并支持最长 8,192 个 token 的文本和源代码输入。
- 文档将其定位于多模态检索增强生成、语义搜索和零样本分类等本地或离线场景。
- 模型支持 128、256、512 和 768 维输出截断,官方称在质量损失较小的情况下可减少向量数据库存储成本。
- Google 同时称其文本和代码基础模型规模从上一代的 3 亿参数降至 2.7 亿参数,但该指标与完整多模态模型参数量不同,不能混用。
- 这些信息来自 Google AI for Developers 于 2026 年 10 月 6 日更新的官方文档,实际效果仍取决于语言、模态组合、索引方案和部署硬件。影响/看点:若统一向量空间在真实跨模态检索中保持稳定,开发者可能减少多套嵌入模型的维护成本,但存储节省和质量表现需要结合具体数据集验证。
- 资料依据:
- Google AI for Developers《EmbeddingGemma》文档(2026-10-06):https://ai.google.dev/gemma/docs/embeddinggemma
- Hugging Face 官方模型页《google/embeddinggemma-2》(2026-10-06):https://huggingface.co/google/embeddinggemma-2
本内容由 AI 生成,仅供参考,请注意甄别