Google 发布 EmbeddingGemma 2,开源原生多模态嵌入模型

📡 Philipp Schmid(Google DeepMind 开发者体验)2026-10-07 02:33

Google开源EmbeddingGemma 2,将文本、代码、图像、音频和视频映射到同一向量空间。

AI 深度解读

Google开发者体验负责人 Philipp Schmid 于2026年10月6日宣布 EmbeddingGemma 2,称其基于 Gemma 4、采用 Apache 2.0 许可证,并支持文本、代码、图像、音频和视频的统一嵌入,关注价值在于多模态检索与本地部署的组合可能扩大嵌入模型的使用场景。

  • Hugging Face 模型页列出 omni、text+vision、text+audio 和 text-only 等不同版本。
  • 公告称模型覆盖100多种语言,并支持最高8192的上下文长度。
  • 模型提供768、512、256和128维的 Matryoshka 嵌入配置,可在精度与存储开销之间取舍。
  • 公告提到已接入 Sentence Transformers 和 LiteRT-LM,但未在该条目中给出完整基准表。
  • 影响/看点:若跨模态表示在实际检索任务中保持足够一致性,开发者可能减少为不同媒体单独维护向量模型的需要;效果仍取决于领域数据、语言覆盖和部署设备性能。
  • 资料依据:
  • Hugging Face(2026-10-06):google/embeddinggemma-2 模型页 https://huggingface.co/google/embeddinggemma-2
  • Philipp Schmid(2026-10-06):EmbeddingGemma 2 发布说明 https://x.com/_philschmid/status/2107539841101758856

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com →
AI 助手