Perplexity 发布统一检索文本、图像与网页的嵌入模型
Perplexity发布两个共享嵌入空间的多模态模型,用于统一检索文本、图像和网页。
AI 深度解读
Perplexity发布 pplx-embed-v2-late 双模型,目标是在共享嵌入空间中检索文本、图像和网页,关注价值在于多模态检索可减少不同内容类型之间的系统割裂。
- Perplexity官方说明称,该系列采用 late-interaction 结构,包含0.6B和更大规格两个模型,并已在 Hugging Face 公开。
- 帖子展示的结果称,0.6B模型在 ViDoRe V3 公共子集上的得分为62.3,并宣称可匹配约5倍规模模型;该结果依赖特定数据集和评测设置,不能直接外推到所有检索任务。
- 共享空间意味着文本、图片和网页内容可以使用统一检索接口,但网页结构解析、图文对齐和索引成本仍会影响实际效果。
- late-interaction 通常保留更细粒度的匹配信息,可能提升相关性,同时带来更高的存储或检索计算开销。
- 影响/看点:如果公开权重、评测代码和部署成本能够支持相关结果,多模态知识库和网页检索的工程复杂度可能下降;实际价值取决于跨域数据上的稳定性、延迟和资源消耗。
- 资料依据:
- Perplexity(2026-10-07):https://www.perplexity.ai/hub/blog/multimodal-embeddings-beyond-a-single-vector
- Perplexity AI(@perplexity_ai)(2026-10-07):https://x.com/perplexity_ai/status/2107866029745746177
本内容由 AI 生成,仅供参考,请注意甄别