Perplexity 开源多模态 late-interaction 嵌入模型
Perplexity开源9B和0.6B多模态嵌入模型,支持在统一空间检索文本、图像和PDF页面。
AI 深度解读
Perplexity 宣布开源 pplx-embed-v2-late 多模态嵌入模型,关注点在于文本与图像检索是否能在同一表示空间中协同完成。
- Perplexity CEO Aravind Srinivas 在 X(2026-10-07)称,该系列包含 9B 与 0.6B 两个模型,面向文本和图像的 late-interaction 检索。
- 现有信息显示,两个模型共享嵌入空间,权重通过 Hugging Face 提供;9B 更偏向索引构建,0.6B 面向查询侧部署。
- 无需先做 OCR 即检索 PDF 页面,意味着图文混排文档可以减少预处理环节,但实际效果仍取决于页面布局、图像质量与召回策略。
- MADQA 92.4%、BrowseComp+ 64% 属于模型方公布的评测结果,比较时还需要确认数据集版本、基线模型和测试流程。
- 影响/看点:如果权重、推理代码和许可条件足以支持复现,该发布可能降低多模态检索的试用门槛;其实际价值取决于跨数据集表现、推理成本和端侧硬件适配。资料依据:
- Perplexity CEO Aravind Srinivas(2026-10-07):https://x.com/AravSrinivas/status/2107871834205196784
- Perplexity GitHub 官方组织页(2026-10-07):https://github.com/perplexityai
本内容由 AI 生成,仅供参考,请注意甄别