OneSearch-VL:统一的图像与视频多模态深度研究智能体
OneSearch-VL以视觉证据图统一处理图像和视频深度研究,并配套构建训练数据与评测流程。
AI 深度解读
论文《OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video》于2026-10-08提交至arXiv,提出统一处理图像与视频深度研究任务的多模态智能体,关注价值在于把视觉定位、外部检索和事实组合纳入同一证据链。
- 系统以视觉支撑证据图VGEG表示视觉锚点、实体关系、来源事实与答案操作之间的依赖。
- 基于VGEG构建并验证多图像、视频问题,形成用于监督训练的数据集OneSearch-VL-SFT-110K和OneSearch-VL-RL-10K。
- 作者提出证据感知视觉支撑评分,用于强化学习阶段监督证据可追溯性和视觉定位。
- 论文新建多图像和视频基准,并报告OneSearch-VL-8B相较带工具的Qwen3-VL-8B分别提升20.2和17.6个百分点。
- 影响/看点:证据图与操作级评测可能改善多模态研究中的引用对应和视觉定位;但提升来自作者设计的数据、奖励和基准,能否代表开放网络中的事实核验能力,还取决于跨领域、噪声来源和未见视频上的测试。资料依据:
- arXiv论文(2026-10-08):https://arxiv.org/abs/2610.12419
- OneSearch-VL官方GitHub仓库(2026-10-08):https://github.com/appletea233/OneSearch-VL
本内容由 AI 生成,仅供参考,请注意甄别