OneSearch-VL:统一的图像与视频多模态深度研究智能体

📡 HuggingFace Daily Papers2026-10-08 08:00

OneSearch-VL以视觉证据图统一处理图像和视频深度研究,并配套构建训练数据与评测流程。

AI 深度解读

论文《OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video》于2026-10-08提交至arXiv,提出统一处理图像与视频深度研究任务的多模态智能体,关注价值在于把视觉定位、外部检索和事实组合纳入同一证据链。

  • 系统以视觉支撑证据图VGEG表示视觉锚点、实体关系、来源事实与答案操作之间的依赖。
  • 基于VGEG构建并验证多图像、视频问题,形成用于监督训练的数据集OneSearch-VL-SFT-110K和OneSearch-VL-RL-10K。
  • 作者提出证据感知视觉支撑评分,用于强化学习阶段监督证据可追溯性和视觉定位。
  • 论文新建多图像和视频基准,并报告OneSearch-VL-8B相较带工具的Qwen3-VL-8B分别提升20.2和17.6个百分点。
  • 影响/看点:证据图与操作级评测可能改善多模态研究中的引用对应和视觉定位;但提升来自作者设计的数据、奖励和基准,能否代表开放网络中的事实核验能力,还取决于跨领域、噪声来源和未见视频上的测试。资料依据:
  • arXiv论文(2026-10-08):https://arxiv.org/abs/2610.12419
  • OneSearch-VL官方GitHub仓库(2026-10-08):https://github.com/appletea233/OneSearch-VL

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com →
AI 助手