SolveEdit:生成模型目标驱动视觉问题求解能力评测基准
论文提出基准SolveEdit,用于评估生成模型根据目标推断场景变换并精准执行视觉问题求解的能力。
AI 深度解读
研究团队推出用于评测生成模型目标驱动视觉问题求解能力的基准 SolveEdit,填补了现有评测主要集中于感知、生成或显式变换指令而忽视目标驱动场景变换的空白。
- SolveEdit 包含 2728 个测试案例,要求模型在给定图像与目标时推断有效变换并在保留无关内容的前提下完成执行。
- 评测引入基于原子转移契约的 SolveScore 指标,在无需单一参考标准输出的情况下量化任务完成度与非预期改动。
- 现有模型在该基准上的表现普遍受限,评测中最强模型的 SolveScore 仅为 57.0%。
- 研究提出的两阶段视觉规划器 SolveEdit-Plan 在未修改底层编辑模型的情况下,将 GPT-Image-2 的 SolveScore 从 57.0% 提升至 71.6%,3 个测试生成器平均提升 9.1 分。
- 影响/看点:该基准揭示了当前图像生成模型在空间逻辑推理与非破坏性编辑上的能力短板,两阶段规划范式可能成为增强生成式物理与逻辑任务求解的重要方向。
- 资料依据:
- arXiv(2026-09-28):https://arxiv.org/abs/2609.35504
- Hugging Face(2026-09-28):https://huggingface.co/papers/2609.35504
本内容由 AI 生成,仅供参考,请注意甄别