探索导向的 Prompt 脚手架:多模态大模型强化学习后训练新方法
针对多模态强化学习后训练中提示词效用不均的问题,研究者提出探索导向脚手架方法,动态调整高探索潜力的提示词分布。
AI 深度解读
研究团队于2026年9月14日在arXiv发表论文,提出面向多模态大模型强化学习后训练的探索导向Prompt脚手架框架。
- 针对现有在线强化学习中饱和Prompt与极难Prompt无效占用采样预算的问题,论文提出探索潜力评分指标评估样本信息量。
- 该评分基于KL正则化策略改进理论推导,可直接通过策略采样统计计算,无需引入额外的计算开销。
- 系统利用教师模型对低效Prompt进行语义保真的脚手架式改写,将教师监督转化为高质量训练数据重构。
- 结合GRPO算法在Geo3K与MMK12等数据集上训练,模型在域内任务提升达9.7%,在MathVision和MMMU-Pro等域外评测中分别取得超11%的提升。
- 影响/看点:该方法通过动态重塑强化学习训练分布提高了后训练采样效率,但改写效果在复杂多模态长文本场景中对教师模型的重构能力存在依赖。
- 资料依据:
- arXiv(2026-09-14):https://arxiv.org/abs/2609.15051
- Hugging Face(2026-09-14):https://huggingface.co/papers/2609.15051
本内容由 AI 生成,仅供参考,请注意甄别