论文提出 PAWBench:评估视频生成模型对物理世界概率分布的模拟能力
论文提出基准PAWBench,从概率对齐角度评估视频生成模型还原物理世界多种可能轨迹与概率分布的能力。
AI 深度解读
上海交通大学与上海人工智能实验室等机构的研究团队于 2026 年 8 月发布论文,推出评测基准 PAWBench 与协议 PAWEval,首次从概率分布对齐的维度评估视频生成模型模拟物理世界动力学的真实能力。
- 核心指标定义:研究正式提出了概率对齐(probabilistic alignment)标准,指出合格的世界模型不仅要在单次生成中呈现合理的物理轨迹,还需在相同初始条件和动作下还原可能物理行为的真实概率分布。
- 评测方案与规模:引入结果层面的 PAWEval 协议,将模型多次 rollout 生成的视频转换为行为经验分布,并在 50 个物理场景下对 11 个主流视频生成系统进行了系统测试。
- 评测现状发现:实验表明当前受测模型均无法在覆盖全部有效物理行为的同时持续匹配参考概率,证明现有系统在作为随机动力学采样器时存在显著分布偏差。
- 干预路径探索:论文进一步测试了语言提示词、初始噪声采样与模型训练对预测分布的重塑效果,为构建概率对齐的世界模型确立了量化参考体系。
- 影响/看点:该研究将世界模型评测由单样本视觉合理性推向物理动力学概率分布层面,可能促使视频生成技术向物理仿真对齐演进,但其支持具身决策的前提是模型能够准确表征不确定性物理过程的真实概率规律。
- 资料依据:
- 1. arXiv 预印本论文(2026年8月):https://arxiv.org/abs/2608.27345
- 2. HuggingFace Daily Papers(2026年8月):https://huggingface.co/papers/2608.27345
本内容由 AI 生成,仅供参考,请注意甄别