Lucida:解析、生成并布局可组合的真实到仿真场景
提出从真实室内观测解析、生成并放置可编辑物体资产的方法,构建可用于仿真的场景。
AI 深度解读
研究团队提出了名为 Lucida 的可组合场景建模框架,旨在将真实室内视频解析为可独立编辑和操控的仿真就绪 3D 资产,以降低具身智能与机器人仿真的环境构建门槛。
- 传统真实到仿真(Real-to-Sim)流程在解析、资产生成与回放摆放三个阶段对杂乱环境输入的几何精度和无遮挡视角要求过高,容易在初始阶段引入误差累积。
- Lucida 重新分配各环节精度要求,先将视频解析为携带实例级多视角证据的场景图,再据此生成完整物体资产,使高精度对齐推迟至流程末端实现。
- 框架集成了基于视觉语言模型(VLM)的 GizmoAct 策略,将资产摆放建模为多轮图形界面(GUI)交互,通过闭环操控 3D 控件自主判断并完成空间对齐。
- 实验数据显示,Lucida 在 R2S-Scene 数据集上的 3D 物体检测平均精度均值(mAP)较 Boxer 提升 69%,在 CA-1M 上的 ADD-SB@0.05 指标达到 83.4%,场景 F-Score 达 0.924。
- 影响/看点:该方法若能推广至更复杂的动态光照与非刚体场景,可能为具身智能训练提供低成本、高保真的数字化孪生环境生成能力。
- 资料依据:
- arXiv(2026-08-31):https://arxiv.org/abs/2608.30821
- Hugging Face Daily Papers(2026-08-31):https://huggingface.co/papers/2608.30821
本内容由 AI 生成,仅供参考,请注意甄别