EvolvingAvatar:随对话动态自适应的交互式 3D 头像生成
论文提出交互式3D头像生成模型EvolvingAvatar,通过测试时自监督训练,根据实时视音频上下文动态调整面部与语音动作。
AI 深度解读
研究人员提出因果式交互 3D 头像生成框架 EvolvingAvatar,通过测试时训练机制让虚拟形象能够在对话过程中动态自适应用户的视听特征。
- 传统 3D 头像生成模型在交互中保持参数固定,无法利用对话展开过程中的动态模式作为持续学习信号。
- EvolvingAvatar 设计了二元上下文预测目标,利用交互过程中的用户面部视频和对话音频进行自监督测试时训练(TTT),无需目标动作真值标签。
- 框架利用持久性快重(fast weights)在对话内累积更新以引导全局动作生成,并结合瞬时下颌自适应响应当前视听上下文。
- 研究构建了 455.95 小时的对话视频基准 InterHead-Bench,实验显示在分布外测试中,随着对话进行,模型与用户真实表达统计的偏差相比初始阶段减少了最多 11.1%。
- 影响/看点:该技术意味着实时虚拟化身能够展现更高自然度与交互共鸣感,其实际落地取决于端侧实时运行测试时自适应更新的算力开销控制。
- 资料依据:
- arXiv(2026-09-28):https://arxiv.org/abs/2609.35616
- Hugging Face(2026-09-28):https://huggingface.co/papers/2609.35616
本内容由 AI 生成,仅供参考,请注意甄别