VoiceMem 论文:面向实时语音交互的“左右脑”流式双记忆架构

📡 HuggingFace Daily Papers2026-08-26 08:00

研究团队提出 VoiceMem 架构,通过信息与情感“左右脑”双记忆设计,提升实时语音模型的交互记忆能力。

AI 深度解读

2026 年 8 月,南洋理工大学、清华大学等多家机构研究人员在 arXiv 发布预印本论文,提出面向双工语音语言模型的左右脑流式双记忆架构 VoiceMem,以解决实时语音交互中记忆准确度与情感个性化不足的问题。

  • 采用“左脑”处理事实信息、“右脑”处理情感与人设的双轨并行设计,并配套流式输入输出机制,构建了从训练、长程评估到解耦部署的完整流水线。
  • 实验数据显示,在 Top-5 检索条件下,其事实检索模块相比 Mem0 系统在 Top-200 条件下的表现高出近 30 个百分点。
  • 情感右脑通过长短期情感归因与双节点人设建模,在 3 项人设基准测试中相比既往系统综合评分提升 4.29 分。
  • 端到端检索耗时降至 134 毫秒,处于标准语音活动检测(VAD)延迟窗口内,未给实时对话引入额外等待延迟。
  • 影响/看点:该架构将知识事实与情感状态解耦管理,有助于改善语音智能体的多轮交互体验,其实际效果取决于长周期多轮对话下内存占用开销与流式状态同步的稳定性。
  • 资料依据:
  • 1. arXiv 预印本论文(2026年8月):https://arxiv.org/abs/2608.26005

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手