Gander 技术报告:统一全模态感知、实时全双工交互与智能体能力的端到端模型

📡 HuggingFace Daily Papers2026-09-08 08:00

提出端到端模型Gander,采用脑小脑协作架构支持多模态流式输入,实现了可随时打断、主动反馈的实时全双工交互与智能体能力。

AI 深度解读

研究团队发布多模态交互智能体 Gander 技术报告, 提出将全模态流式感知、实时全双工交互与复杂任务规划统一在端到端架构中的新方案。

  • 双系统协同架构:采用 “小脑—大脑”(Cerebellum-Brain)分工体系, 小脑负责流式多模态实时交互与对话, 大脑负责复杂逻辑推理与智能体工具调度。
  • 流式分块交互机制:小脑基于流式 Thinker-Talker 结构, 将音视频与文本等流式输入和输出按分块级别展平成有序 Token 流, 实现低延迟全双工交互。
  • 支持实时打断与主动反馈:打破传统回合制对话模式, 允许用户随时打断, 模型亦能在执行工作流过程中主动提问或给予中间反馈。
  • 复杂真实场景鲁棒性:在背景噪音、多人对话场景以及边听边确认等交互测试中保持稳定, 并同步开源了模型权重、代码与数据集。
  • 影响/看点:该架构可能推动多模态语音助手向能够一边倾听、一边执行多步骤外部任务的自主实体演进, 实际落地效果取决于高并发流式处理下的计算成本与协同延迟。
  • 资料依据:
  • arXiv 预印本平台(2026-09-08):https://arxiv.org/abs/2609.08977
  • Hugging Face 论文精选(2026-09-08):https://huggingface.co/papers/2609.08977

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手