Google Research 开源 Fuse 框架,专门评估大语言模型的社交意图推理能力

📡 DAIR.AI2026-09-16 22:50

Google Research 开源 Fuse 评估框架与数据集,用于评测大模型在多智能体模拟中的社交意图推理能力。

AI 深度解读

Google Research 团队发布并开源了多智能体模拟框架 Fuse 及其基准数据集,专门用于评估大语言模型在用户存在主观偏差叙述下的社交意图推理能力,弥补了社交常识评测缺乏客观基准的问题。

  • 评测机制设计:Fuse 通过多智能体模拟构建具有隐藏动机的目标智能体,并与代表用户的智能体互动,要求辅助大模型仅根据模拟用户的片面转述来推断目标智能体的真实意图。
  • 数据规模与验证:研究团队通过 2.4 万条人工标注验证了模拟中动机体现的可识别性,并开源了包含 2.1 万条测试样本的数据集与评测框架。
  • 模型评估表现:对 12 款大语言模型的测试发现,带有偏见的用户叙事会显著干扰助手的判断准确性,且延长对话历史并未能稳定提升推理准确率。
  • 影响/看点:该框架为衡量大语言模型在复杂人际交互中的社交辨析能力提供了量化标准,可能推动针对用户主观偏见具备更强鲁棒性的对话智能体研发。
  • 资料依据:
  • arXiv 论文(2026-09-16):https://arxiv.org/abs/2609.17496
  • X:DAIR.AI(2026-09-16):https://x.com/dair_ai/status/2100235768975511752

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手