研究发现:聊天模板可显著改变大语言模型的自指代语气

📡 Hacker News 热门2026-09-28 07:49

最新研究发现,不同的聊天模板会显著改变大语言模型在输出时的自我指代与语气风格。

AI 深度解读

arXiv 预印本平台发表的研究表明,聊天模板是大语言模型输出自我免责声明的关键开关,直接影响模型的自指代语气表达。

  • 论文针对 8 款参数规模在 9B 以内的主流开源指令模型展开测试,发现加入聊天模板会显著增强类似“我只是一个人工智能”的免责声明语气,并抑制体验式表达;去除模板后则呈现相反趋势。
  • 研究人员在 3 款模型的激活空间中成功定位到了调控该行为的特征方向,通过消除或叠加该方向向量即可直接调节免责语气的强弱。
  • 实验证实即使在未提供聊天模板的情况下,直接注入该激活方向也会让模型输出与带有模板时相同的免责表述。
  • 研究指出模型对自身的描述并非单纯来源于模型底层权重,而是受部署时的聊天模板机制调制,因而不能将其自我描述直接视作模型具有内省或自我认知的确凿证据。
  • 影响/看点:这意味着在开展 AI 模型自我认知与安全自述评估时,研究人员必须将聊天模板作为关键混淆变量进行严格控制。
  • 资料依据:
  • arXiv(2026-09-27):https://arxiv.org/abs/2609.25021
  • Hacker News(2026-09-27):https://news.ycombinator.com/item?id=49865343

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com →
AI 助手