苹果机器学习团队新研究:大模型概率置信度更新缺乏贝叶斯一致性
苹果研究团队量化分析了大模型根据新证据更新置信度的偏差,发现其概率更新普遍缺乏贝叶斯一致性。
AI 深度解读
苹果机器学习团队新研究发布题为“LLMs Are Not (Consistently) Bayesian”的论文,系统考察大语言模型在证据更新下概率信念是否遵循贝叶斯法则,这项问题关系到模型在医学、法律等高风险领域的可靠性。
- 该研究将LLM视为信息处理规则,用“信息处理差距”量化实际概率更新与贝叶斯更新的偏差,从而把哲学层面的不确定性争论转化为可计算的度量。
- 实验覆盖了多种主流LLM,结果显示其置信度更新与贝叶斯最优更新不一致,且存在内部矛盾,比如同一证据以不同措辞呈现时,模型给出的置信度变化幅度相异。
- 这提示模型可能无法稳定地吸收证据强度,可能表现为过度自信或更新不足,进而在需要累计判断的任务中出现系统性偏差。
- 研究提供了一种可复用的诊断方法,使开发者能够对比不同模型的概率推理一致性,也为未来通过训练或解码层面改进校准提供了可能。
- 影响/看点:这一发现可能推动LLM不确定性研究的基准化,但具体影响仍需在更多真实任务中进一步验证,尤其需要与其他校准方法的效果做对照。
本内容由 AI 生成,仅供参考,请注意甄别