OpenAI 推出 MentalHealthBench:用于评估 AI 心理健康对话安全性的新基准
OpenAI 推出由专家参与构建的 MentalHealthBench 基准,用于评估 AI 在真实心理健康对话场景中的安全性和有效性。
AI 深度解读
OpenAI 于 2026 年 9 月 23 日发布开源评估基准 MentalHealthBench,旨在量化评估大语言模型在心理健康对话中的安全性与专业指导一致性。
- 基准由来自 22 个国家的 80 多位持证心理健康专家协同构建,覆盖多样化文化背景与现实对话场景。
- 评估维度从传统的单一紧急危机避险扩展至上下文探寻、用户自主权维护和行动指引合理性等细分指标。
- 明确 AI 不能替代专业治疗,重点考察模型在提供共情支持的同时引导用户寻求现实专业援助的能力。
- 影响/看点:该基准的开源可能促进行业对心理健康对话场景的安全评估标准化,但其实际指导意义依赖于各评估机构对多文化专家标准的主观一致性把控。
- 资料依据:
- OpenAI(2026-09-23):https://openai.com/index/introducing-mentalhealthbench
本内容由 AI 生成,仅供参考,请注意甄别