Harvey LAB-AA v1.1 引入幻觉门控评分指标
Artificial Analysis与Harvey更新法律智能体基准,新增幻觉检查和门控通过率指标。
AI 深度解读
Artificial Analysis 与 Harvey 宣布更新法律智能体基准 LAB-AA v1.1,新增幻觉检查并引入 Hallucination-Gated All-Pass Rate,关注价值在于法律模型评测开始把“答案是否包含重大错误陈述”纳入通过条件。
- 新规则要求回答同时满足任务正确和不含重大错误陈述,单纯覆盖更多问题不再足以保证高分。
- Hallucination-Gated All-Pass Rate 将正确性与幻觉门槛结合,反映的是严格通过率,而不是平均得分。
- 该指标可能更接近法律工作中的风险控制要求,因为一处关键错误就可能改变结论或行动建议。
- Artificial Analysis 的公开榜单同时展示模型能力、价格和速度等维度,说明评测结果需要结合成本、延迟和任务范围理解。
- 该指标仍依赖题目设计、重大错误判定标准和人工或程序化复核的一致性。
- 影响/看点:如果其他法律基准采用类似门控方法,模型比较可能从“平均表现”转向“低容错场景下的稳定通过率”;结论成立的前提是评分规则透明、样本足够且能覆盖真实法律任务。
- 资料依据:
- Artificial Analysis X 帖(2026-10-08):https://x.com/ArtificialAnlys/status/2108264572545310824
- Artificial Analysis 模型评测榜单(2026-10-09):https://artificialanalysis.ai/leaderboards/models
本内容由 AI 生成,仅供参考,请注意甄别