Artificial Analysis 代码智能体指数新增安全拒答分析报告
Artificial Analysis 代码智能体指数新增安全拒答报告,用于追踪并解释不同模型的拒答与回退行为。
AI 深度解读
评测机构 Artificial Analysis 在其 Coding Agent Index v1.5 指数中新增了安全拒答报告,用于解释模型因安全触发导致的得分差异与行为波动。
- 当模型或接口服务商因安全策略拒绝执行某项编程任务时,智能体可能调用备用模型继续执行,或直接中断评测流程。
- 评测数据显示,Claude Fable 5.1 在 Claude Code 与 Devin Fusion 两个运行环境中出现最高的回退率,回退尝试分别占指数权重的 8.8% 与 7.1%,因此最终得分综合了备用模型的实际表现。
- 报告指出,安全拒答率的差异受到各服务商安全对齐严格程度、上下文历史累积、推理努力设置以及重试机制等多重变量影响。
- 影响/看点:安全拒答维度的公开为评估代码智能体在严苛企业环境下的真实可用性提供了透明标准,意味着开发者在选型时不仅需关注基准解题率,还需综合权衡安全拦截对任务连续性的实际干扰。
- 资料依据:
- Artificial Analysis(2026-09-18):https://artificialanalysis.ai/methodology/coding-agents
- X:Artificial Analysis(2026-09-18):https://x.com/ArtificialAnlys/status/2101090586434601040
本内容由 AI 生成,仅供参考,请注意甄别