HazardAuditor:针对 Computer-Use 智能体运行时安全防御的执行评估框架
为应对电脑操作智能体的运行时安全风险,研究团队开发出HazardAuditor框架,通过标准化执行事件评估多架构智能体的安全性。
AI 深度解读
研究人员提出了针对计算机使用智能体(Computer-Use Agent)运行时安全防御的执行评估框架 HazardAuditor,重点解决智能体在浏览器、终端和文件系统等动态交互中的运行时行为风险。
- 现有安全护栏主要针对静态提示词与文本响应,难以覆盖多步骤执行行为,且既有测试平台多输出裁决结果而非跨框架监督信号。
- HazardAuditor 在受控环境中运行 Claude Code、Codex、Hermes 与 OpenClaw 等异构智能体,将各类交互行为归一化为标准事件表示,提供跨架构监督数据。
- 针对生成式护栏在 Token 级后训练中梯度易被长推理过程主导的失配问题,提出 GuardPO 算法,将确定性安全结果转化为序列级优势并规范推理与裁决区域。
- 测试数据显示,在多个评测基准与异构系统上,该框架相较于既有基线模型将安全检测准确率提升最高达 16.5 个百分点。
- 影响/看点:该框架将智能体防护粒度从文本过滤延伸至系统操作事件流,可能为桌面与终端自动化工具提供跨平台的统一防御方案,其实际防护效果取决于跨操作系统事件解析的完整度与实时拦截延迟。
- 资料依据:
- arXiv(2026-09-14):https://arxiv.org/abs/2609.15134
- GitHub(2026-09-14):https://yunhao-feng.github.io/HazardAuditor/
本内容由 AI 生成,仅供参考,请注意甄别