AdaGuard:支持用户自定义安全策略的自适应智能体防护模型
论文提出自适应防护模型AdaGuard与多规则数据集,通过反事实轨迹与解释,帮助系统准确识别智能体对自定义安全策略的违规。
AI 深度解读
研究团队提出了自适应智能体防护模型 AdaGuard 及强化学习算法 SafePO,旨在支持推理阶段由用户动态自定义安全规则并进行精准违规监测。
- 针对现有防护模型固化安全分类体系、无法适应多变场景规则的痛点,AdaGuard 支持在推理时直接接收 1 至 100 条自定义策略规则。
- 构建了包含 10939 条训练样本与 1000 条测试样本的 AdaptiveSafety 数据集,包含策略与行为反事实对以及结构变换增强,确保规则重排时判定的一致性。
- 提出 SafePO 强化学习算法,利用结构化奖励和独立价值模型调节解释性推理与最终裁决区域的 Token 权重平衡。
- 构建的 0.6B、4B 和 8B 模型家族中,4B 版本在 AdaptiveSafety 和 DynaBench 上的二分类准确率分别达到 89.30% 和 71.82%。
- 影响/看点:该技术为大模型智能体在多租户和定制化合规场景中的动态安全防护提供了轻量化解法,其规模化应用的前提是在处理多条复杂规则时保持高吞吐并有效防范规则冲突下的误判。
- 资料依据:
- arXiv 论文(2026-09-28):https://arxiv.org/abs/2609.34241
- GitHub 代码库(2026-09-28):https://github.com/Yunhao-Feng/AdaGuard
本内容由 AI 生成,仅供参考,请注意甄别