OpenAI 首席科学家 Jakub Pachocki:澄清前沿模型计算图深度,直面思维链监控的脆弱性
OpenAI 首席科学家 Jakub 澄清前沿模型计算图深度未剧增,并指出思维链监控面临脆弱性挑战。
AI 深度解读
2026年9月2日,OpenAI 首席科学家 Jakub Pachocki 发文澄清前沿模型计算图深度,并深入阐述思维链监控的技术价值与当前面临的脆弱性挑战。
- 计算尺度上,指出包括 Astra 在内的当前前沿模型,计算图深度与 GPT-4 的差距在 2 倍以内,驳斥了关于模型深度出现极端扩张的误传。
- 监控价值上,强调团队自早期推理模型起便使用思维链(CoT)监控,以直接观察模型对齐特性如何从训练分布向外泛化。
- 安全困境上,指出思维链监控机制目前处于脆弱状态且有弱化趋势,该现象并非由模型架构改变引起,团队正积极探索针对性强化方法。
- 影响/看点:思维链可解释性被视为前沿推理模型安全对齐的关键支柱,若监控技术无法突破脆弱性瓶颈,可能限制更长思维链推理模型在关键任务中的信任度。
- 资料依据:
- X:Jakub Pachocki(2026-09-02):https://x.com/merettm/status/2095023204993490967
本内容由 AI 生成,仅供参考,请注意甄别