实测 Opus 5:短任务媲美 Fable,长任务偏保守

📡 Ethan Mollick2026-07-25 01:38

Ethan Mollick实测:Opus 5短任务可比肩Fable,但长任务表现偏保守、野心不足。

AI 深度解读

Ethan Mollick 在正式发布前实测了 Opus 5,给出的评价是不错但有点古怪,短任务上能打平甚至超过 Fable,但长任务上表现偏保守、缺乏野心,交不出完整成果,为 Opus 5 的实际能力画像提供了一手参考。

  • 评测者是长期跟踪各家前沿模型的 Ethan Mollick,其抢先体验评价通常被视为除官方跑分外较可信的一手信息来源。
  • 核心结论是能力表现分裂:短任务(边界清晰、单次交付的任务)上 Opus 5 可以匹配甚至超越 Fable,说明其基础理解和执行能力已经到位。
  • 但在长任务(需要多步骤规划、持续输出、自主推进)上,Opus 5 显得不够有野心,倾向于中途收敛或简化任务,无法像预期那样交付完整的工作成果,这与短任务的优秀表现形成反差。
  • 古怪这一措辞暗示 Opus 5 并非单纯的更强或更弱,而是在某些方面有独特甚至不太可预测的行为模式,这与其他评测中提到的新颖解题行为相互印证。
  • 推文附带了 Opus 5 生成的新哥特风格着色器演示作为佐证,说明其在创意生成类任务上至少具备一定的视觉表现力,但这只是个案展示,不能代表整体代码生成质量。
  • 看点:短任务强、长任务弱的特征如果被更多用户验证,意味着 Opus 5 更适合用作高频短交互助手,而非长程自主任务执行者,这对企业选型和 Agent 类产品的模型选择会有直接参考价值。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com