腾讯发布 WorkBuddy Bench:多领域编程智能体基准
腾讯发布多领域编程智能体基准WorkBuddy Bench,任务改写自真实提交/PR以防止被搜索命中。
AI 深度解读
腾讯发布多领域编程智能体评测基准WorkBuddy Bench,覆盖代码、网页、办公、安全四大工作域,核心卖点是“抗污染”的任务构造方式——每道题都从真实commit、PR或业务场景反向改写成口语化角色扮演提问,原始素材无法被网页搜索直接命中。
- 覆盖Code、Web、Office、Security四个工作域,力求贴近真实工作场景,而非直接搬运公开Issue文本
- 任务由真实commit、PR、业务场景逆向改写而成,来源不可通过网页搜索还原,以此对抗数据污染
- 完整开源任务目录、环境镜像、评测harness、测试用例与参考答案,做到可复现、可第三方审计
- 已在CodeBuddy Code和Claude Code两套Agent框架上跑通统一评测协议,给出跨模型排行榜
- 各子集打分方式不同,不做跨子集综合平均,避免制造虚假的可比性
- 为编程Agent评测提供了一套更注重防污染和可复现性的新标尺,也顺带展示了腾讯自家CodeBuddy在同类基准上的对齐进展。
本内容由 AI 生成,仅供参考,请注意甄别