腾讯发布 WorkBuddy Bench:多领域编程智能体基准

📡 HuggingFace Daily Papers2026-07-23 08:00

腾讯发布多领域编程智能体基准WorkBuddy Bench,任务改写自真实提交/PR以防止被搜索命中。

AI 深度解读

腾讯发布多领域编程智能体评测基准WorkBuddy Bench,覆盖代码、网页、办公、安全四大工作域,核心卖点是“抗污染”的任务构造方式——每道题都从真实commit、PR或业务场景反向改写成口语化角色扮演提问,原始素材无法被网页搜索直接命中。

  • 覆盖Code、Web、Office、Security四个工作域,力求贴近真实工作场景,而非直接搬运公开Issue文本
  • 任务由真实commit、PR、业务场景逆向改写而成,来源不可通过网页搜索还原,以此对抗数据污染
  • 完整开源任务目录、环境镜像、评测harness、测试用例与参考答案,做到可复现、可第三方审计
  • 已在CodeBuddy Code和Claude Code两套Agent框架上跑通统一评测协议,给出跨模型排行榜
  • 各子集打分方式不同,不做跨子集综合平均,避免制造虚假的可比性
  • 为编程Agent评测提供了一套更注重防污染和可复现性的新标尺,也顺带展示了腾讯自家CodeBuddy在同类基准上的对齐进展。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com