腾讯混元开源 WebCraftBench 基准:针对智能体建站质量的端到端评测框架
腾讯混元开源评测基准 WebCraftBench,用于多维度评估 AI 智能体自主构建网站的可用性与质量。
AI 深度解读
2026 年 9 月 22 日,腾讯混元团队在 arXiv 发布论文并开源 WebCraftBench 基准,从软件测试与交互探索视角系统评测大模型智能体生成真实 Web 应用的综合质量。
- 评测方法上,WebCraftBench 通过代码覆盖率引导测试智能体探索被测网站,将交互轨迹抽象为状态转移图,独立于硬编码验收条件进行动态取证。
- 评测维度覆盖视觉美学、交互可用性以及原始需求匹配度三大核心指标,解耦探索与评分过程以降低评测噪声。
- 数据集规模包含 369 项真实用户需求与 5088 条验收标准;在对 17 款前沿大模型的评测中显示各模型互有优劣,无单一模型在全部维度领先。
- 人类对齐验证方面,在内部竞技场抽样的 197 个成对样本会话上,WebCraftBench 自动化评分与人类偏好的一致率达到 85.3%。
- 影响/看点:该基准弥补了传统静态代码评测无法捕捉前端运行时渲染与交互缺陷的不足,若被行业广泛采纳为建站智能体的标准评估基准,可能促使代码大模型从单纯生成代码片段转向保障端到端可交互质量。
- 资料依据:
- arXiv(2026-09-22):https://arxiv.org/abs/2609.15387
- X:腾讯混元(2026-09-22):https://x.com/TencentHunyuan/status/2102320407860977861
本内容由 AI 生成,仅供参考,请注意甄别