腾讯混元推出 WebCraftBench:聚焦真实非结构化指令的应用开发评测基准
腾讯混元发布基准 WebCraftBench,基于真实用户非结构化需求评测大模型端到端构建 Web 应用的能力。
AI 深度解读
腾讯混元团队联合高校于 2026 年 9 月 23 日发布 Web 应用生成评测基准 WebCraftBench,从软件动态测试视角系统评估大模型在真实非结构化需求下的 Web 开发能力。
- 该基准构建自 Code Arena 内部复刻环境中收集的 369 条真实用户请求,涵盖 5088 条验收标准以及不完整指令等真实场景。
- 评测框架将交互探索与打分阶段解耦,通过代码覆盖率引导智能体运行测试,从视觉外观、可用性与需求达成度三个维度进行综合评估。
- 在 17 个前沿大模型上的评测显示其排名与 Code Arena 排行榜相关系数达 0.89,在 197 个人工验证样本上与人类偏好匹配率达 85.3%。
- 影响/看点:该基准为评估代码模型的动态交互与完整 Web 应用交付能力提供了可复现的量化标准,有助于推动 AI 编程从静态代码片段生成向复杂系统开发演进。
- 资料依据:
- X:Arena(2026-09-23):https://x.com/arena/status/2102858150789669291
- arXiv(2026-09-23):https://arxiv.org/abs/2609.15387
本内容由 AI 生成,仅供参考,请注意甄别