B站发起“AI无限竞技场”真实场景实测:开源 190 个任务评测集

📡 karminski2026-09-21 09:28

B站发起涵盖代码与量化等真实场景的 AI 竞技场评测,并公开包含 190 个任务测试数据的开源数据集。

AI 深度解读

B 站社区创作者于 2026 年 9 月 21 日推出「AI无限竞技场」真实场景评测并开源数据集,以多样化实际应用任务检验大模型在复杂环境下的落地能力。

  • 数据集汇集 40 个主题、190 个实际任务样本与 33 位测试者的测评过程,覆盖代码重构、量化交易、复杂博弈等非标场景。
  • 测评整理了 100 多个参赛模型的数据并在 GitHub 开源,前三名分别为 GPT6-Astra、Fable 5.1 和 GLM-5.3。
  • 评测模式强调以实际工程与日常痛点为考核指标,规避传统刷榜基准的数据泄露问题。
  • 影响/看点:这种众包式实测意味着模型评估进一步贴近真实工作流,但评估结果的权威性仍取决于评分标准的一致性与测试样本的代表性。
  • 资料依据:
  • GitHub(2026-09-21):https://github.com/vista8/ai-infinite-arena
  • X:karminski(2026-09-21):https://x.com/karminski3/status/2101845994405274033

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手