Supabase 开源 Evals 基准,评测 Claude Code、Codex 与 OpenCode

📡 MarkTechPost2026-08-01 17:52

Supabase开源评测基准Evals,给Claude Code、Codex、OpenCode等智能体的真实建库任务打分

AI 深度解读

Supabase 开源了自家的编码 Agent 评测框架 Evals,专门在真实 Supabase 任务(建表、修 Edge Function、修 RLS 策略等)上给 Claude Code、Codex、OpenCode 等主流编码 Agent 打分,并同步公开了在线排行榜。

  • 评测框架按产品(数据库、鉴权、存储、Edge Functions、实时、定时任务、队列、向量、data-api)、主题(RLS、安全、迁移、SQL、SDK、可观测性、自托管、测试、声明式 schema)、阶段(构建、部署、排查、解决)三个维度设计,题目取材自真实的工单、bug 报告和 GitHub issue
  • 每道题都在真实环境中运行:框架会拉起托管式技术栈和本地 CLI 项目容器,Agent 直接调用真正的 MCP 服务器和 CLI,而不是打桩模拟
  • 评分方式是确定性检查加大模型评判双轨并行,Agent 有一次重试机会后才计入最终分数,题库分为公开的基准题和每日刷新、不计入公开分数的回归题两类
  • 项目基于 Apache-2.0 协议开源,本地跑通需要 Docker 守护进程、对应的模型 API key,以及 54321-54329 端口空闲,门槛不算高,适合直接接入自己的 CI 做回归测试或版本对比
  • 相比通用编码榜单,这类绑定具体后端服务真实任务的垂直评测更能反映编码 Agent 在实际业务场景中的可用性,也给正在挑选编码 Agent 的团队多了一份可复现的参考依据。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com