Simon Willison 发布 smevals:轻量级模型评测套件
Simon Willison发布smevals,一款用于评测模型、提示词与工具链的轻量评测套件
AI 深度解读
Simon Willison 联合 Jesse Vincent 的 Prime Radiant 实验室发布轻量级评测工具 smevals,用一套极简命令行流程解决“怎么系统评估不同模型/提示词/工具链表现”这个他摸索三年、迭代三次后终于觉得“对了”的问题。
- 用法极简:让编码 agent 跑 uvx smevals docs 读懂 README 后,直接帮你把评测用例搭起来,以 YAML 文件目录形式组织,不用手写评测框架代码
- 运行(run)与评分(grade)彻底分离,一条命令可用 -m 参数同时对比多个模型,如 GPT-5.5 与 Claude Opus 4.6 跑同一套用例
- 自带本地网页看板(smevals serve)和静态 HTML 导出(smevals build),排行榜、通过率、评分阈值等结果可直接部署到任意地方分享
- 作者已用它搭了一个“三行俳句”评测集作为示例,展示了从模型对比到详细评分明细的完整报告形态
- 看点:相比动辄要接入复杂平台的传统 eval 方案,smevals 主打“轻、快、可被编码 agent 自举搭建”,对个人开发者和小团队做模型/提示词选型是个务实的低门槛工具。
本内容由 AI 生成,仅供参考,请注意甄别