谷歌哈佛伯克利联合推出JAXBench,专攻TPU内核优化基准
谷歌、哈佛与伯克利联合推出TPU内核优化基准JAXBench,配合文档后单样本正确率大幅提升。
AI 深度解读
导读:谷歌联合哈佛、UC伯克利发布JAXBench,专门针对“用LLM自动写TPU内核代码”这件事出了一套贴近真实场景的基准——50个任务全部取材于Llama-3.1、DeepSeek-V3等实际在用的模型架构,而非玩具题目。
- 基线很惨:仅靠模型本身单样本生成TPU内核代码,正确率只有5.8%,说明LLM对TPU这种小众硬件的内核优化几乎无从下手。
- 关键变量是“给不给文档”:配合TPU官方文档后,用Gemini 3 Flash的单样本正确率直接跳到37.3%,50个任务里解出48个,说明模型缺的不是能力而是领域知识输入。
- 速度上,几何平均加速比达到1.28倍,再叠加束搜索(beam search)做多候选比较优选,能进一步推到1.36倍。
- 研究团队给出一个反直觉但实用的判断:正确性瓶颈本质是“文档问题”(缺上下文),速度瓶颈本质是“搜索问题”(缺足够候选去比较),两者需要不同的工程手段解决。
- 看点:这个结论呼应了当下agent工程的一个重要共识——对垂直、小众硬件场景,喂对上下文比堆更大模型更有效,JAXBench等于给这场争论提供了一份可复现的实证证据。
本内容由 AI 生成,仅供参考,请注意甄别