vLLM 团队实现谷歌 TPU 运行 Kimi 推理速度超英伟达 GPU 57%
原vLLM团队基于DeepSeek推理框架进行优化,使Kimi在谷歌TPU上的推理速度比英伟达GPU快57%。
AI 深度解读
由 vLLM 核心开发人员创立的 Inferact 团队在谷歌 TPU v7 硬件上实现了 Kimi K3 模型的推理加速,性能表现超过同等芯片规模的英伟达 GB200,展示了异构算力与定制软件栈结合的工程潜力。
- 团队针对 TPU 架构开发了专用 megakernel 推理内核,将模型推理过程中分散的小算子融合为单一程序,降低调度开销并提升片上内存带宽利用率。
- 结合 DeepSeek 开源的 DSpark 推测解码框架,系统在 16 块谷歌 TPU v7 集群上运行 Kimi K3 模型时达到了每秒 709 个 Token 的生成速度,高于 16 块英伟达 GB200 的 452 Token/s。
- 测试表明推理加速在保持模型数学推理与常识问答准确率一致的前提下完成,未发生精度损失。
- 团队已开源相关推理内核代码,以增强开源社区在非英伟达硬件上的部署能力。
- 影响/看点:该成果表明通过软硬件协同深度优化,专用 ASIC 芯片能够在特定大模型推理任务中获得成本与吞吐优势,但其实际工业落地仍取决于开发者对底层内核的适配维护成本以及特定模型架构的兼容性。
- 资料依据:
- 量子位(2026-09-26):https://www.qbitai.com/2026/09/497425.html
- GitHub(2026-09-26):https://github.com/vllm-project/vllm
本内容由 AI 生成,仅供参考,请注意甄别