Cloudflare 揭秘如何大规模高效运行 Kimi 与 GLM 开源模型

📡 Cloudflare Blog2026-08-03 21:00

Cloudflare分享用KV缓存量化、权重压缩等技术大规模高效运行Kimi与GLM开源模型的实践

AI 深度解读

Cloudflare 公开了自己在 Workers AI 上如何大规模、低成本地跑 Kimi 和 GLM 这类超大开源模型的工程细节,对关注开源模型部署成本的读者是难得的一手实践资料。

  • 核心矛盾是显存瓶颈:Kimi、GLM 这类长上下文 MoE 模型很“香”但很难伺服,通常是 KV 缓存而非模型权重先把显存占满
  • 做法一是把 KV 缓存从默认 16 位量化到 8 位浮点(FP8),使 Kimi K2.6 可支持的上下文长度从约 68.6 万 token 翻倍到约 137 万
  • 收益并非来自单 token 推理提速(FP8 反而多了一点转换开销),而是能同时在显存里驻留更多并发请求
  • 论文/工程实测基于开源推理框架 SGLang 完成,并称已把优化反哺回上游开源社区
  • 文章还提到会在压缩权重之上做“共享缓存保护”,应对多租户挤在同一硬件上的安全隐患
  • 看点:这类“把开源模型伺服成本打下来”的工程细节,直接决定了 Kimi、GLM 这些中国开源模型未来能否被海外云厂商大规模、低价地商用铺开。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com