llama.cpp 支持 DFlash,加速 Qwen3.8-27B 推理

📡 Georgi Gerganov(llama.cpp)2026-10-06 21:27

llama.cpp新增DFlash支持,可加速Qwen3.8-27B结合MTP时的推理。

AI 深度解读

llama.cpp 维护者 Georgi Gerganov 表示,llama.cpp v0.6.0 已加入 DFlash 相关支持,Qwen3.8-27B-GGUF 用户可通过 draft-dflash 参数尝试推测解码,关注点在于本地推理框架把模型侧的多 token 预测能力接入实际部署流程。

  • llama.cpp v0.6.0 发布说明列出 DFlash drafts 相关修复,并将其放在推测解码变更中。
  • Hugging Face 的 ggml-org/Qwen3.8-27B-GGUF 模型卡提供了通过 llama serve 和 llama cli 调用该模型的示例。
  • 原帖给出的启动参数包含 draft-dflash、最大草稿 token 数 7,并要求使用 v0.6.0。
  • 发布说明同时包含多个后端和模型改动,因此实际速度不能只由版本号推断。
  • 推测解码的收益通常取决于硬件、量化格式、上下文长度、采样设置以及草稿 token 的接受率。
  • 影响/看点:若 Qwen3.8-27B 与 DFlash 配合稳定,用户可能减少单 token 解码的开销;实际加速幅度需要在相同硬件、模型文件和工作负载下进行基准测试,不能直接套用其他模型或设备的结果。
  • 资料依据:
  • llama.cpp(2026-10-05):v0.6.0 发布说明 https://github.com/ggml-org/llama.cpp/releases/tag/v0.6.0
  • ggml-org(2026-10-06):Qwen3.8-27B-GGUF 模型卡 https://huggingface.co/ggml-org/Qwen3.8-27B-GGUF
  • Georgi Gerganov(2026-10-06):X 公告 https://x.com/ggerganov/status/2107462737211056421

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com →
AI 助手