Strata 让 12GB 显存显卡运行 125B 参数 Qwen 模型

📡 IT之家2026-10-06 15:45

开源引擎Strata可让配备12GB显存的消费级显卡运行量化125B参数Qwen模型。

AI 深度解读

开发者 Niko1221 发布开源推理引擎 Strata,目标是在配备 12GB 及以上显存的消费级电脑上运行量化版 Qwen3.8-Flash-Next,关注价值在于它展示了超大参数模型向个人设备下沉的一种工程路径。

  • Strata 官方 GitHub README(2026-10-06)写明,模型参数量为 1250 亿,另有 510 亿 n-gram 嵌入参数;模型权重由 Qwen 官方仓库发布。
  • Strata 将模型主体放在系统内存,仅把部分高频专家放入显存,并结合投机解码降低等待时间,因此对系统内存、磁盘和数据搬运效率有较高要求。
  • README 给出的 RTX 5070 测试中,Q2_0 量化版本生成速度为 94 词元/秒,IQ3_S 为 53 词元/秒;这些是开发者在特定硬件和版本下的测量,不等同于普遍性能。
  • Qwen 官方模型卡(2026-10-06)显示,该模型原生上下文长度为 262144 词元,并采用稀疏激活和 n-gram 嵌入设计;Strata 的本地运行能力依赖这些结构特征及量化实现。
  • 影响/看点:如果不同硬件上仍能保持可用速度,Strata 可能降低个人运行大模型的显存门槛;实际效果取决于量化损失、内存容量、上下文长度和驱动兼容性。
  • 资料依据:
  • Niko1221/Strata GitHub 官方仓库(2026-10-06):https://github.com/Niko1221/strata
  • Qwen 官方模型卡(2026-10-06):https://huggingface.co/Qwen/Qwen3.8-Flash-Next

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com →
AI 助手