开源项目让 125B 参数模型在 RTX 4090 上达到每秒 100 个 token
开源项目声称可让 1250 亿参数模型在 RTX 4090 上达到每秒约 100 个 token。
AI 深度解读
开源项目 Strata 宣称可在消费级电脑上运行 1250 亿参数的 Qwen3.8-Flash-Next,项目文档给出了不同显卡和量化版本的实测速度,关注点在于大模型本地部署的硬件门槛。
- Strata GitHub README(2026-10-04)称,项目支持 Windows 和 Linux,并要求至少 12 GB 显存及 32 GB 内存。
- 文档列出的测试包括 RTX 5070、RX 9070 XT 等设备;部分量化版本在 RTX 5070 上达到约 94 token/秒。
- 项目说明会把模型计算分配到显存、系统内存、CPU 和 SSD,因此速度与量化方式、内存容量及存储性能密切相关。
- Qwen 官方模型卡(2026-10-05)将该模型列为 125B 参数、约 6B 激活参数,并说明其为实验性架构预览。
- 影响/看点:这类方案可能扩大本地运行大模型的可行范围,但“100 token/秒”不能外推到所有 RTX 4090 或长上下文场景,实际表现取决于模型版本、量化、硬件和任务类型。
- 资料依据:
- Strata GitHub README(2026-10-04):https://github.com/Niko1221/Strata
- Qwen3.8-Flash-Next 模型卡(2026-10-05):https://huggingface.co/Qwen/Qwen3.8-Flash-Next
本内容由 AI 生成,仅供参考,请注意甄别