玩家利用单张 RTX 4090 成功运行 125B 参数 Qwen 3.8 Flash Next

📡 阿易 AI Notes2026-08-27 16:02

海外开发者利用单张 RTX 4090 显卡搭配内存,成功在本地运行 125B 参数的 Qwen 3.8 Flash Next。

AI 深度解读

开源社区开发者于 2026 年 8 月通过内存卸载与模型量化技术,成功在单张 24GB 显存的 RTX 4090 显卡上部署并运行了 125B 参数的阿里开源模型 Qwen3.8-Flash-Next。

  • 部署配置:测试平台采用单张 24GB 显存的 RTX 4090 配合约 110GB 的 DDR4 系统内存,在 Linux 环境下实现了 125B 模型的本地加载。
  • 架构机制支持:该模型采用 125B 总参数、单 Token 激活 6B 的 MoE 稀疏架构,并将 51B 参数的 N-gram 嵌入表卸载至主机内存,避开了单卡显存容量的硬性限制。
  • 实测性能表现:在本地测试中,模型上下文长度被拉升至约 25 万 Token,解码生成速率达到每秒约 21 个词。
  • 影响/看点:这表明结合稀疏专家架构与系统内存卸载能够在消费级硬件上低成本运行百亿至千亿级大模型,但该方案主要适用于离线实验或低并发开发者场景,大规模生产环境仍受限于内存带宽瓶颈。
  • 资料依据:
  • 1. 阿易 AI Notes 社区实测记录(2026 年 8 月,https://x.com/AYi_AInotes/status/2092885394337444233)
  • 2. Qwen3.8-Flash-Next 官方技术架构文档(2026 年 8 月,https://huggingface.co/Qwen)

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手