开源项目 SlotStream:在 48GB 内存 Mac 上流畅运行 104GB 大模型

📡 Hacker News 热门2026-09-02 05:05

开发者开源 SlotStream 项目,实现了在 48GB 内存的 Mac 上流畅运行 104GB 的大模型。

AI 深度解读

开发者 carloslfu 在 Hacker News 与 GitHub 发布开源项目 SlotStream,展示了在 48GB 统一内存的 Mac 设备上运行 104GB 混合专家大模型的技术实现。

  • 该项目基于 Apple Silicon 平台的 Swift 与 MLX 框架开发,采用 SSD 动态流式传输(SSD-streaming)与专家按需加载(expert-offloading)机制。
  • 其核心设计是将模型的密集主干常驻在内存中,而将 MoE 专家权重保留在高速固态硬盘,根据计算图需求动态调度入共享内存。
  • 测试显示,该工具能在 48GB 内存 Mac 上运行 125B 参数(4-bit 量化约 104GB)的 Qwen3.8-Flash-Next 模型,并维持约 12 tok/s 的推理速度,同时提供兼容 OpenAI 与 Ollama 的本地接口。
  • 影响/看点:该方案降低了本地端侧运行百亿至千亿级 MoE 模型的硬件门槛,但其持续使用效果取决于设备固态硬盘的连续与随机读取带宽,以及高负载读写对 SSD 寿命的潜在损耗。
  • 资料依据:
  • GitHub(2026-09-01):https://github.com/carloslfu/slotstream
  • Hacker News(2026-09-01):https://news.ycombinator.com/item?id=41420786

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手