伯克利与得克萨斯大学推出FreeToken引擎:8GB设备流畅运行35B大模型
伯克利等高校推出 FreeToken 引擎,通过优化显存路由与缓存调度,支持 8GB 显存设备流畅运行 35B 大模型。
AI 深度解读
加州大学伯克利分校与得克萨斯大学奥斯汀分校研究团队于2026年8月开源了面向混合专家(MoE)架构的端侧推理引擎FreeToken,通过动态专家调度使低显存消费级硬件流畅运行数十亿至数百亿参数模型。
- 显存与带宽协同优化:FreeToken根据系统各层级带宽实时测量,动态将专家参数在GPU显存、系统内存与SSD间弹性映射,打破传统显存对模型容量的物理限制。
- 专家缓存命中率提升:该引擎采用请求感知路由机制,将专家缺失率从llama.cpp的约62%降至16%,在8GB显存笔记本上运行35B参数模型可实现每秒39.3个Token的生成速度。
- 开源与兼容部署:项目采用Apache-2.0开源协议,提供兼容OpenAI与Anthropic标准的服务接口,并支持Windows与Linux桌面端快速安装运行。
- 影响/看点:端侧MoE推理效率的提升可能降低高性能模型在个人PC上的本地化部署门槛,但实际生成延迟仍高度受限于设备的PCIe与主存读写带宽。
- 资料依据:
- 1. UC Berkeley & UT Austin 团队 GitHub 仓库及技术文档(2026年8月): https://www.flashml.ai
- 2. arXiv 预印本论文库发布(2026年8月): https://arxiv.org
- 3. Rohan Paul 社交媒体技术推文(2026年8月): https://x.com/rohanpaul_ai/status/2093439825408082139
本内容由 AI 生成,仅供参考,请注意甄别