面壁智能 MiniCPM5-2B 获 SGLang 首日部署支持,RTX 5090 解码速度超 250 tok/s
面壁智能推出 MiniCPM5-2B,SGLang 框架提供首发部署支持,在 RTX 5090 上解码速度突破 250 tok/s。
AI 深度解读
面壁智能宣布其 MiniCPM5-2B 端侧模型获得高性能推理框架 SGLang 的首日部署支持,推进了轻量模型在桌面级与工作站显卡上的部署效率。
- 部署适配方面,SGLang 在模型发布当日提供完整服务支持,适配范围覆盖 NVIDIA RTX PRO 6000、RTX 5090、DGX Spark 及 Hopper 架构芯片。
- 性能指标方面,在消费级显卡 RTX 5090 上启用 DSpark 优化后,编码任务在批处理大小为 1 的设置下单用户解码速度超过 250 tok/s。
- 软硬件协同方面,通过专用推理框架与轻量级模型架构的深度结合,减少了端侧推理在处理序列时的算力与显存开销。
- 影响/看点:高吞吐低显存占用的小模型部署方案可能降低本地智能体与端侧辅助工具的硬件门槛,而推广效果取决于其在复杂长上下文任务下的实际泛化能力。
- 资料依据:
- 面壁智能 OpenBMB 官方 X(2026-09-07):https://x.com/OpenBMB/status/2097007177315860627
本内容由 AI 生成,仅供参考,请注意甄别