芯展速AI90固态硬盘显存化方案:首Token延迟缩短至1/50
芯展速推出AI90方案,将SSD纳入显存体系,使首Token延迟缩短50倍,吞吐量提升5.1倍。
AI 深度解读
芯展速推出AI90固态硬盘显存化方案,将首Token延迟缩短至1/50,为AI推理加速提供了新思路。
- AI90方案将高性能SSD纳入GPU显存体系,形成HBM+DRAM+SSD三级存储,KV Cache可卸载到SSD。
- 首Token延迟从秒级降至亚秒级,提速50倍;吞吐量提升5.1倍;显存节省39%。
- 结合智能P2P多卡互联,8卡RTX 5090集群推理加速可达5.8倍,支持128K+上下文。
- 配套的PT200Z AI SSD采用pSLC闪存和PCIe Gen5,DWPD高达100,满足高写入负载。
- 影响/看点:这一方案通过存储创新缓解了显存瓶颈,有望降低大模型推理的硬件成本,推动AI应用普及。
本内容由 AI 生成,仅供参考,请注意甄别