SemiAnalysis 解析 NVIDIA LPU 三种分离式推理架构
SemiAnalysis解析了NVIDIA LPU的三种分离式推理架构及其在不同交互场景下的性能权衡。
AI 深度解读
2026年8月31日,半导体分析机构 SemiAnalysis 发文解析了英伟达 LPU 面向分离式推理(Disaggregated Inferencing)的三种协同架构,展示了硬件针对不同大模型交互延迟场景的切分方案。
- SemiAnalysis 分析指出,英伟达 LPU 在分离式推理下支持三种组合:第一种由 Rubin 负责预填充(Prefill)阶段、LPU 负责解码(Decode)阶段,以追求更高的交互响应速度。
- 第二种方案采用 Rubin 承担预填充和解码注意力计算、LPU 承担解码前馈网络(FFN)计算,主要适配吞吐与延迟曲线中段的需求。
- 第三种方案结合 Rubin 进行预填充与解码验证、LPU 作为草稿模型(Drafter)加速推测解码;而在低交互延迟要求的批量任务中,纯 Rubin 架构依然保持优势。
- 英伟达官方在开源推理框架 TensorRT-LLM 中持续演进解耦服务与推测解码等技术,体现出异构算力协同优化吞吐已成为推理基建的关键路径。
- 影响/看点:分离式推理架构可能进一步优化大规模智能体工作负载的硬件能效比,其实际收益将取决于异构芯片之间的高速互联带宽以及调度框架对复杂计算图的切分效率。
- 资料依据:
- X:SemiAnalysis (@SemiAnalysis_)(2026-08-31):https://x.com/SemiAnalysis_/status/2094470943619842286
- GitHub:NVIDIA/TensorRT-LLM 开源仓库(2026-08-31):https://github.com/NVIDIA/TensorRT-LLM
本内容由 AI 生成,仅供参考,请注意甄别