NVIDIA Dynamo 推出影子引擎恢复技术:大模型推理节点故障可实现秒级自愈

📡 NVIDIA Technical Blog2026-08-26 04:57

NVIDIA Dynamo推出影子引擎恢复预览功能,支持大模型推理节点故障时秒级自愈,无需数分钟的冷重启。

AI 深度解读

英伟达官方技术博客发布分布式推理服务框架 NVIDIA Dynamo 的“影子引擎恢复”(Shadow Engine Recovery)预览功能,展示了针对大模型在线推理高可用性的秒级故障自愈方案。

  • 据 NVIDIA Technical Blog 2026 年 8 月 25 日发布的技术文档,在大语言模型推理服务中,传统进程崩溃后的冷重启需要经历从持久化存储向高带宽显存(HBM)加载权重、编译算子以及捕获 CUDA 计算图等流程,大型模型初始化往往耗时数分钟。
  • Dynamo 引入的 GPU 内存服务(GMS)支持在物理显存中独立管理模型权重,允许多个引擎进程映射同一份显存物理地址,在不增加冗余显存占用的前提下维护就绪状态的影子引擎。
  • 当工作引擎发生故障时,预先初始化的影子引擎可直接接管请求,官方在搭载 NVIDIA B200 芯片节点的 GLM-5.2 模型测试中,故障恢复耗时由冷重启的 283 秒缩短至 7.3 秒。
  • 影响/看点:该技术能够显著平抑推理集群单点故障引发的服务雪崩与首字延迟劣化,但该机制的前提是故障仅限于进程级崩溃,若涉及底层 GPU 硬件物理损坏或通信互联中断,仍需依赖多节点层面的流量调度与容灾方案。
  • 资料依据:NVIDIA Technical Blog(https://developer.nvidia.com/blog/restore-llm-inference-capacity-in-seconds-with-shadow-engine-recovery-in-nvidia-dynamo/)

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手