英伟达 Vera Rubin NVL72 亮相 MLPerf Inference v6.1 并创下推理性能新标杆

📡 NVIDIA AI Blog2026-09-16 23:00

英伟达在 MLPerf Inference v6.1 评测中首次展示 Vera Rubin NVL72 系统并刷新推理性能成绩。

AI 深度解读

英伟达在 MLPerf Inference v6.1 评测中首次提交 Vera Rubin NVL72 系统的预览测试成绩,展示了新一代架构在复杂推理工作负载下的吞吐能力。

  • 在多模态模型 Qwen3-VL 测试中,Vera Rubin NVL72 配合 vLLM 与 NVIDIA Dynamo 框架,在离线、服务器与交互场景下的吞吐量达到 GB300 NVL72 的 3.7 倍。
  • 在长思考推理模型 DeepSeek-R1 测试中,借助 TensorRT-LLM 优化库,其吞吐量达到 GB300 NVL72 的 2.5 倍。
  • 同期提交的 GB300 NVL72 在 4 机架共 288 颗 GPU 规模下,跨机架扩展效率达到 99%;软件栈优化使得 v6.1 相比 v6.0 性能提升至高 1.6 倍。
  • 影响/看点:新架构与系统级互联技术将推高前沿推理任务的单机架吞吐上限,但其实际落地效益受制于高密度机架的供电散热门槛与量产交付周期。
  • 资料依据:
  • NVIDIA AI Blog(2026-09-16):https://blogs.nvidia.com/blog/vera-rubin-nvl72-mlperf-inference/
  • MLCommons(2026-09-16):https://mlcommons.org/benchmarks/inference-datacenter/

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手