Epoch AI 解析英伟达 LPX 系统:以超高速 SRAM 突破小模型解码吞吐

📡 Epoch AI2026-08-27 03:13

Epoch AI 解析英伟达 LPX 系统,该方案采用超高速 SRAM 替代 HBM,大幅提升小模型解码吞吐速度。

AI 深度解读

研究机构 Epoch AI 于 2026 年 8 月发文解析英伟达 Groq 3 LPX 系统的架构特点,指出其利用 128 GB 超高速片上 SRAM 替代传统 HBM,实现了小型模型极端解码吞吐的提升。

  • 解码吞吐实测:在评测机构 Artificial Analysis 针对 Gemma 4 31B 模型的测试中,Groq 3 LPX 系统取得了超过 3400 token/秒的解码速度。
  • 存储介质取舍:LPX 采用容量相对较小但带宽极高的片上 SRAM,消除了传统高带宽内存(HBM)的访存延迟瓶颈,使适配该容量的模型实现满速解码。
  • 异构混合部署设想:针对大规模前沿模型超出单机 SRAM 容量的现实,英伟达提出将 LPU(处理高吞吐解码)与 GPU(提供大显存与预填充算力)结合的混合架构方案。
  • 影响/看点:若 LPU 与 GPU 异构调度的软件栈开销得到妥善优化,该方案可能显著降低智能体长链条推理与实时交互的端到端等待时间,但其普及进度仍受制于片上 SRAM 高昂的单位容量制造成本。
  • 资料依据:
  • 1. Epoch AI 官方 X 账号 (https://x.com/EpochAIResearch/status/2092692024772510137)
  • 2. Artificial Analysis 基准平台 (https://artificialanalysis.ai)

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手