AMD携手Cerebras布局低时延AI推理:每瓦Token吞吐提升5倍
AMD在Advancing AI 2026上宣布与Cerebras合作,融合Helios机架与晶圆级引擎做低时延推理,单瓦token吞吐提升5倍。
AI 深度解读
在Advancing AI 2026大会上,AMD宣布与Cerebras联手开发低时延AI推理方案,把Helios机架级方案与Cerebras晶圆级引擎捏合,剑指英伟达与Groq在推理市场的联盟。
- 方案聚焦超低延迟AI推理场景,AMD Helios机架承担高性能、可扩展的吞吐引擎角色,负责处理提示词与大上下文窗口
- Cerebras的晶圆级引擎(Wafer-Scale Engine)负责对内存带宽要求更高的Token生成与解码环节,主打超低时延
- 双方披露,两种计算引擎组合使用后,预计可将每瓦每秒Token吞吐量提升5倍
- Cerebras介绍称,其晶圆级引擎在单块互连硅片上集成数十万个计算核心与数十GB SRAM,减少外部网络瓶颈对数据传输的拖累
- 这一合作被视为对英伟达与Groq推理阵营组合的直接回应,推理算力格局的分野正在拉开
- 影响/看点:AI竞争重心正从训练算力转向推理效率与能效比,AMD与Cerebras押注「每瓦Token数」这一新战场,若落地顺利将冲击英伟达在推理侧的领先优势。
本内容由 AI 生成,仅供参考,请注意甄别