AMD携手Cerebras布局低时延AI推理:每瓦Token吞吐提升5倍

📡 IT之家2026-07-24 13:49

AMD在Advancing AI 2026上宣布与Cerebras合作,融合Helios机架与晶圆级引擎做低时延推理,单瓦token吞吐提升5倍。

AI 深度解读

在Advancing AI 2026大会上,AMD宣布与Cerebras联手开发低时延AI推理方案,把Helios机架级方案与Cerebras晶圆级引擎捏合,剑指英伟达与Groq在推理市场的联盟。

  • 方案聚焦超低延迟AI推理场景,AMD Helios机架承担高性能、可扩展的吞吐引擎角色,负责处理提示词与大上下文窗口
  • Cerebras的晶圆级引擎(Wafer-Scale Engine)负责对内存带宽要求更高的Token生成与解码环节,主打超低时延
  • 双方披露,两种计算引擎组合使用后,预计可将每瓦每秒Token吞吐量提升5倍
  • Cerebras介绍称,其晶圆级引擎在单块互连硅片上集成数十万个计算核心与数十GB SRAM,减少外部网络瓶颈对数据传输的拖累
  • 这一合作被视为对英伟达与Groq推理阵营组合的直接回应,推理算力格局的分野正在拉开
  • 影响/看点:AI竞争重心正从训练算力转向推理效率与能效比,AMD与Cerebras押注「每瓦Token数」这一新战场,若落地顺利将冲击英伟达在推理侧的领先优势。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com