国内首个国产 GPU+类脑芯片大模型异构混合推理系统发布,推理性价比提升超一倍
国内发布首个国产 GPU 与类脑芯片异构混合推理系统,实测使大模型推理性价比提升超一倍。
AI 深度解读
在 2026 中国算力大会上,移动云联合中国电子科技南湖研究院、灵汐科技、天数智芯及清华大学、北京大学发布了国内首个国产 GPU 与类脑芯片异构混合大模型推理系统,为异构算力融合与降本提供了技术探索路径。
- 架构解耦:系统将大模型进行任务拆分,Attention 计算部署于通用国产 GPU,FFN 及 MoE 专家模块部署于具备存算一体与片上大容量 SRAM 特性的类脑芯片。
- 调度协同:依托自研模型编译器、高速互联协议与统一推理引擎,实现两类硬件的任务拆解、协同调度与结果聚合。
- 实测表现:根据研发团队在 DeepSeek V4 上的测试数据,该异构集群相较同类纯国产 GPU 集群推理性价比提升一倍以上,业务运营成本降低 40% 以上。
- 场景定位:方案重点面向 Token 工厂、代码生成、多智能体协同等高实时场景,以及金融、通信等安全敏感领域。
- 影响/看点:该方案可能为缓解大模型推理显存墙瓶颈开辟异构协同路径,但其实际成效取决于混合编译调度在不同大模型架构上的泛化能力以及复杂生产环境中的软硬件稳定性。
- 资料依据:
- IT之家(2026-09-13):https://www.ithome.com/1/001/793.htm
- 移动云(2026-09-13):https://ecloud.10086.cn/home/news/20260913-heterogeneous-inference
本内容由 AI 生成,仅供参考,请注意甄别