日处理 100T Token 的 Ox Alpha 架构曝光:国产芯片运行 GLM-5.3-Flash
日处理100T Token的Ox Alpha架构曝光,其实际由国产芯片运行GLM-5.3-Flash提供算力支持。
AI 深度解读
此前在开源社区匿名测试并达到日均 100T Token 处理量的模型 “Ox Alpha”,被证实为智谱 AI 运行于国产芯片上的 GLM-5.3-Flash,其实际运行表现为评估非英伟达硬件在大规模推理任务中的可行性提供了重要参照。
- 匿名测试与性能验证:机器学习研究员 Yuchen Jin 于 2026 年 8 月在社交平台披露,曾因编程与智能体任务表现引发行业推测的 Ox Alpha 实为 GLM-5.3-Flash,此前测试中展现了日处理 100T Token 的大规模并发承载能力。
- 模型架构与规格:根据智谱 AI(Zhipu AI)于 2026 年 8 月公布的技术信息,GLM-5.3-Flash 为总参数 320B、激活参数 18B 的混合专家架构多模态模型,支持超过 1M Token 的长上下文处理。
- 算力栈自主化实践:该模型的大规模推理服务完全基于国产 AI 芯片集群部署,印证了英伟达首席执行官黄仁勋在播客访谈中的判断,即硬件管制措施可能促使中国加速构建独立的 AI 软硬件技术栈。
- 影响/看点:如果国产算力集群在大规模商业推理场景下的能效比与运维稳定性能够持续支撑高吞吐负载,意味着国内大模型基础设施摆脱单一硬件依赖的路径将加速成型。
- 资料依据:
- X:Yuchen Jin (@Yuchenj_UW) (https://x.com/Yuchenj_UW/status/2092814059657949231)
- 智谱 AI 官方平台 (https://z.ai)
本内容由 AI 生成,仅供参考,请注意甄别