Cerebras 上线 Qwen 3.8 27B 高速推理:达 1500 tokens/秒
Cerebras 平台上线 Qwen 3.8 27B 模型的高速推理服务,推理速度最高可达 1500 tokens/秒。
AI 深度解读
2026 年 9 月 3 日,Cerebras 在其推理平台上线开源密集多模态模型 Qwen 3.8 27B,通过晶圆级芯片硬件架构实现了约 1500 tokens/秒的生成速度,旨在降低复杂智能体与交互式任务的等待时延。
- Qwen 3.8 27B 参数规模为 270 亿,支持文本与图像双模态输入,并具备可配置的推理等级。
- 平台为该模型提供 64K(免费版)至 128K(付费版)的上下文窗口,开发者层级定价为输入每百万 tokens 0.99 美元、输出每百万 tokens 1.49 美元。
- 高吞吐推理将长程思维链(CoT)与多步骤工具调用的生成耗时压缩至秒级甚至亚秒级区间,有助于提升交互式代码与智能体工作流的反馈响应。
- 影响/看点:极高吞吐的推理服务可能加速需要频繁多轮推理与工具调用的自动化场景落地,但其实际工程价值仍取决于服务在高并发下的可用性、调用配额以及长上下文下的成本控制。
- 资料依据:
- Cerebras 官方文档(2026-09-03):https://inference-docs.cerebras.ai/models/overview
- Cerebras 官方平台(2026-09-03):https://cerebras.ai/inference
本内容由 AI 生成,仅供参考,请注意甄别