阿里发布 Qwen3.8-Flash-Next 预览 Qwen4 架构,英伟达提供首日微调支持
阿里发布开源模型 Qwen3.8-Flash-Next 预览下一代架构,英伟达同步提供微调支持。
AI 深度解读
2026 年 8 月,阿里巴巴通义千问团队发布开源实验性模型 Qwen3.8-Flash-Next 以技术预览下一代 Qwen4 架构,英伟达同步提供首日微调与推理支持,展示了新型架构在软硬件协同上的最新进展。
- 架构设计上,Qwen3.8-Flash-Next 采用混合注意力机制与稀疏混合专家结构,拥有 1250 亿总参数及 510 亿 N-gram 嵌入参数,单词元激活 60 亿参数,原生支持 26.2 万上下文并可扩展至 100 万。
- 工具链适配方面,英伟达通过 NVIDIA NeMo AutoModel 与 NeMo RL 提供首日全参数微调、LoRA 及强化学习对齐支持,并适配了 vLLM、SGLang 和 TensorRT-LLM 推理框架。
- 硬件部署覆盖上,该模型已在英伟达 GB300 NVL72 系统上完成验证,同时支持部署至工作站级硬件,降低了长文本与智能体开发者的测试门槛。
- 影响/看点:该模型的发布为开发者提供了探索下一代 Qwen4 架构特性的开源样本,英伟达的工具链适配有助于降低长序列场景的工程成本;其实际生产落地效果取决于各开源框架在长序列推理下的显存优化与吞吐表现。
- 资料依据:
- 1. 通义千问官方 X 账号 @Alibaba_Qwen(2026 年 8 月):https://x.com/Alibaba_Qwen/status/2092809475174666699
- 2. GitHub NVIDIA-NeMo/AutoModel 仓库:https://github.com/NVIDIA-NeMo/AutoModel
本内容由 AI 生成,仅供参考,请注意甄别