商汤开源 SenseNova U1.5 技术报告:8B-MoT 原生统一多模态大模型支持 4K 生成
商汤发布 SenseNova U1.5 技术报告并开源 8B-MoT 原生统一多模态模型,通过共享注意力实现原生 4K 图像生成。
AI 深度解读
商汤科技发布并开源 SenseNova U1.5 技术报告,推出基于 8B 参数规模 MoT 架构的原生统一多模态大模型并支持 4K 图像生成。
- 模型通过共享自注意力机制将多模态视觉理解与图像生成能力统合在单一网络结构中。
- 生成模块采用 Pixel Shuffle 结合 3×3 空间卷积结构,实现了原生 4K 分辨率画面的直接生成。
- 报告数据显示其 WISE 评估得分达 0.81,在 VBVR-Pro-Bench 基准上测得 68.2%,高于同期 Nano-Banana-Pro(56.4%)与 GPT-Image-2(50.7%)。
- 报告的开源提供了中小规模参数下实现高分辨率生成与理解一体化的工程实现路径。
- 影响/看点:该成果验证了 8B 级别原生统一模型在高清图像生成与视觉理解并存上的可行性,若后续开源权重获得社区生态适配,将降低多模态生成应用的部署门槛。
- 资料依据:
- X:商汤 SenseTime(2026-09-17):https://x.com/SenseTime_AI/status/2100598129494294765
本内容由 AI 生成,仅供参考,请注意甄别