小鹏发布TuringViT视觉编码器,重构视觉大模型训练范式
小鹏发布TuringViT视觉编码器,重构架构、数据与训练范式,支持智驾、座舱和人形机器人。
AI 深度解读
小鹏发布TuringViT视觉编码器,以“十分之一数据,更优效果”挑战行业主流,推动视觉大模型从“堆数据”转向“用优质监督”。
- TuringViT从架构、数据、训练三个维度突破,采用“线性注意力主导+高质量数据治理+原生动态分辨率”技术体系,实现效果、效率与落地性三重提升。
- 推出18L和24L两个规格,在高分辨率下延迟增长远平缓于标准softmax ViT,1536×1536分辨率下推理吞吐量达Seed1.5-ViT的3.04倍,为端侧部署扫清障碍。
- 打造VISTA-Curation多模态数据治理流水线,通过三步筛选(低质量过滤、多样化字幕生成与交叉验证、综合打分)提升单样本监督价值,仅用0.85B图文对(约SigLIP2-L训练数据的10%)便在六项零样本分类基准上平均准确率83.6%,超越使用10B数据的基线。
- 采用四阶段渐进式原生动态分辨率训练范式,从预训练之初适配下游VLM/VLA输入特性,告别固定分辨率限制。
- 影响/看点:TuringViT不仅支撑小鹏智能驾驶、智能座舱和人形机器人三大业务,更为行业提供了一条可复现、低成本训练SOTA视觉Transformer的技术路径,推动先进视觉大模型从“头部团队专属”走向“行业普惠”。
本内容由 AI 生成,仅供参考,请注意甄别