小鹏发布TuringViT视觉编码器,重构视觉大模型训练范式

📡 IT之家2026-07-21 12:23

小鹏发布TuringViT视觉编码器,重构架构、数据与训练范式,支持智驾、座舱和人形机器人。

AI 深度解读

小鹏发布TuringViT视觉编码器,以“十分之一数据,更优效果”挑战行业主流,推动视觉大模型从“堆数据”转向“用优质监督”。

  • TuringViT从架构、数据、训练三个维度突破,采用“线性注意力主导+高质量数据治理+原生动态分辨率”技术体系,实现效果、效率与落地性三重提升。
  • 推出18L和24L两个规格,在高分辨率下延迟增长远平缓于标准softmax ViT,1536×1536分辨率下推理吞吐量达Seed1.5-ViT的3.04倍,为端侧部署扫清障碍。
  • 打造VISTA-Curation多模态数据治理流水线,通过三步筛选(低质量过滤、多样化字幕生成与交叉验证、综合打分)提升单样本监督价值,仅用0.85B图文对(约SigLIP2-L训练数据的10%)便在六项零样本分类基准上平均准确率83.6%,超越使用10B数据的基线。
  • 采用四阶段渐进式原生动态分辨率训练范式,从预训练之初适配下游VLM/VLA输入特性,告别固定分辨率限制。
  • 影响/看点:TuringViT不仅支撑小鹏智能驾驶、智能座舱和人形机器人三大业务,更为行业提供了一条可复现、低成本训练SOTA视觉Transformer的技术路径,推动先进视觉大模型从“头部团队专属”走向“行业普惠”。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com