品玩7月21日讯,小鹏正式发布TuringViT高效视觉编码器,旨在系统性重构面向VLM/VLA时代的视觉编码器架构、数据与训练流程。该技术将全面支撑智能驾驶、智能座舱及IRON人形机器人三大业务场景,并致力于为行业提供一条可复现、低成本的SOTA级视觉Transformer训练路径。
TuringViT通过三大核心创新实现技术突破。首先,其提出的Turing线性注意力(TLA)将计算复杂度降至近线性,在1536²分辨率下推理速度显著优于主流基线模型。其次,VISTA-Curation数据治理技术仅用10%的训练数据便实现了更优的零样本性能。最后,原生动态分辨率训练范式从预训练阶段即对齐下游需求,无需事后适配。
作为小鹏物理AI技术闭环的关键一环,TuringViT不仅提升了车端高分辨率感知能力,也为具身智能提供了通用视觉基础,推动先进视觉大模型走向行业普惠。



