小鹏集团发布TuringViT 打造物理AI统一感知底座

CNMO科技
07-21 12:21 来自北京

【CNMO科技消息】今年上半年,小鹏集团密集发布物理AI技术报告,继多视角生成式世界模型X-World、世界模型推理加速引擎X-Cache、预测式世界模型X-Foresight及X-Mind技术框架之后,近日,小鹏正式发布TuringViT高效视觉编码器,面向VLM/VLA时代系统性重构视觉编码器的架构设计、数据范式与训练流程。

小鹏

小鹏

据CNMO科技了解,针对softmax注意力在长序列下的算力困境,TuringViT创新性地提出Turing线性注意力(TLA)作为核心计算单元,构建 “5层线性注意力+1层标准多头注意力”的混合Turing Block架构。

该设计让线性注意力承担主要的全局上下文聚合工作,将计算复杂度从二次方降至近线性;仅周期性插入少量标准注意力层保障token级交互精度,同时搭配序列长度感知归一化与输入依赖门控机制,在高效全局建模的同时保留局部细节与高频视觉特征,避免线性注意力常见的细节平滑问题。

TuringViT的块架构和模型配置

TuringViT共推出两个规格版本:TuringViT-18L包含3组Turing Block(共15层TLA+3层MHA),主打动态分辨率下的高效部署;TuringViT-24L包含4组Turing Block(共20层TLA+4层MHA),在保持线性计算主导的前提下进一步提升表征能力。

实测数据显示,随着输入分辨率提升,TuringViT的延迟增长曲线远平缓于标准softmax ViT,高分辨率下的效率优势愈发显著。在1536×1536分辨率下,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍,相比SigLIP2-ViT-L提升2.16倍,为高分辨率感知、多摄像头输入、长时序视频处理的端侧部署扫清了核心障碍。

不同于行业“堆数据规模”的粗放路线,TuringViT打造了VISTA-Curation多模态数据治理流水线,通过提升单样本的监督价值实现数据效率的量级提升,从“用更多数据”转向“用更优质的监督”。

TuringViT采用四阶段渐进式原生动态分辨率训练范式,从预训练之初就适配下游VLM/VLA的输入特性,彻底告别“固定分辨率预训练+事后适配”的传统模式。

随着TuringViT的发布,小鹏全栈自研的物理AI底层技术能力逐步完善和丰富。小鹏的物理AI底层技术能力,也不仅仅服务于智能辅助驾驶,更将赋能更多物理AI业务场景。

热点新闻