小鹏汽车发布TuringViT视觉编码器 面向物理AI场景重构视觉大模型训练范式
盖世汽车获悉 近日,小鹏汽车正式发布TuringViT高效视觉编码器。该系统针对VLM/VLA时代视觉编码器的架构设计、数据范式与训练流程进行了系统性重构,将支撑智能驾驶、智能座舱及IRON人形机器人三大业务场景。
图片来源:小鹏汽车
当前行业普遍采用的复用开源通用ViT方案,在高分辨率、多视角、连续视频帧等真实场景下面临算力成本、数据效率与场景适配三重瓶颈。TuringViT从架构、数据、训练三个维度同步推进,提出了相应的技术路径。
架构方面,TuringViT采用Turing线性注意力作为核心计算单元,构建了混合Turing Block架构,以线性注意力承担主要全局上下文聚