小鹏汽车发布TuringViT视觉编码器 面向物理AI场景重构视觉大模型训练范式
盖世汽车获悉 近日,小鹏汽车正式发布TuringViT高效视觉编码器。该系统针对VLM/VLA时代视觉编码器的架构设计、数据范式与训练流程进行了系统性重构,将支撑智能驾驶、智能座舱及IRON人形机器人三大业务场景。
图片来源:小鹏汽车
当前行业普遍采用的复用开源通用ViT方案,在高分辨率、多视角、连续视频帧等真实场景下面临算力成本、数据效率与场景适配三重瓶颈。TuringViT从架构、数据、训练三个维度同步推进,提出了相应的技术路径。
架构方面,TuringViT采用Turing线性注意力作为核心计算单元,构建了混合Turing Block架构,以线性注意力承担主要全局上下文聚合工作,计算复杂度从二次方降至近线性。实测显示,1536×1536分辨率下,TuringViT-18L推理吞吐量达到Seed1.5-ViT的3.04倍。该系统提供18L和24L两个规格版本。
数据方面,TuringViT打造了VISTA-Curation多模态数据治理流水线,通过图文和视频数据的多阶段筛选与标注优化,提升单样本监督价值。该系统仅使用0.85B图文对完成训练,约为SigLIP2-L训练数据规模的10%,在ImageNet-1K等六项零样本分类基准上取得83.6%的平均准确率。
训练方面,TuringViT采用四阶段渐进式原生动态分辨率训练范式,从预训练阶段即适配下游VLM/VLA的输入特性,配合二维旋转位置编码,支持不同尺寸与长宽比的输入。
应用层面,TuringViT将作为小鹏第二代VLA模型的核心视觉编码器,负责处理多路环视摄像头输入;在智能座舱场景中支撑视觉与语言模型的对齐;同时为IRON人形机器人提供物体识别、空间关系理解等基础感知能力。小鹏表示,该系统的架构设计与训练流程不依赖特定硬件平台,可为行业提供可复现的视觉大模型训练路径。
- 奔驰长轴距GLE SUV上市55.98万元起 标配Momenta智驾+超联屏+AI座舱
- 十届科技创新周,窥见东风汽车转型的底层答案
- 年轻人第一台车,4万级的拾月max直面秋游检验
- “同级无对手”是狂言还是事实?对小鹏G9L这台车,我们逐条检验一遍
- 问界M9 Ultimate领世加长版先行者在工厂交付仪式圆满举行
- 超级置换价9.99万元起,解读全新捷途X90的大家庭SUV破局之道
- 预售14.59万起 中大型纯电运动轿车 吉利银河TT将于9月10日上市
- 研发向东,品牌筑底,罗英瀚谈奥迪本土化的“平衡术”
- 覆盖两项电池起火终身保障权益 小米发布龙甲电池安心保障计划
- 三电机插混动力 纯电续航305km 吉利银河战舰700将于9月内预售
- 日产Wave谍照曝光!与雷诺5同平台!定位微型车!
- 吉利汽车8月销量270194台 同比增长8% 星愿8月销量60955台
- 吉利银河TT新增预售权益 0-100km/h最快加速3.8秒 将于9月上市
- 特斯拉默默抹去中国,FSD入华又成画饼?
- 福特吉利合资后续:将联合打造拉力风SUV 基于吉利GEA架构打造
- 比亚迪的新对手!全新纯电K-Car 续航310公里 铃木e SKY官图发布