小鹏集团发布 TuringViT,宣称重构视觉大模型训练范式
7 小时前
小鹏集团发布 TuringViT 高效视觉编码器,面向 VLM / VLA 时代重构视觉编码器的架构设计、数据范式与训练流程,将支撑智能驾驶、智能座舱、IRON 人形机器人三大业务场景,还为行业提供可复现、低成本训练 SOTA 级视觉 Transformer 的技术路径。该编码器从架构、数据、训练三个维度突破,打造了完整技术体系,推出 TuringViT-18L、TuringViT-24L 两个版本,高分辨率下效率优势显著。其打造 VISTA-Curation 多模态数据治理流水线,以约为 SigLIP2-L 训练数据规模 10% 的 0.85B 图文对,在多项基准任务上取得更优效果。此外,它采用四阶段渐进式原生动态分辨率训练范式,在三大业务场景中分别承担第二代 VLA 模型核心视觉编码器、提升座舱交互识别精度、人形机器人「视觉视网膜」的角色。
体验专业版特色功能,拓展更丰富、更全面的相关内容。