智能驾驶VLA模型崛起 物理AI成最大增量方向
一份研报观点认为,VLA4AD核心架构通常包含视觉编码器、语言处理器和动作解码器三部分。视觉编码器处理摄像头和激光雷达等多传感器输入并强化三维理解,语言处理器注入驾驶知识,动作解码器则直接输出轨迹或控制量。研报指出,VLA可分为被动解释器、规划协作者、统一动作生成器、推理中枢四个阶段,并非固定架构,而是自动驾驶向大模型、多模态和动作生成演进的总称。 研报认为,当前厂商路线已明显分化。Waymo用Gemini驱动纯端到端并统一语言空间,理想升级至MindVLA统一架构,小鹏第二代VLA则弱化显式语言层,以原生多模态Tokenizer和视觉思维链直达动作。元戎启行和千里也分别提出三角色与多专家世界模型方案。研报指出,这种分化集中在是否保留语言作为慢思考中枢,后续竞争焦点将落在实时性、数据闭环和量产可靠性上。 研报认为,数字AI底座路径已清晰,但物理AI在物理世界建模闭环上具备更大确定性。智能驾驶作为最先跑通闭环的代表场景,其技术突破将带来显著增量价值,相关领域有望率先受益于AI向实体经济渗透。 中财网
![]() |