多模态AI迈入Omni时代 智能驾驶成最大增量方向

时间:2026年08月07日 15:46:29 中财网
  多模态AI技术正快速演进,从早期模型拼接走向统一架构。最新进展显示,GPT-4o已将文本、图像、音频输入输出纳入同一实时交互闭环,Omni阶段正式开启,这意味着听看说能力实现无缝融合。

  
  一份研报观点认为,多模态智能本质是把不同模态映射进统一表示空间,并完成理解、推理、生成与交互,这是AI2.0架构、任务、模态三重收敛在模态维度的集中兑现。研报指出,发展历程分为外挂式组合、原生多模态和当前Omni三个阶段,对齐位置不断前移使得信息转换损耗大幅下降,大幅提升了模型在复杂真实场景的泛化能力。

  
  研报认为,Omni并非终点,理解与生成统一以及多模态深度推理将成为下一阶段核心主线,目前业界正通过自回归、扩散等多种范式探索解决表征冲突,同时推理能力正从语言向视觉和具身场景扩展。

  
  研报指出,虽然数字AI底座发展路径已逐渐清晰,但难以完成物理世界建模闭环,物理AI将成为当前AI增量更大的方向。智能驾驶作为最先跑通闭环的代表场景,技术与商业化落地条件日益成熟,有望率先兑现价值。随着多模态统一趋势深化,智能驾驶相关公司的技术壁垒与应用场景将进一步拓宽,业绩增长确定性增强,市场关注度有望持续提升。

  中财网
各版头条