物理AI将成为最大增量 智能驾驶投资价值凸显

时间:2026年08月07日 08:22:34 中财网
  数据显示,视觉智能正经历从CNN向Transformer的深刻转变。这一过程本质是图像被token化、视觉归纳偏置回归以及视觉基础模型逐步形成,已清晰分为三大阶段,包括图像token化阶段、可扩展通用骨干网络构建阶段以及以CLIP、SAM系列为代表的视觉基础模型阶段。最新技术进展显示,Transformer在全局建模、跨任务跨模态能力和可扩展性上优势明显,已在图像分类、检测、分割等领域取得突破。

  
  一份研报观点认为,视觉Transformer化并非CNN的彻底替代,而是融合再平衡的渐进演进。研报指出,虽然视觉数据对局部性、多尺度和空间先验要求更高,但通过吸收这些特性,视觉智能技术正快速成熟。目前视觉主要作为感知中间能力,通过与语言模型结合获得互动性,已完成架构和规模两次跃迁。

  
  研报认为,数字AI底座模型发展路径已逐渐清晰,但难以实现物理世界的建模闭环,而物理AI将成为物理世界更有效的AI解决方案,增量空间更大。智能驾驶作为最先跑通闭环的代表场景,技术确定性强,商业化落地进程有望加快。这意味着智能驾驶产业链公司将在视觉智能升级中直接受益,长期增长潜力值得市场关注。

  中财网
各版头条