Transformer渗透生成视觉加速 智能驾驶成物理AI最大增量
一份研报观点认为,Transformer正沿着序列生成、条件编码、骨干替换与多模态扩展四个环节逐步渗透生成式视觉领域。早期DALL·E将文本与图像token统一建模,随后CLIP、Imagen和Stable Diffusion强化了文本理解能力。2023年DiT以Transformer完全替代U-Net骨干,在潜空间图像patch上建模,验证了视觉生成具备与语言模型类似的规模化扩展潜力。研报指出,Transformer正成为视频生成和多模态系统的统一框架,推动内容创作从单图向时空连续与跨模态交互演进。 研报认为,数字AI底座模型发展路径已较为清晰,但难以完成对物理世界的建模闭环。而物理AI能直接作用于真实世界,成为当前AI发展中增量更大的方向。智能驾驶作为最先实现闭环的代表场景,相关技术迭代与商业化进程将带来确定性增长机会,值得重点关注。 中财网
![]() |