欢迎您访问欢迎来到沄森网,沄森智能旗下资讯平台!今天是:2026年08月07日 星期五 农历:丙午(马)年-六月-廿五
您现在的位置是:首页 > AI

券商观点|汽车行业深度报告:AI系列深度17期:视觉智能为何引入Transformer?

创始人2026-08-06 22:19:07
  2026年8月6日,东吴证券发布了一篇汽车行业的研究报告,报告指出,AI系列深度17期。  报告具体内容如下:  投资要点 视觉Transformer化的本质,不是ViT对CNN的一次性替代,而是图像被token化、视觉归纳偏置回归、视

      2026年8月6日,东吴证券发布了一篇汽车行业的研究报告,报告指出,AI系列深度17期。

  报告具体内容如下:

  投资要点 视觉Transformer化的本质,不是ViT对CNN的一次性替代,而是图像被token化、视觉归纳偏置回归、视觉基础模型形成的渐进过程。CNN之所以在AI1.0时代成为视觉核心架构,源于局部连接、权重共享和平移等变三项视觉归纳偏置与图像数据高度契合;但同样的强先验也带来局部感受野、任务专用、封闭标签和全局建模不足等约束,构成Transformer进入视觉任务的前提。 Transformer进入视觉的关键,是ViT确立“图像patch即token”的表示方式,使二维图像可被改写为一维序列,并接入自注意力和大规模预训练范式。相较CNN,Transformer具备全局建模与长距离依赖更优、接口统一利于跨任务与跨模态、可扩展性强等优势,且归纳偏置较弱,在大规模预训练下更能释放数据规模价值;但视觉数据并非天然离散序列,且高分辨率、多尺度和空间先验需求更强,因此视觉演化路径与语言不同,更多表现为融合与再平衡,而非彻底替换。

本报告将视觉Transformer演进归纳为三大阶段、九个子阶段。第一阶段是图像被token化,Non-local等注意力模块先补足CNN全局建模,ViT和DETR进一步改写图像输入与检测输出范式;第二阶段是可扩展通用骨干,Swin、PVT、CoAtNet等重新吸收局部性、层级结构和多尺度先验,ConvNeXt则证明ViT训练经验可反哺卷积网络;第三阶段是视觉基础模型,DINOv2/DINOv3、CLIP、SAM/SAM2/SAM3分别推动自监督通用特征、开放词表图文对齐和可提示分割。

从落地看,视觉智能仍主要是“感知性”中间能力。图像分类、检测、分割、视觉特征等结果通常需要嵌入既有业务流程才能兑现价值,尚未独立形成语言模型式消费级交互入口;视觉的“互动性”更多通过CLIP、GPT-4V、Florence-2等视觉语言模型接入语言中枢获得。因此,以语言智能的四次跃迁(架构、规模、对齐、推理)为参照,视觉已完成架构与规模两次跃迁,对齐仅以图文对齐形式部分实现且依附于语言,推理跃迁在视觉侧尚未展现。

我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。

风险提示:技术迭代不及预期的风险;大模型厂商 ARR 增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。

  更多机构研报请查看研报功能>>

  声明:本文引用第三方机构发布报告信息源,并不保证数据的实时性、准确性和完整性,数据仅供参考,据此交易,风险自担。

所有文章未经授权禁止转载、摘编、复制或建立镜像,违规转载法律必究。

举报邮箱:1002263188@qq.com

相关标签: