券商观点|汽车行业深度报告:AI系列深度26期-云端基座模型如何在毫秒级车端跑起来
2026年8月7日,东吴证券发布了一篇汽车行业的研究报告,报告指出,AI系列深度26期-云端基座模型如何在毫秒级车端跑起来。
报告具体内容如下:
投资要点 学术缩放定律与车端工程约束对应不同的优化目标。Kaplan、Chinchilla等缩放定律讨论的是给定训练算力下参数量、数据量与损失之间的最优关系,其“最优”指向训练算力前沿,并未把推理成本和毫秒级实时时延纳入目标函数。将推理成本显式纳入后,部署最优点会向更小模型、更多训练数据偏移;智能驾驶则进一步强化了这一部署约束。 车端实时性构成大模型上车的核心约束。自动驾驶模型必须在固定车规算力上满足帧率、端到端时延和功能安全要求,大型视觉Transformer叠加大语言模型难以在现有车规算力下持续满足高频推理要求。理想披露VLA推理帧率约10Hz,NVIDIAAlpamayo-R1论文披露端到端推理时延99ms,小鹏称第二代VLA指令输出时延压缩至80ms以内。
云端基座模型的效率优化主要可归纳为两类路径:一是通用模型稀疏化和注意力/KV缓存压缩,如MoE、MLA、MTP、FP8、线性注意力等;二是面向驾驶的视觉Token剪枝、动态/隐式Token和思维链压缩,用更少Token承载关键场景信息。其目标是在云端继续探索能力上限,同时降低长序列和多模态推理成本。
车端时延压缩更强调可部署性,主流范式是“云端大模型蒸馏上车+快慢双系统”。Waymo通过教师—学生蒸馏把大模型能力迁移到实时学生模型,并采用ThinkFast/ThinkSlow架构;理想由云端基座蒸馏出车端VLA,并用扩散流匹配减少去噪步数;小鹏则以基座蒸馏和视觉思维链效率提升,降低车端推理时延。
我们归纳,未来云车分工或趋于“云端探上限、车端保实时”。云端模型负责更大规模、更复杂推理和世界模型训练,车端模型则围绕低时延、稳定性和安全冗余做压缩部署。该判断仍受蒸馏能力上限、统一评测缺失、芯片供给、量产时间表和功能安全验证约束,因此,训练侧的规模扩张逻辑不能直接外推至车端部署。
我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。
风险提示:技术迭代不及预期的风险;大模型厂商ARR增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。
更多机构研报请查看研报功能>>
声明:本文引用第三方机构发布报告信息源,并不保证数据的实时性、准确性和完整性,数据仅供参考,据此交易,风险自担。
所有文章未经授权禁止转载、摘编、复制或建立镜像,违规转载法律必究。
举报邮箱:1002263188@qq.com