WAIC 2026观察:百度天池 2.0 超节点亮相,单节点可承载万亿参数模型训练
在今年的世界人工智能大会上(WAIC)上,超节点成为了焦点。在WAIC现场,华为、中科曙光(603019)、沐曦股份、中兴通讯、百度昆仑芯纷纷展示了自己的超节点。
7月17日-19日,百度智能云对外展示了国产超级点“天池”的自研突破,同时公布包括昆仑芯万卡集群、吉瓦级AIDC建设等多项AI Infra进展。
早在百度世界2025大会上,百度智能云发布新一代昆仑芯和天池超节点,打造最硬AI云、助力企业内化AI能力。
百度的天池超节点凭借其全互联架构,能极大提升卡间通信效率,但其实现考验在芯片、内存、通信、供电、冷却上的全栈协同能力。百度智能云作为国内在此领域最早实现关键突破的厂商,正式发布了基于昆仑芯的天池256与天池512超节点。相比上一代产品,天池256超节点的卡间互联带宽提升4倍、整体性能提升50%;天池512超节点在此基础上进一步跃升,单个超节点即可支撑万亿参数模型训练。两款产品即将全面上市。未来,百度智能云还将基于昆仑芯M系列,推出千卡、四千卡超节点。
基于百度十多年积累的全栈自研优势,天池256在吞吐性能上较上一代提升25%,同时完成包含文心、DeepSeek、GLM、MiniMax等主流模型的适配,推理效率提升50%,而天池512超节点将在此基础上进一步跃升,单个超节点即可支撑万亿参数模型训练。
百度智能云混合云部总经理杜海现场表示,AI时代百度云客户需求持续转向大规模集群化推理效能。他进一步介绍,过去主流是8卡一体机,单台服务器部署模型、承载应用即可运行。而现在客户普遍需要百卡、千卡集群。百度现已建成3万卡算力集群,同时规划十万卡集群。客户核心诉求转变为如何更高效率、更高性价比使用算力。“本次我们推出天池2.0超节点方案,就是为了匹配市场对算力极致成本、极致性价比的需求。”
他进一步介绍,百度智能云在超节点技术自研上主要包含四个方面,首先是自研XPU-Link互联协议与可编程交换技术,把超节点内大量加速卡组织为高带宽、低时延统一通信域,重构Scale-Up全互联通信域,从32节点扩展到1024节点;其次是自研拥塞控制算法,缓解“多打一”流量冲突;然后是报文分类与QoS机制,拥塞时优先保障核心业务低延迟;最后是自研链路高可用算法,故障切换压缩至50微秒以内。在这些自研技术支撑下,天池超节点的实测带宽有效率达77%,能够对标国际顶尖方案。
在设计与架构层面,天池整机架构全自研,涵盖结构、供电、散热、管理与计算节点,并采用自研Cable Tray铜缆互连技术。液冷环节则推出Side-Car CDU,可在存量风冷机房不做改造的前提下部署液冷高密机柜。
而在构成超节点的芯片层,百度自研昆仑芯P800此前已完成规模化验证,2025年至今已交付多个万卡集群。
超节点不同于算力部署,在攻克诸多系统性工程挑战后,才能在提高整体算力性能的同时保证稳定性和可靠性。
杜海介绍,天池超节点主要攻克了三类工程难题。首先是高速互联在规模、成本和密度上的平衡。通过自研的互联技术以及架构设计方案,把互联成本和单柜网络空间都节省50%。
除了以上对AI Infra方面的效能提升外,百度智能云也在Agent Infra方面做了全面提升。目前原有的“MaaS模型服务”升级为“Token Factory词元工厂”。以Agent-first理念重构产品架构,尽可能减少token重复计算,推理生成速度较市场水平提升约25%。支持文心、DeepSeek、GLM、MiniMax等国产主流模型的调用,提供更具性价比的token服务。
同时,百度智能云还升级了“Harness Engineering驾驭工程”,覆盖长上下文管理、持久记忆、工具调用、子智能体调度、评估反馈及Runtime等能力模块,并对各模块进行深度协同优化,在使用浏览器、Office等工具来处理办公场景的任务时,成功率可以达到95%。
当前Token已经成为行业关注的焦点。智能体时代,百度创始人李彦宏此前提出DAA(日活智能体数)的衡量标准,认为行业不应该不只看Token消耗,更应该关注智能体的落地和产出。
杜海表示,当前行业普遍以Token消耗量评判模型优劣、AI落地效果,但Token吞吐量只是过程指标,无法衡量大模型给行业、业务带来的真实价值。百度将DAA作为模型落地效果的核心考核标准。DAA即日活跃智能体(Agent)完成有效任务数量。判定标准不在于消耗多少Token,很多场景简单任务会产生大量无效token消耗。“百度更主张使用DAA,也就是每日智能体完成有效任务总量,衡量大模型、AI基础设施是否产生真实业务价值。长期来看,DAA相比Token吞吐量,是评估AI落地效果更有效的指标。”
所有文章未经授权禁止转载、摘编、复制或建立镜像,违规转载法律必究。
举报邮箱:1002263188@qq.com