揭秘超节点,AI算力需要“统一的语言” | 对话华为灵衢

客服微9964384311个月前财经知识153

编|王一粟

AI大模型带动的热潮,也在持续地席卷算力行业。

从CPU到GPU,再到NPU,各种AI芯片逐渐成为了市场中的香饽饽。

中国AI芯片也趁此机会开始崛起。从华为、阿里、百度等大厂,到寒武纪、云天励飞、‌壁仞科技‌、摩尔线程等新兴企业,中国AI芯片的单颗能力在不断提升。

但是,哪怕单颗芯片能力再强,算力也不能够满足大模型的需求。

尤其是随着大模型参数的不断翻倍,很多企业可能都会遇见的问题,就是8张卡的服务器根本跑不动,勉强用多台机器拆分任务,结果CPU、AI芯片、存储之间“各说各话”,数据传着传着就“堵车”,算力损耗快到一半。

_揭秘超节点,AI算力需要“统一的语言” | 对话华为灵衢_揭秘超节点,AI算力需要“统一的语言” | 对话华为灵衢

更要命的在于,不同厂商的设备像说不同方言的人:

A厂的CPU用一套协议,B厂的GPU用另一套,数据从CPU传到GPU,得先“翻译”,一来一回就浪费时间;甚至同一厂商的不同设备,规模扩大后性能也会“打折”,比如10个节点本应发挥10倍算力,实际可能只到1倍,这就是行业常说的“线性度”问题。

单个芯片算力不够用、不同设备沟通有障碍,成了整个行业的“卡脖子”难题。那么,要怎么解决这些问题,才能够支撑大模型的需求?

众所周知,当单独作战打不过之时,团队配合战斗则成为了赢取战争胜利的关键,而中国AI算力突破算力瓶颈的一个关键,就是开始走团队战斗路线。

此前,华为发布了“超节点”架构,配套的技术则是“灵衢”(UnifiedBus)。

简单理解两者的关系,当单颗芯片算力不够用,就需要将多种算力如CPU、GPU、NPU、存力等统一起来干活,超节点架构就是将多种算力部件整合为一个大节点,而互联协议则是让这些部件能顺畅沟通的规则,只有双方相互配合,才能够把整个算力系统的能力提升上去。

其中最核心的就是灵衢技术,其搞出了“算力普通话”,即一套能覆盖所有场景的统一协议,不管是超节点内部的CPU和GPU的沟通,还是超节点之间的集群互联,都不用换“语言”,这就像全国都讲普通话,不用到一个地方学一种方言,沟通效率自然高。

这套“普通话”还打破了两个关键界限:计算机网络,如平时上网的物理层、链路层,以及计算机内部架构,如内存管理、节点控制等。

过去,这俩像两个独立的房间,数据得“开门、进门、再开门”,而灵衢直接拆了两者之间的“墙”,底层用网络逻辑连设备,上层用架构逻辑管资源,数据传输的“路”一下子变通畅了。

同时,灵衢的超节点也不是“把部件堆一起就行”。华为专家强调,灵衢超节点是“超级单一节点”,不是“松散的部件集合”,就像把多间小房子改成一套大平层,所有家具(CPU、GPU、NPU、内存)都连在一条“统一的高速总线”上,不用再绕路,如交换机,过去只是“数据中转站”,现在在灵衢里成了“处理单元”,能直接参与算力协作。

基于这些突破,灵衢要实现四个目标,即让不同算力“组队干活”(提升计算性能)、系统出问题能快速恢复(高可用)、内存带宽等资源“集中共用不浪费”(资源池化)、不同厂商部件“插进去就能用”(组件货架化)。

这些目标的最终目的,都是为了让整个算力系统“更高效、更灵活、更省钱”。

而华为灵衢之所以能够实现“一套通吃”,原因在于,华为从一开始就盯着“整个算力系统”,不是只做单个产品,没有受制于老产品的束缚。

同时,华为灵衢于2019年正式立项,并把华为过去自研IT设备的经验、技术成果,还有搞集群的工程经验全部融入其中,同时还和鲲鹏、昇腾这些华为芯片一起反复测试。

基于这些实践经验,“现在灵衢1.0已经完成产品化,经过了芯片验证、集群交付验证,是工业化级别的可靠系统。”华为集群计算总经理朱照生说。

揭秘超节点,AI算力需要“统一的语言” | 对话华为灵衢_揭秘超节点,AI算力需要“统一的语言” | 对话华为灵衢_

华为集群计算总经理朱照生

同时,在具体落地客户实践场景中,也会考虑客户原有设备,比如客户已有以太网,灵衢也能直接在上面跑,不用大改基础设施,还能和现有的应用互通。

而为了让更多的厂商参与进来,华为还开放了灵衢的“全套说明书”,即从物理层到事务层的协议规范全公开,甚至找了第三方做“协议验证仪”。

“不管是做CPU的、做GPU的,只要按规范做,就能用灵衢,未来还能通过第三方验证是不是符合标准。”朱照生说到,“说实话,灵衢发布后,已经有很多厂商找过来跟我们交流,这已经超出了我们最初的预期。”毕竟,在其预期中,可能只有2-3家头部厂商会找过来。

业内皆知,过去,不同厂商的协议不互通,客户只能“绑定一家”,选择少还贵。但现在灵衢开放了协议,不管是华为的竞争对手,还是中小厂商,都能基于灵衢做产品。

朱照生说:“我们希望先做企标,再慢慢形成团标、甚至国标,让大家一起把算力基础设施做好。”比如某厂商想做GPU,不用自己再搞一套协议,直接用灵衢,就能和华为的CPU、其他厂商的存储兼容,大大降低了研发成本。

据灵衢系统架构师介绍,在AI大模型训练场景,通过超节点互联降低通信占比,端到端性能收益达到20%+;通算数据库场景,通过三层池化支撑多写多读,TPCC提升20%。结论表明,灵衢技术特别适合高并行、高同步的负载特征场景,能为业务带来显著提升。

另外,当前行业关于超节点是否越大越好也存在着诸多争议。对此,朱照生的回答很坦诚:“现在没人能说清‘甜点区’在哪,因为AI的发展总是超出预期。我们能做的,就是把超节点的规模做大,给行业留足空间。”

因此,灵衢2.0作为核心技术底座,支撑华为发布两款超大规模算力产品,覆盖不同阶段需求:

Atlas 950 SuperCluster(2026年Q4上市):由64个Atlas 950超节点组成,FP8算力达524 EFLOPS,规模与算力超过当前全球最大集群xAI Colossus;

Atlas 960 SuperCluster(2027年Q4上市):百万卡级集群,FP8算力2 ZFLOPS、FP4算力4 ZFLOPS,支持UBoE(灵衢推荐模式)与RoCE协议,适配未来更大规模AI训练、推理需求;

越大的超节点集群,整体算力性能越突出,以Atlas 950 SuperPoD为例,其支持8192张昇腾卡,训练吞吐达4.91M TPS,推理吞吐达19.6MTPS,远超前代产品。

“如果我们不能够准确预判未来负载模型一旦收敛于某一类模型某一个大小,我们就没法在算力基础设施层面给它设个框,如果设定那个框,那个框一定会反过来制约模型发展。”朱照生说。

当前,我们不难发现:算力的竞争,早已不是“单芯片谁更强”,而是“系统谁更高效”。

灵衢的价值,就在于用一套“通用语言”,把分散的算力聚合成一股力量,它或许不会马上改变所有,但至少给行业指了一个方向:未来的计算,不该有“语言壁垒”,不该有“设备孤岛”。

相关文章

突发!西子电梯总裁跳楼身亡,背后复杂企业关系曝光

突发!西子电梯总裁跳楼身亡,背后复杂企业关系曝光

做了一辈子电梯,偏偏这次选择了一跃而下。 今天中午,公众号“浙股君”发布消息,称西子电梯科技有限公司总裁刘文超于6月2日突然跳楼,不幸身亡。 就在事故发生的3天前,刘文超还出席了西子电梯第九届“安全...

一群年轻人和AI一起工作,造出老外追着买的中国耳机

一群年轻人和AI一起工作,造出老外追着买的中国耳机

新一代中国智造的成长路径:生于全球,长于AI。 【01 把AI装进全球办公室】 “我们选择钉钉,主要是因为钉钉听劝。” 在上个月的钉钉十周年产品发布会上,韶音科技CIO陈乡帅的一番话,让台下各大企业的...

坦克品牌销量罕见下滑,长城汽车如何守擂?

坦克品牌销量罕见下滑,长城汽车如何守擂?

连续四年销量持续上涨,连续54个月蝉联国内越野SUV销量榜首的长城坦克品牌,竟然罕见地出现了销量下滑,这究竟是怎么回事? 近日,长城汽车公布6月产销快报。今年上半年,长城汽车累计批发销量达56.98万...

运茅台堪比押钞,i茅台成了顺丰的免费陪练?

运茅台堪比押钞,i茅台成了顺丰的免费陪练?

顺丰和极兔结盟的同时,更重磅的是顺丰和茅台结盟。 近日,顺丰和极兔互相持股引发行业聚焦。顺丰控股(002352.SZ / 6936.HK.以下简称顺丰)与极兔速递(1519.HK)联合发布公告,宣布...

人大博士和山西首富争夺百亿煤矿,一个被抓,一个被追债

人大博士和山西首富争夺百亿煤矿,一个被抓,一个被追债

*此图由AI生成 作者| 史大郎&猫哥 来源| 是史大郎&大猫财经Pro “博士煤老板”,正在被追赌债。 最近,香港特区高等法院披露了一则“破产案”,事涉已经消失多年的“博士煤老板”吕中楼。 20...

海关总署:8月份我国出口2.3万亿元 同比增长4.8%

海关总署:8月份我国出口2.3万亿元 同比增长4.8%

2025年前8个月,我国货物贸易延续平稳增长态势,进出口总值29.57万亿元人民币,同比(下同)增长3.5%。其中,出口17.61万亿元,增长6.9%;进口11.96万亿元,下降1.2%,降幅较前7个...

发表评论    

◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。
客服微信:BT86616点击复制并跳转微信