昇腾超节点:用数学“补”物理,中国算力迎来换道时刻

雪豹财经社
07-20 17:03 来自北京

数字世界的算力“普通话”

Fast Reading

华为首次公开亮相的昇腾950超节点真机,在2026 WAIC上吸引了众多参会人士,很多人兴奋地在由16台计算柜和4台灵衢柜组成的真机前合影留念。

昇腾950超节点备受关注,是因为它回答出了一个切中要害的问题:当一块芯片的算力已经逼近物理极限,如何用更多芯片“拼”出一台更强的计算机?

昇腾超节点的解决方案,是通过一套精密的灵衢互联协议,实现跨物理节点的统一内存编址,从而消除协议转换开销,降低通信时延。

作者 | 曹全景

编辑 | 高珮莙

7月17日,在上海开幕的2026世界人工智能大会(WAIC)上,“超节点”是炙手可热的名词之一,中兴通讯、沐曦股份、壁仞科技等多家企业亮出真机、展示肌肉。

很显然,围绕AI算力基础设施,一轮新的“军备竞赛”已经箭在弦上。

其中,最引人瞩目的是人头攒动的华为展台。首次公开亮相的昇腾950超节点(Atlas 950 SuperPoD)真机,以业界最大的1024卡规模、256TB内存统一编址,以及1 EFLOPS FP8、2 EFLOPS FP4算力,吸引了众多参会人士围观,很多人兴奋地在由16台计算柜和4台灵衢柜组成的真机前合影留念。

一位在WAIC现场的华为技术人员告诉雪豹财经社,超节点跟传统集群不一样。超节点的作用,就是让不同服务器之间的卡高速互联,统一内存编址,共享内存池,就像是在一台超级计算机中一样,而不是纯粹的物理堆叠。

反过来,即使在一个集群里堆再多的服务器,服务器之间不能统一内存编址,也不能叫超节点。

7月19日,鹏城实验室和GCC联合发布《超节点定义与实践白皮书》,首次明确了超节点的概念:超节点是一种在物理上由多个计算节点通过高效互联协议紧密连接组成,具备跨物理节点的统一内存编址能力,逻辑上具备“一台计算机”特征的计算系统。其中,“跨物理节点统一内存编址”是区分超节点与传统集群的核心架构特征。

它的出现,意味着中国AI产业的竞争,已经从单芯片性能的比拼全面转向系统级协同效率的较量。

用数学“补”物理

位于上海的国泰海通证券营业部里,数百名研究员紧张地忙碌着。他们需要从每天的海量信息和数据中,浪里淘沙般筛选出真正有价值的部分并进行分析,最终形成结论,以研报或视频的方式为投资者给出专业的建议。

这个巨大的工作量,靠传统人力根本无法应对,必须借助AI辅助。但金融行业、特别是证券交易系统有其特殊性,必须做到又快又稳,对高可靠、无中断、低时延和数据安全的标准极高。

传统的单机或双机部署,很难满足它们对算力基础设施的要求。

7月15日,国泰海通与华为合作部署了金融行业首个AI液冷超节点。与上一代昇腾Atlas 900 A2算力集群相比,部署昇腾Atlas 900 A3超节点之后,单次交互的TTFT时延从10秒缩减到了2.8秒,单卡端到端推理吞吐提升了3.2倍,研报产出、审核及相关服务的效率提升了5~10倍。

国泰海通一位管理层在一场小规模的分享中判断,2026年是智能体爆发之年,已经进入token经济的时代。

国家数据局数据显示,全国日均词元(token)消耗量已经从2024年初的1000亿,迅速增长至今年3月的140万亿,两年增长超千倍。

每一个token背后,都是算力需求的爆发式增长。

据CIC灼识咨询推算,中国智能计算芯片需求正迎来大幅增长,市场收入由2020年的17亿美元增长至2024年的301亿美元,复合年增长率为105%,预计2024-2029年的复合年增长率为46.3%,将显著高于全球平均水平。

但与此同时,传统的国产算力基础设施正面临结构性的困境。

过去半个多世纪以来,在摩尔定律的逻辑下,芯片上的元件从微米级一路缩小到纳米级,性能也在不断提升。英伟达最先进的芯片达到了3纳米工艺,单颗芯片算力是国内7纳米芯片的3倍,领先了整整两代。

制程竞赛短时间内追不上来,是国产AI芯片“卡脖子”的痛点。

而昇腾950超节点之所以备受关注,正是因为它回答出了一个切中要害的问题:当一块芯片的算力已经逼近物理极限,如何用更多芯片“拼”出一台更强的计算机?

它的破局逻辑,是放弃单颗芯片的算力“单挑”,用数百甚至上千颗芯片组成一台架设在同一逻辑上的超级计算机,用系统级的能力弥补单点的差距。

另一位华为技术人员在WAIC现场告诉雪豹财经社,这是用数学的方式突破物理的限制。

超节点的意义不仅仅是突破,而是换道超车,具备了和全球顶级方案掰手腕的能力。

作为国内唯一实现规模商用的超节点,2025年发布的昇腾384超节点,已经在互联网、运营商、金融、教育、医疗、交通、制造等20多个行业规模商用750多套,联合3000多个行业合作伙伴孵化出7000+行业解决方案,适配DeepSeek、Kimi、千问等超65个主流大模型。

今年2月,上海人工智能实验室与昇腾联合研发并发布首个万亿参数科学多模态大模型书生·Intern S1-Pro,基于昇腾Atlas 900 A3 SuperPoD完成预训练、SFT、RL、评测全流程,科学智能体能力升级高效支撑复杂科研任务。

与网络安全与云计算企业深信服合作的企业级AI代码开发,人均代码产出提升了4倍,新模块开发效率提升3~5倍,严重BUG检出率质量提升了1~2倍。

浦发银行部署昇腾384超节点后,通过多维推理加速技术,理财推荐产品的命中率从2%提升到了9.9%,风控模型的查准率从2.6%提升到了16%。

在业务场景多、精准操控难的宝武钢铁,昇腾384超节点通过对高炉炉温和硅含量的准确预测,单高炉年增经济效益超千万;热轧宽展预测精度提升了5%,钢材成材率提升0.5%,单产线一年节省超9000万;钢铁表面缺陷检测的识别精度达到95%,每年减少质量损失上亿元。

数字世界的算力“普通话”

把几千张卡连在一起并不难,难的是打破传统架构限制,突破服务器间的通信瓶颈,让它们真正做到像一台超级计算机一样工作。

在传统的服务器集群中,卡与卡之间的互联往往依赖PCIe或以太网,跨服务器互联带宽多为200~400GB/s,且时延达到数十微秒。

人们在日常生活中使用AI,对这个时间的感知可能不太明显。但一旦场景来到千亿甚至万亿参数模型训练的并行计算场景中,频繁的GB级数据通信阻塞,往往导致计算等待通信,成为性能瓶颈。一位华为技术人员告诉雪豹财经社,如果靠传统计算架构一次次迭代,训练时长可能动辄长达一年。

昇腾超节点的解决方案,是通过一套精密的灵衢互联协议,实现跨物理节点的统一内存编址。

一位技术人员打了一个比方:如果把集群比作一座城市,过去,每栋楼(服务器)独立运转,从一个房间(芯片)到另一个房间,得从小路走到大路再走到另一条小路,还得过红绿灯,速度很慢。

灵衢则是留一条大路,所有房间都放在路两边统一编号,任何两个房间都可以直接互联,CPU、NPU/GPU 之间可以跨节点访问地址,就像在同一台计算机里去调度这些硬件,实现内存的全局管理和灵活访问。

之所以能做到统一内存编址,还在于灵衢协议的另一个核心突破点——通过协议归一,解决了传统计算系统的“语言困境”。

在传统的数据中心,CPU、GPU等硬件都使用不同的“方言”,CPU用PCIe、GPU用NVLink、跨服务器用RoCE。硬件交互必须反复做协议翻译,产生巨大的时延损耗。灵衢则定义了一套覆盖整个设备的统一协议栈,让算力部件全部使用同样的数据传输规则,都用通用的“普通话”进行交流。

可以说,灵衢协议实现了数字世界的算力“普通话”,从而消除协议转换开销,降低通信时延。

超大带宽、超低时延、统一内存编址,这三大能力相互协同,才能真正实现让集群像一台计算机一样工作,实现真正的超节点。这也是区分真假超节点的基准线。

与上一代产品相比,拥有业界最大规模1024卡和业界最大范围256TB内存统一编址的昇腾950超节点,在关键指标上提升了至少70%,跨节点通信时延从7微秒降到了3微秒,平均稳定运行时长能够达到300小时。作为对比,万卡规模普通集群几乎每隔几小时就会出现一次集群中断,浪费大量的算力和时间成本。

在对算力要求极高的训练、推理场景中,超节点的优势尤为突出。

在大模型训练时,低精度格式省一半显存,统一内存让长序列训练能跑更大批量、不用频繁存档搬数据。通信性能比传统方案快16倍,计算和通信可以完全重叠,不再有“等数据”的空转。后训练时,推理生成的Token直接通过内部内存流入训练侧,纳秒级到达,推理和训练不再互相等待。推理时,单节点就能装下千亿参数模型的全部权重和超大并发缓存,单卡性能提升3倍,不用再跨节点搬数据。

统一内存编址+超大带宽+超低时延,让数据不再需要跨节点“搬运”,通信开销从瓶颈变成透明层。每一个效率提升,都是超节点能力在不同环节的兑现。

把墙拆掉,修一条路

在AI算力的全球格局中,英伟达用CUDA生态和NVLink私有协议筑起了一座围墙。这个封闭生态,对内是完善成熟的产业沃土,对外却是隔绝异构算力、排斥外部玩家的森严壁垒。

但华为选择了另一条路:把墙拆掉,改建高速公路,先让所有人都跑起来。

去年9月,灵衢互联协议2.0技术规范全面开放,基础规范文档超过600页,被合作伙伴评价为“最详细、最完整”,还办了几十期公开课,所有厂家都可以基于灵衢规范和参考架构打造更先进的算力基础设施。

去年年底,CANN、Mind系列基础软件全量开源,全面兼容各类 AI 编程范式和编程语言,向开发者无保留开放底层核心能力。

再加上此前已开源的昇思MindSpore框架和openEuler操作系统,华为超节点生态中的开源项目,已覆盖从互联协议到操作系统再到大模型的全栈技术链路。

这个与英伟达截然不同的开放生态,首先是一个聪明的生存策略。

在拥有数百万开发者和十几年使用惯性的CUDA生态面前,后来者如果仍然复制封闭路线,哪怕技术再好也很难与之抗衡。但CANN开源后,凭借兼容全行业开发范式的差异化优势,大幅降低了开发者的迁移和自研成本,从而逐渐瓦解CUDA的先发锁定。

目前,平均每月有3500多位开发者活跃在CANN开源社区,平均每3天就有一个新的开源项目上线,平均每天新增开源的代码3万行,社区的代码下载量也从开源初期的127万跨过了千万级别。

灵衢同样如此,坚持开放。从PCIe到NVLink到InfiniBand,互联协议的话语权长期被海外巨头掌控。以英伟达的NVLink为例,只有英伟达自己的GPU和交换机能用,其他厂商都被排斥在外。灵衢的开放,让国产算力行业看到了“不依赖NVLink也能高速互联”的可能性,且UBoE模式原生适配现有以太网基础设施,企业不需要换交换机就能部署。

这是一个足够有吸引力的巨大蓝海。华泰证券测算,2028年国产超节点市场空间有望达到3414亿元,2026-2028年复合增速194%。

开放的下一步,是从一家公司的协议到行业的标准。

工信部正在牵头推进计算高速互连总线协议(CLink)的标准制定工作,灵衢协议因其开放性和技术先进性,已成为该标准的重要参考依据之一。如果各大国产芯片厂商及不同企业的协议能通过灵衢的开放框架接入超节点体系,一个“国芯、国连、国用”的自主算力生态将真正成型。

这正是华为开放生态的初衷:把高速路网修好,提高国产芯片的协同效率,带动整个国产算力生态从封闭走向开放。

这也是中国算力产业在协议层的一次集体补课。借着这次AI基础设施换代的机会窗口,中国企业在协议层打了一个属于自己的钢钉。这个钉子一旦钉进去,后面的万卡集群、智能体时代、物理AI,都建立在自己的地基上。

IDC数据显示,2025年中国本土AI加速卡厂商在国内AI加速卡市场的合计份额已升至约41%,英伟达份额降至约55%。

从一家公司的协议到“中国标准”的建立,才是卡脖子问题的根本解法:不是在短时间内造出比海外巨头更强的单卡,而是提高国内算力供给的可得性、降低外部供应不确定性,并推动推理、行业模型和部分训练场景的国产算力使用比例提升。

这条路能否走通,不取决于华为一家,而是这条产业链上的每一个参与者。但至少方向已经清晰:与其在别人的赛道上追赶,不如自己修路架桥。

封面来源:雪豹财经社 拍摄

热点新闻