克雷西 发自 凹非寺
量子位 | 公众号 QbitAI
AI算力的竞争,多年来就一个字——堆。
堆卡、堆机柜、堆发电机……似乎计算卡足够多、集群足够大,就能站在食物链顶端。
但算力「够不够用」这个问题,已经不再能单靠堆卡来解决,它开始分化出越来越多的层面。
第一个问题关于智能上限,也就是你的算力能撑起多强的智能。
前沿模型的参数规模、上下文长度、推理深度在同时变大,Agent可能连续运行几个小时甚至几天。
模型在一台机器里装不装得下、跑得快不快、长时间跑起来稳不稳,都需要被重新考量。
另一个问题是智能规模,这个问题更直击灵魂——你的算力能以多低的成本生产多少智能?
Token需求在爆发,但推理负载是多元的,Prefill和Decode的计算特征不同,堆同一种算力已经覆盖不了这些差异。
智能上限和智能规模,两个问题各自独立,又相互关联,只解决其中一个,无法突破全部的算力瓶颈。
刚刚的AICC(人工智能计算大会)2026上,IDC发布了《2026年中国人工智能计算力发展评估报告》,把这两个方向拆开讲了一遍。
「一分为二」的算力缺口
Agent大爆发以后,AI对算力的需求正在发生质变。
过去,人们使用大模型时,算力调用更像是「脉冲式」的,用户问一个问题,系统返回一个答案,只调用一次算力。
但在Agent接管任务之后,情况变了。一个人类意图可能触发几十次、几百次连续推理;多个Agent组成协作网络之后,系统连续运转的时长,还能进一步增加到几个小时甚至好几天。
原本一次次短暂发生的算力请求,开始变成持续不断的计算负载,并进一步给基础设施带来新的压力。
这种长流的压力,可以拆解出三个影响因子。
第一个是任务执行次数,IDC报告显示,到2030年,全球每年的AI推理任务将增长4000万亿次;
第二个是单任务Token消耗量,过去一次简单问答只消耗几十个Token,现在一次多轮任务决策要消耗几十万个;
第三个是多智能体协同的「放大系数」,一个用户操作会被拆解成多条Agent指令,Agent之间传递上下文、汇总结果又拉长了整条任务链路,进一步放大了前两项的增长。
三个因子以乘法的形式叠加在一起,将算力需求的增长曲线拉到了前所未有的高位。

IDC数据显示,从今年到2030年,全球Token消耗量的复合增长率将达到4822.6%,Agent吃掉的Token正在急剧膨胀。
但算力的供给增长速度,却滞后于需求的变化。
IDC报告显示,全球AI算力需求满足率从2024年的79%一路下滑,2027年预计跌至71%,即便此后上游半导体供应链压力有所缓解,到2030年也只能恢复到77%左右。
百分比的波动看起来不大,但需求基数在急速膨胀,到2030年,算力缺口的绝对值将达到3809亿美元,扩大到2024年的将近十倍。

过去,弥补这种缺口的方式主要是靠「大力出奇迹」,也就是通过集群规模的扩展,堆叠更多的算力。
但Agent时代的推理负载种类繁多,对算力设施的要求也不尽相同。
Prefill阶段是高并行、高计算密度的任务,Decode阶段要逐Token串行处理、更吃内存带宽,Attention需要频繁访问不断增长的KV Cache,MoE包含稀疏计算和大规模路由调度,多模态模型还有独立的Encoder模块……
这些负载各有各的计算特征,还会随着上下文长度、输出长度和并发规模动态变化。
Agent任务中,首轮对话的上下文可能只有一两万个Token,经过上百轮对话后会扩展到三四十万个,系统瓶颈在计算、显存、带宽和通信之间不断转移。
所以,单纯堆料非但带不来线性的容量增长,反而会造成资源配比失衡,让一部分算力长期闲置,另一部分却持续过载。
实际上,这个缺口包含的是两个方向的问题。
一个是能力上限。
前沿模型的参数规模、上下文长度、推理深度在同时变大;一台机器装不装得下、跑不跑得快、长时间能不能跑稳,三个问题同时压了过来。
另一个关乎产能。
Token需求在爆发,但负载类型各异,不同推理阶段需要不同特征的算力,靠一种算力一招鲜吃遍天的路数,已经走不通了。
浪潮信息首席AI战略官刘军,把这两个方向概括为Capability和Capacity。

Capability AI Compute是能力型智算,支撑前沿模型去碰那些过去碰不了的问题。
如今,AI已经能从靶点出发发现新的药物分子、完成筛选和设计并推进到临床试验,能求解困扰学术界几十年的NS方程和孪生素数猜想,能自主设计AI芯片并不断迭代性能……
这些任务的共同特征是推理链条长、模型规模大、对算力系统的承载能力和稳定性要求极高。
Capacity AI Compute是容量型智算,让智能的供给更充足也更便宜,让更多人和企业用得起。
算力也是同一个道理,光有能力上限的突破不够,让足够多的人用得到,才能真正落到实处。
捅破「能力天花板」,瓦解「产能焦虑」
面对这两层问题,浪潮信息在AICC2026上发布了两款产品——超节点AI服务器「元脑SD200 Ultra」和多元算力机组「元脑HC2000」。
突破单节点智能上限
SD200 Ultra解决的是前沿模型装不下、跑不快、跑不稳的问题。

「装得下」是从0到1的一步,模型需要先能运行,才有讨论性能的空间,SD200 Ultra通过「紧致扩展」解决这个问题。
它延续了去年SD200采用的3D Hyper Mesh架构,整机内的芯片数量从64颗增加到了128颗,显存和扩展存储也相应提升到了8TB和64TB。
SD200 Ultra将足够多的计算、存储和通信资源压缩进一个物理边界内。
目前全球最大的开源模型Kimi K3有2.8万亿个参数,SD200 Ultra可以单机装下并高效运行。
不仅如此,SD200 Ultra支持在单机上部署最高10万亿参数的模型,提前为未来更先进的开源模型做好了基础设施准备。
跑起来之后,人们便开始追求速度。
128颗芯片要协同工作,跨芯片的数据交换每秒高达数十万次,传统方式依赖软件调用和缓冲区中转来搬运数据,延迟开销很大。
SD200 Ultra分两层解决这个问题。
第一层是「统一寻址」,通过全局统一编址、虚拟影子设备注册和跨域地址翻译,让128颗芯片的显存形成一个统一的地址空间,远端资源的访问从消息通信加数据搬移变成了地址空间内的直接访问。
第二层是「对称直连」,在统一寻址的基础上,通过对称内存技术实现GPU显存直连,GPU可以像访问本地显存一样直接读写远端GPU的显存,由GPU发起通信,跳过地址转换和封包中转,通信路径大幅缩短。

最终,SD200 Ultra的All to All通信时延缩短到0.69微秒,达到国际主流超节点产品相当的水平。
除了通信之外,计算也需要优化。
以Kimi K3为例,其单步推理涉及数千个算子调用,运行时大量时间消耗在算子启动、数据搬运和同步等待上,真正用于计算的时间反而有限。
SD200 Ultra构建了「超级算子」技术,把推理过程中Attention、FFN、MoE等众多基础算子融合成计算与通信一体的大算子,算子数量降低到了十分之一,减少了内核启动次数和显存访问开销,隐藏了通信延迟。

通过超级算子优化,SD200 Ultra运行Kimi K3的推理性能提升了3倍以上,Token生成时延低至5.85毫秒。
有意思的是,超级算子的优化过程使用了K3来分析和重构推理流程,由模型自己改进自己的执行效率。
还有一个容易被忽略的问题是稳定性。
Agent的复杂任务可能连续运行几小时甚至几天,期间经历大量模型调用、工具调用和数据读写,任何一次计算或通信故障都有可能中断整条任务链路,导致之前所有的推理和执行功亏一篑。
SD200 Ultra采用铜互联方案,减少了光电转换环节,降低了长时间运行中因电路故障导致任务中断的风险。
让算力产生更多智能
HC2000面向的是另一个方向,它解决的是Token产能不足的问题。
其核心思路,是让不同类型的算力各司其职。

HC2000的硬件基础是高密液冷AI整机柜。
它采用全液冷设计加上高通流供电,突破了传统风冷机柜的散热和供电瓶颈,单柜供电能力超过300千瓦,最多承载256张AI加速卡,算力密度达到传统风冷机柜的4倍。
其通信架构也升级到Directcom 2.0,计算与通信带宽1比1均衡配比,柜内聚合带宽达200Tbps,能够跨柜多平面无损扩展,All to All通信性能提升50%以上。
在这个硬件底座上,HC2000实现了多元算力承载,让不同类型的芯片按推理阶段分工协作:
Prefill阶段选择大算力芯片配合成本更优的显存颗粒,匹配高并行、高计算密度的特征。
Decode阶段选择大容量HBM芯片,兼顾显存容量和带宽。
FFN计算环节选择3D RAM堆叠芯片,缩短数据搬运路径,缓存带宽可以达到数十TB每秒。
整机柜支持成熟的工业标准架构模组,适配多种算力芯片,不同芯片各自承担最适合的负载。

其中,负责把这些不同类型的算力协同起来的是「MCIS多元算力协同推理软件栈」。
MCIS覆盖了从请求路由、PD分离推理到算力动态调整的全链路。
在PD算力动态调整方面,MCIS构建了测量、分配、监控、调整的完整流程,在模型部署前通过性能仿真评估不同芯片组合和PD配比,找到适合的配置方案。
上线后,MCIS会对计算、缓存、传输各环节的实际表现进行全链路监控,识别瓶颈并与预测做对比。
业务负载变化时,MCIS会重新评估PD配比和实例分配,持续优化资源分配方式。

在多元算力KV Cache管理方面,MCIS打通了不同类型算力之间的点对点数据直传,避免CPU中转和重复拷贝,数据传输性能提升近5倍。
MCIS还会根据KV Cache数据的冷热程度构建分级存储,结合多级流水并行聚合,使节点内磁盘I/O性能提升32倍,突破了KV Cache在大规模多元算力环境下的存储和传输瓶颈。
最终在典型的Agent任务场景中,HC2000搭配MCIS在同等投资下实现了10倍的Token产能提升。
从「提供算力」到「生产智能」
Capability和Capacity,是解决AI算力瓶颈的两个方向,但它们并不是两条分道扬镳的路线。
它们互为因果,Capability突破出来的新能力,经过算法优化和工程迭代,会以更低的成本向下渗透,变成Capacity需要规模化供给的东西;
而Capacity把智能送到更多人手中之后,产生新的应用和新的需求,这些需求又会反过来推动下一轮Capability,从而去挑战更高的天花板。
两个方向殊途同归,汇成了一条螺旋,而且这条螺旋正在加速。
去年,全球规模最大的开源模型是DeepSeek-R1,参数量6710亿;今年这把交椅的主人变成了Kimi K3,参数量达到了2.8万亿。
训练和运行它们需要极大的算力投入,只有少数机构能负担得起。
但各个模型厂商,已经在用更小的参数量和更低的推理成本,把前沿模型验证过的能力向下传递。
顶部的突破不断制造新的能力,底部的工程不断把这些能力变便宜,中间的应用层则不断长出新的需求,把螺旋继续往上推。
这条螺旋在企业端已经转起来了。
同一家公司,面对需要探索和突破的任务,会调用前沿模型去寻找未知的答案;面对已经验证过的日常流程,则切换到更轻量的模型批量执行。
Capability负责思考和规划,Capacity负责执行和重复,两种算力在同一个业务里并行运转。
刘军在AICC上的演讲中提到了一个历史类比。
世界上第一台通用电子计算机ENIAC非常重要,但真正改变几十亿人工作和生活的是个人电脑和智能手机。
最先进的发电技术非常重要,但真正改变工业社会的是稳定廉价的电力进入千家万户。
AI正在经历同样的过程,前沿智能的首次突破决定了AI能做到什么,而智能的普及程度才决定它能改变什么。
知识、推理、判断、创造,这些能力过去高度依赖于人类个体,但一个科学家穷其一生能深入研究的问题是有限的,高水平的智能天生就是稀缺资源。
今天,AI让智能有可能像计算和电力一样,成为一种可以被大规模生产和供给的资源。
这个变化,也在重新定义算力产业的价值尺度——从「提供算力」,到「生产智能」。
用刘军的话说,「生产智能」的今天,用户买算力设施,就应该像买电冰箱一样,插上电就能产Token。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
🌟 点亮星标 🌟
科技前沿进展每日见


