IDC×浪潮信息最新报告!22亿Agent背后,AI算力正迎来一场重构

机器之心
 来自北京

图片

编辑|陈陈

过去,人们很少用「工作量」来衡量一个 AI。

一个聊天机器人被调用一次,回答完问题,任务通常也就结束了。它消耗多少 Token、占用多少算力,大多被封装在一次请求里。对用户来说,一次调用基本就对应一次计算。

Agent 改变了这种关系。

现在,当你告诉 AI「帮我完成这项工作」,它可能先制定计划,再搜索资料、读取文件、调用工具、操作软件、检查结果;如果发现哪里出了问题,还会回到前面的步骤重新执行。

这意味着,一项过去只对应一次模型调用的任务,现在可能被拆成几十步,甚至更长的执行链条。每增加一次推理、一次工具调用,背后都会叠加新的 Token 消耗和计算开销。

于是,当 Agent 开始承担越来越复杂的工作,衡量 AI 的方式也在发生变化:人们关注的不再只是一次回答用了多少算力,还要看它为了完成一项工作,究竟执行了多少步骤、消耗了多少计算。

Agent 正在把 AI 从「回答一个问题」,推向「完成一项工作」。

近日,在 2026 人工智能计算大会(AICC2026)上,IDC 与浪潮信息联合发布《2026 年中国人工智能计算力发展评估报告》(以下简称《报告》),与往年相比,今年《报告》把 Agent 放到了一个更核心的位置。

IDC 副总裁周震刚在解读《报告》时提到,今年这份《报告》前后准备了半年多时间,期间访谈了大量企业并收集相关数据。

而这些调研数据,正在揭示 Agent 时代一个更大的变化。

22 亿 Agent 背后,真正爆发的是 Token

《报告》显示,2026 年全球已经有 52.1% 的 AI 项目取得可衡量的业务成果,相比 2025 年 9 月的 45.1% 进一步提高。到 2031 年,IDC 预计 AI 将累计创造 22.5 万亿美元的全球经济价值。

随着 Agent 技术逐渐成熟,企业 AI 采购预算将进一步增长约 20%。

Agent 本身正处于快速扩张阶段。

IDC 预计,全球活跃企业 Agent 数量将从 2026 年的 7940 万个增长到 2030 年的 22.16 亿个,复合增长率达到 129.8%。

同期全球 Token 消耗量的复合增长率预计达到 4822.6%,约为活跃 Agent 数量增速的 37 倍。

2026-2030 年中国活跃智能体数量复合增长率达 151.2%,同期 Token 消耗量复合增长率达到 3499.3%。

周震刚认为,比 Agent 数量更值得关注的是任务深度。

过去的 AI 主要完成检索、生成等相对简单的任务,现在开始进入多轮推理、工具调用和跨系统协作。随着 Agent 承担的任务越来越复杂,单个 Agent 背后的 Token 消耗也在快速增加。

因此,Agent 带来的算力增长并非线性关系。

报告给出了一个公式:Token 消耗总量 = 任务执行次数 × 单任务 Token 消耗 × 多智能体协同放大系数。这三个乘数正在同时增长。

首先,任务执行次数。

传统大模型通常需要用户主动发起请求。Agent 进入业务流程之后,大量调用开始由任务本身自动触发。

一个代码 Agent 接到 “修复 Bug” 的指令后,可能需要先读取代码仓库,寻找相关文件,再修改代码、执行测试、读取报错、继续修复。一次用户请求,在系统内部已经变成多次模型和工具调用。

报告预计,全球 Agent 年执行任务数将从 2026 年的 2800 亿次增长至 2030 年的 415.07 万亿次;中国则会从 178 亿次增长至 39.41 万亿次。

第二个变化,是单任务 Token 消耗。

一次简单问答可能只消耗数十到数百 Token,一个复杂 Agent 任务则可能持续运行多个步骤。

它需要加载上下文,进行任务规划,调用搜索、数据库、API 或代码执行环境,再读取工具返回结果。只要任务还没完成,就可能继续进入下一轮推理。

随着上下文窗口扩大、模型推理能力增强,单个任务的 Token 消耗也在从简单问答的数十个,增长到复杂文档分析的数万个,再到多轮决策任务的数十万个。

第三个变化,则来自多智能体协同。

一个复杂任务可以被拆成多个 Agent 子任务。一个 Agent 做检索,一个 Agent 做分析,一个 Agent 写代码,还有一个 Agent 负责验证和汇总。

Agent 数量增加了一层计算,Agent 之间传递上下文、交换结果,又进一步拉长了任务链。于是,一次原本简单的模型调用,被扩展成了一棵不断生长的计算树。

三个乘数叠加之后,最直接的结果就是算力需求斜率上升。

2025 年,中国智能算力规模为 1371.1 EFLOPS;2026 年预计达到 2576.5 EFLOPS,同比增长 87.9%;到 2030 年进一步达到 10524.3 EFLOPS。

与此同时,2025—2030 年中国智能算力复合增长率预测,已经从此前的 46.2% 上调至 50.3%。

Agent 正在把算力需求曲线继续向上拉。

问题在于,数字世界里的 Agent 可以迅速复制,物理世界里的芯片、电力和数据中心没有这么快。

IDC 预计,到 2030 年全球 AI 算力市场规模将达到 1.25 万亿美元,约为 2025 年的 4 倍。中国 AI 算力市场规模预计在 2026 年达到 515 亿美元,同比增长 37%,到 2030 年进一步达到 1501 亿美元。

企业也在继续加大投入,97.3% 的企业预计将持续扩大 AI 算力投入,其中 37.7% 的企业需要明显增加推理算力,29.3% 的企业需要持续的大规模算力资源支撑业务运行。

但一个有意思的现象出现了:投入在快速增加,算力依旧不够。

报告预计,全球 AI 算力需求满足率将从 2024 年的 79% 持续下降,在 2027 年达到 71% 的低点,到 2030 年也只能恢复到 77% 左右。

更重要的是绝对缺口。全球 AI 算力缺口预计将从 2024 年的 389 亿美元扩大到 2030 年的 3809 亿美元。

原因并不复杂。数字世界的需求可以指数增长,但芯片、HBM、服务器 CPU 的制造都受到真实产能约束。

数据中心同样如此。算力上架之前,还要解决机房、电力、散热、网络等一系列问题,电网扩容和关键设备交付的周期通常远长于一个 Agent 产品从上线到用户爆发的速度。所以,资本开支增加,并不会立即等比例变成可以调用的 Token。

算力不够堆之后,竞争转向怎么用好算力

既然算力需求高速增长、供给又长期存在缺口,那么 AI Infra 不能只依靠继续增加硬件。Agent 也因此开始重构整个 AI 基础设施。

Agent 不是一次调用就结束的请求,而是长期运行、持续进行数据交互的进程。

AI Infra 的优化目标也从单点性能走向完整任务执行效率。

报告沿着计算、存储、网络、数据中心、终端、模型与 Agent 框架、调度与 MaaS、Token 运营层面展开。

计算走向双线演进:既要更强,也要更多

计算层面,Agent 让 CPU 和 GPU 的分工更加明确。

GPU 主要承担模型推理和并行计算;CPU 则更多负责工作流编排、工具调用、状态管理等任务。Agent 时代的 AI 计算开始从 GPU 中心转向 CPU、GPU、NPU 等异构资源协同。

报告指出:传统 AI 服务器中 CPU 与 GPU 的资源配比大约在 1:8 到 1:4,随着 Agent 数量增加,CPU 需要承载越来越多工作流和状态管理任务,其重要性明显提升,AI 基础设施从以 GPU 为中心向 CPU 与 GPU 协同演进。

在此基础上,未来 AI 计算沿着两条路线发展。

一条是 Capability AI Compute,能力型智算。

随着模型规模、长上下文、多模态和复杂任务继续增长,单颗芯片很快触碰物理边界。计算竞争正从芯片峰值性能提升转向系统级能力构建。因此需要超节点、HBM、高速互连、Chiplet、先进封装等系统级创新,把更多芯片组成更大的统一计算域。以超节点为代表的 Scale-up 架构通过扩大高速互联域和统一内存寻址,提升单机模型承载能力和复杂任务处理能力,支撑突破智能上限。

另一条是 Capacity AI Compute,容量型智算。

让 AI 越来越强的同时,另一个问题是怎样让智能越来越便宜、越来越丰富,触达更广泛的用户。

报告针对训练和推理等不同阶段的负载特征,指出计算架构需要开展贯穿式创新,通过软硬件协同提升整体效率。报告重点谈到 Prefill-Decode 分离、Attention-FFN 分离、Encoder-Prefill 分离、Draft-Target 分离,以及多元算力协同、缓存和调度优化。以此提高 Token 产出效率,降低单位 Token 成本,实现智能充分供给。

Agent Infra 的变化远不止计算

计算之外,其他基础设施也在围绕 Agent 的长链路运行发生变化。

存储从保存模型和数据,进一步承担工作记忆、短期记忆、长期记忆和组织记忆,KV Cache 也开始从单次请求走向跨会话复用:

网络从主要关注数据连接和传输效率,转向保障任务链正常运行。一次 Agent 任务可能横跨终端、模型、知识库、企业系统和外部工具,一次尖峰延迟或网络抖动,就可能导致整条任务链超时。

数据中心则需要应对 Agent 7×24 小时运行和高并发推理带来的高功率密度。随着单机柜功率向 300kW 以上演进,散热需要和计算、互连、空间布局等系统协同设计,原生液冷成为 MW 级 AI 整机柜高密散热的演进方向。

终端也从单纯展示结果,变成 Agent 的运行节点。PC、工作站、汽车、机器人、工厂设备等都可能承担本地推理,最终形成云、边、端协同。

所以,Agent Infra 并不是简单地再多买一些 GPU。它实际上要求计算、存储、网络、数据中心和终端一起变化。

软件层也要从调用模型升级到管理任务

Agent 还在推动软件基础设施发生变化。单一模型无法满足所有任务,因此需要根据任务类型、用户意图、时延和成本动态选择模型。

在模型之上,智能体框架负责把模型能力嵌入任务执行流程,通过上下文管理、工具调用、状态维护和任务编排,将一次性的模型输出转化为持续、稳定、可控的业务执行能力。

调度对象也随之改变。

过去主要决定哪张 GPU 跑哪个任务;Agent 时代还要决定:调用哪个模型、运行在哪里、使用哪类芯片、失败后如何迁移和重试。

MaaS 也因此从模型 API,进一步走向覆盖推理加速、模型路由、工作流编排和 Agent 运行的任务级平台。

Token 开始成为衡量智能生产效率的中间尺度

过去评价基础设施,行业习惯看 FLOPS、GPU 数量和 PUE。但这些指标只能告诉企业投入了多少资源,无法直接说明这些资源最终生产了多少智能。

Token 成为衡量智能生产效率的核心计量单位。

如果一个 Agent 消耗 100 万 Token 完成了一项价值很低的任务,另一个 Agent 只消耗 10 万 Token 就完成了一项核心业务流程,单纯比较 Token 数量没有意义。

所以,报告进一步强调 Token 运营需要在交互性和吞吐量之间寻找平衡,并根据不同业务场景动态调整模型、算力和调度策略。最终真正需要衡量的,仍然是任务成功率、单位任务成本以及业务结果。

应用端出现明显鸿沟,Coding Agent 、Work Agent 最先跑起来了

Agent 落地不会齐头并进,而是首先进入高频、边界清晰、结果可验证的场景。目前明显跑在前面的主要有两类: Coding Agent 和 Work Agent。

代码生成、工程辅助之所以跑得最快,是因为代码高度数字化、任务边界明确,而且结果可以通过编译和测试直接验证。

Work Agent 的逻辑也类似。文档、邮件、日程、会议、知识库等办公场景,本身已经高度数字化,因此 Agent 很容易从写作、检索、会议纪要等单点能力,进一步延伸到邮件处理、日程安排和文档流转等连续任务。

相比之下,需要跨系统协同或者涉及高风险决策的制造业、医疗健康等传统行业,落地速度相对更慢,真正进入核心业务并形成执行 — 反馈 — 优化闭环的比例均为 0%。

教育、科研等领域则体现出另一个趋势:当前应用成熟度并不完全代表长期产业价值。

这些行业 Agent 应用深度和规模尚未达到 Coding、办公等领域的水平,但由于知识密度高、专业判断环节多,长期来看仍可能成为 AI 重构生产方式的重要方向。能源、交通等领域则受到物理系统、实时性和安全责任边界约束,整体推进相对更慢。

城市 AI 排名,也开始被 Agent 改写

北京、杭州、深圳组成新的第一梯队。

其中,北京依托完整算力产业链、实力雄厚的大模型企业以及人工智能应用生态继续排名第一;杭州凭借 AI 创新企业集群和互联网产业基础,以及在大模型、具身智能等领域的持续发展,排名第二;深圳则成为今年最大的变量,超过上海升至第三。

深圳的上升很能说明这一轮城市竞争发生了什么变化。它原本就拥有 AI 服务器、算力芯片和电子制造产业基础,在 Agent 快速增长之后,龙头企业持续扩大的算力投入、WorkBuddy、混元等模型与应用,又进一步形成了从算力供给到 Agent 应用的闭环。

上海、广州、成都、南京、武汉、济南、苏州进入第二梯队。

其中,武汉自 2018 年之后重新进入前十,形成通算 + 智算 + 超算 + 边缘算力协同体系;济南依托中国算谷产业生态建设,山东首个移动云 Token 中心已经落地;苏州则依靠光模块、精密制造等能力成为 AI 算力互联产业链的重要节点。

这张榜单背后更大的变化是,城市之间比拼的已经不只是有多少算力,还包括有没有模型、Agent 和产业场景去持续消耗和转化这些算力。

当 AI 从训练大模型走向持续生产 Token、执行任务,城市算力竞争也开始从单纯比拼算力规模,进入算力 — 模型 — 应用 — 产业的综合竞争阶段。

结语:Agent 正在重写 AI 的一切

周震刚在大会上表示:Agent 正在重写 AI 的一切。

AI 从内容生成走向任务执行,从单轮问答走向长链路协作,也从一个工具逐渐成为承担生产任务的业务单元。企业之间的竞争,也将从是否部署 AI,转向能否规模化、安全、可治理地运行 Agent。

模型能力依然重要,但仅仅跑起来已经不够。谁能让越来越多的 Agent 跑得更快、更稳、更便宜,同时做到安全、可控、可治理,才更有可能把不断增长的算力投入真正转化为生产力。

© THE END

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。

Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”

热点新闻