
芯东西(公众号:aichip001)
作者 | 全球AI芯片峰会
芯东西9月21日报道,今日,2026全球AI芯片峰会在上海圆满落幕。
本届大会由智东西发起,旗下智猩猩主办,芯东西协办,以“芯路求索 聚力致远”为主题,全景透视从TOPS到Token的AI算力关键链路。
整整两天,超过60位重磅嘉宾,在1场开幕式、3场论坛、5场闭门研讨会上密集输送技术创新、落地实践与产业趋势干货。多位演讲嘉宾还在会上预告重磅新品。
大会直击AI芯片前沿,涵盖架构创新、3D堆叠、超节点、KV Cache、新型存储、Token工厂异构混训混推、大模型推理、智能体推理、具身智能推理等焦点议题。来自超百家AI芯片生态企业的专业观众来到现场参会交流。

在展区,奎芯科技、芯来科技、Imagination、进迭时空、奇异摩尔、星融元、启芯宸光、科华数据、博伦智汇、硅芯科技、先进编译、恒瀚微电子、焱融科技等企业带来最新的技术产品方案展示。
“九年前,我们在上海举办了首场全球AI芯片峰会。九年来,全球AI芯片峰会的足迹已遍布北京、深圳和上海。”智东西联合创始人兼CEO龚伦常在发表致辞时谈道,“这是我们持续关注整个AI领域的一个缩影。”

▲智东西联合创始人兼CEO龚伦常
我们对开幕式及3场高峰论坛(大模型AI芯片、Agent推理芯片、具身智能芯片)中30位嘉宾分享内容做了梳理总结,重点如下:
一、云端AI芯片论剑!高效算力呼唤新架构,CPU杀回智能体时代焦点
随着智能体爆发,全球AI芯片产业格局持续演变,头部模型厂商深度参与芯片架构定制,几乎每家云计算巨头都在自研AI芯片,国产AI加速卡持续放量,算力运营重心从不计成本抢占高端算力,转向以token成本和算力利用率为核心的精细化运营。
如何通过技术创新提高大模型训推效率?为什么智能体时代呼唤“六边形”CPU?突破算力、内存、网络瓶颈有哪些新解法?大模型怎么辅助提高芯片设计效率?5位演讲嘉宾在开幕式上妙语连珠,畅谈他们的成果与思考。
1、中山大学王中风:把AI芯片算力用满,让大模型参与芯片设计
中山大学集成电路学院院长、IEEE/AAIA Fellow王中风分享了大模型时代下AI芯片的设计挑战与演进方向。当前如何将硬件峰值算力转化为模型部署的有效算力成为关键问题,为了实现高效部署,其团队通过压缩与量化技术创新降低数据开销,基于软硬件协同提升推理效率。
模型驱动芯片设计方面,王中风团队通过视觉Mamba高效加速器、超低BitLLM推理加速器、多层次稀疏Transformer加速器设计,解决算子适配、存储调度、稀疏利用等挑战;面向大模型辅助芯片设计自动化,提出性能感知GEMM Verilog生成设计、GEMM图-码转换多模态框架等创新。
王中风认为,提升AI有效算力的演进方向将是模型、硬件与系统设计的协同创新,包括探索更低比特的模型压缩与精度适配、联合优化算子融合与数据重用、用部署反馈驱动模型迭代。

▲中山大学集成电路学院院长、IEEE/AAIA Fellow王中风
2、英特尔高宇:智能体时代,CPU重回C位
英特尔中国区技术部总经理高宇说,智能体爆发带动CPU、内存、SSD和隐私需求,让CPU告别过去给GPU“打辅助”的角色,重回AI算力体系的C位。
智能体的运行是一个循环过程,其主线程主要运行在CPU上。CPU需要负责上下文处理、调用大模型、权限检查、工具调用以及结果处理等环节。
适合智能体的CPU不能只追求单点性能,而要成为“六边形战士”,同时具备更高的沙箱并发度、IPC和频率、更大的内存容量,以及硬件加速和安全能力。
高宇预告说,英特尔将在两天后的英特尔技术创新与产业生态大会(Intel Connection)大会上展示内置128张或192张Granite Rapids处理器的高密度CPU机柜设计,单机柜可承载5万个Agent同时并发运行。

▲英特尔中国区技术部总经理高宇
3、清华大学胡杨:以晶圆级协同设计提升Token经济性
清华大学集成电路学院副教授胡杨指出,AI基础设施的价值不能仅以单芯片峰值算力衡量,还应同时考虑有效Token产出与设备、网络、供电冷却等全生命周期投入。其团队围绕Token经济性,开展从计算芯粒、晶圆级芯片到集群的全系统协同设计。
针对通信、功耗和集成密度三大瓶颈,团队根据任务需求与面积、功耗约束,优化计算、存储和通信资源配比。在系统层面,将高带宽通信转入晶圆内部,联合设计晶圆内外互连及供电冷却,减少通信等待与外围设备投入。
报告介绍了模型部署、专家布局和集群组网等研究进展。通过协同优化Token映射与专家负载均衡,MoE推理方案在4毫秒输出Token间隔约束下,单芯粒吞吐达到对照方案的1.84倍。晶圆间组网方案在所评估配置中的电力成本较基线降低46%。相关研究分别从提高有效产出和减少系统投入两方面探索晶圆级的经济性。
胡杨强调,性能收益需要与制造、运行代价共同评估。团队已将热致翘曲、制造与装配良率、容错和散热约束纳入设计,联合清微智能研制了国产晶圆级芯片样机,形成大尺寸硅基板设计PDK、芯粒集成与系统验证能力。并联合清微智能与浦江实验室构建了软件基础设施。

▲清华大学集成电路学院副教授胡杨
4、后摩智能信晓旭:M50已定点150+产品,3D CIM架构取得阶段性成果
据后摩智能联合创始人、产品副总裁信晓旭分享,应对AI芯片提升算力和访存的两大挑战,后摩智能作为存算一体的先行者,过去六年沿着基于SRAM的存算一体路线迭代,成功将存算一体架构从学术界带入产业界。其旗舰产品M50量产半年,产品定点已达到150+,形成商业闭环。
针对行业主流3D堆叠技术算力受限、散热不佳等难题,后摩智能自研3D CIM架构,实现同等面积下算力翻倍,功耗与散热压力显著优化。
信晓旭表示,后摩智能将围绕端侧AI对算力、能效和存储带宽提出的新需求进行技术演进,并加速推进3D CIM架构的芯片产业化探索。

▲后摩智能联合创始人、产品副总裁信晓旭
5、奎芯科技王晓阳:未来AI芯片或采用定制内存(HBM+HBF)+标准互联新架构
在奎芯科技联合创始人兼副总裁王晓阳看来,AI芯片设计逐渐走向定制化、异构化、专用化,给内存架构创新带来新机会,HBM Base Die定制化和HBF分层存储成为新趋势。
HBM内存已从标准单品发展成小型子系统,需针对不同工作负载深度定制。HBF采用NAND Flash定制化堆叠,达到HBM级带宽但容量高一个数量级。未来AI芯片可能采用NAND Flash(HBF)+HBM混合架构,将KV Cache、Attention等延迟敏感数据留HBM,可预测的专家权重卸到HBF。
奎芯科技拥有全栈内存与接口IP,在UCIe,HBM,LPDDR,ONFI/NAND等接口方面积累深厚,能够为定制内存+标准互联架构提供接口底座技术。目前奎芯M2 UCIe:接口底座的标准封装32G已完成硅验证,其打造的Chiplet产品ML100 IO Die能实现HBM与xPU解耦,已流片交付客户。

▲奎芯科技联合创始人兼副总裁王晓阳
二、经纬圆桌:AI的平民化及端侧模拟计算的未来
经纬圆桌由经纬创投合伙人童倜主持,晰见科技创始人杨哲宇、安纳智芯首席科学家孙仲、芯词元创始人詹翊、后摩智能AI系统总工陈仲铭四位嘉宾围绕“AI的平民化及端侧模拟计算的未来”主题进行分享。
经纬创投合伙人童倜给本场圆桌划出两大重点:一是AI平民化,AI服务面向富人是阶段性的中间过程,未来肯定会有大量产品和服务面向普通人;二是在端侧,传统GPU、数字NPU是“老登”,未来需要用更多新技术解决现在的问题。
计算芯片公司有了水,还需要配套的管子,这里的水管代表芯片能够支撑的模型规格能力。童倜认为,企业具备核心计算能力是前提,而存储架构的选型,则是根据不同应用场景,基于对应模型的参数规模及系统需要,来决定。

▲从左到右:经纬创投合伙人童倜,晰见科技创始人杨哲宇,安纳智芯首席科学家孙仲,芯词元创始人詹翊,后摩智能AI系统总工陈仲铭
1、晰见科技杨哲宇:天眸芯成果荣登Nature封面,实现物理通用智能(Physical AGI)
晰见科技创始人杨哲宇说,端侧智能或者更大的范畴Physical AGI是比肩AI Coding的下一个机会,晰见科技要让AI拥有看世界的眼睛。其感存算传一体的3D IC芯片天眸芯是一颗能直接输出token的芯片,相关论文登上国际顶刊Nature封面。
天眸芯的结构是基于3D堆叠技术,在感光阵列下方堆叠高密度存储阵列与运算单元,通过模拟计算降低ADC的转换频次,功耗仅为对应同规格芯片的几十分之一。
据杨哲宇透露,目前头部具身智能企业打网球、踢足球、打乒乓球的视觉方案都直接来自天眸或进入深度评估阶段,具身运动人形机器人未来都会在3-6个月内,采用晰见科技的天眸芯或Token Camera。
今年11月,晰见科技将发布基于天眸芯的多模态大模型。内部测试显示,基于天眸芯的稀疏Token该模型的首token延迟(TTFT)仅为传统基础模型的二十分之一,性能可直接对标国内外头部多模态大模型,且率先支持主动感知与视觉注意力,是未来Physical AGI时刻的基座模型
2、安纳智芯孙仲:用模拟计算芯片把机器人时延压到几毫秒
安纳智芯成立不到一年,专注于模拟计算芯片设计。安纳智芯首席科学家孙仲谈道,模拟计算芯片有希望将相关应用的时延从百毫秒级降到几毫秒,人可感知的延迟为几十毫秒,机器人延迟在几毫秒运动会更流畅。
端侧大模型的数据量很大,处理这一问题的自然方法是做3D堆叠。安纳智芯擅长做矩阵计算,在面对如端侧设备微调等具体应用时,数据存储就可以使用DRAM或HBM,再利用模拟计算芯片进行数据处理、微调,这也是安纳智芯将后续探索的方向。
孙仲透露说,其工程样片即将回片,下一步会联合银河通用等具身智能公司做运动规划和实时控制Demo,与科大讯飞等端侧AI企业打造信号处理、大模型微调等相关应用。
3、芯词元詹翊:庖丁解牛式拆解AI平民化三道坎,正联合小米打磨超高速AI推理终端产品
芯词元创始人詹翊认为,AI平民化分为AI是否值得用、用不用得起、能否显著提高生产力三个维度:第一个维度和基座模型有关,第二、第三个维度反映在硬件上,就是降成本和提升推理速度。
芯词元将基于全新一代存算架构打造速度更快、成本更低的AI推理芯片与推理算力集群,预计明年上半年发布MO-I1,展示近万tokens/s的端到端推理速度,联合小米等产业伙伴实现超高速AI推理硬件在现实应用场景中的实际落地。
詹翊判断,未来AI推理硬件会是集各种存储介质所长的综合系统。其中芯词元的eDRAM负责片内高带宽和高速计算需求;片外3D DRAM和HBF互有带宽和密度优势,都会有他们各自适配的场景。所以AI推理硬件会在不同场景下采用不同的搭配方案,但芯词元的eDRAM存算一定是片内方案的最优解。
4、后摩智能陈仲铭:10W功耗跑100B大模型,下一代旗舰芯已流片
在后摩智能AI系统总工陈仲铭看来,3D堆叠能把内存带宽做大,实现极高的数据吞吐,尤其在物理AI场景下,有机会实现实时交互,不过现阶段相关供应链还未成熟。
HBF是应对HBM高昂成本的一条技术思路。陈仲铭认为,HBF无法完全替代HBM,更多是作为互补方案,未来3D堆叠技术可能将出现HBM+HBF等混合堆叠架构。
后摩智能采用3D CIM(存算+3D DRAM)的下一代旗舰芯片A20已流片,新一代存算架构可将100B大模型部署至端侧芯片,功耗约10W,具备装进手机的潜力。
该公司也在关注模拟存算,可能会在下一代或下下一代产品实现大规模生产。
三、大模型AI芯片狂奔,3D堆叠、新型存储、模拟计算风起云涌
随着大模型参数向万亿级膨胀,峰值算力不再是衡量AI芯片能力的唯一标尺,制约系统效率的要素还包括数据搬得动、存得下、连得快,以及芯片能否以可接受的功耗和成本真正落地。访存带宽、互联效率、软件生态和工程化能力,正在共同影响一颗AI芯片的有效算力。
AI芯片创新正从单点提升计算性能,转向计算、存储、互联、软件与设计工具的系统级重构。如何打通从架构创新到规模量产、从理论性能到真实应用的漫长链条?在大模型AI芯片高峰论坛上,8位嘉宾给出了他们的答案。有人以软件定义、3D堆叠和近存计算突破内存墙,有人押注存算一体、HBF与现代模拟计算,也有人将战场推向融合GPU、STCO和AI赋能EDA。
1、东方算芯彭贵强:用“软件定义+3D堆叠”创新绕过系统瓶颈
东方算芯董事长特别助理彭贵强谈道,“更聪明的模型”需要大算力和高访存带宽,“更低成本的应用”需要高访存带宽和低成本推理,算力评价标尺正从峰值算力变为有效算力。芯片性能不仅取决于计算单元本身,更受限于访存带宽、互联延迟、调度效率等系统因素。
东方算芯聚焦软件定义芯片,从计算、存储和互联架构三大方面进行创新:(1)软件定义Tile,提升硬件利用率,降低编程复杂度;(2)采用逻辑-存储三维匹配的3D IC设计,提供极致带宽并突破内存墙,这一过程需要应对应力与晶圆翘曲控制、热管理和良率成本损失三大工程化挑战;(3)通过Infinity Chiplet 3.5D,实现更强算力和更大互连规模。

▲东方算芯董事长特别助理彭贵强
2、亿铸科技熊大鹏:三大定律,指引通用存算一体
亿铸科技创始人、董事长兼CEO熊大鹏认为,通用存算一体是突破AI芯片算力与内存瓶颈的关键。对此,他提出三大核心定律,为行业落地提供理论支撑。
(1)搬运代价定律:AI数据搬运功耗与延时远高于计算本身,存算一体核心是尽可能消除数据搬运频次与距离。
(2)通用边界定律:通用存算一体需兼容CUDA主流生态,全覆盖通用GPU算力,适配各类模型迭代。
(3)异构终局定律:存算一体与GPU架构逻辑不同,二者融合能力直接决定芯片商业化成败。
熊大鹏强调,存算一体的核心在于存储,亿铸科技选定大容量、高成熟度、低成本的3D DRAM技术路线,未来将推出多形态全栈算力产品,覆盖云边端各类算力场景。

▲亿铸科技创始人、董事长兼CEO熊大鹏
3、迈特芯李凯博士:端侧模型有“三座大山”,3D近存计算可破局
深圳迈特芯科技芯片产品经理李凯博士分享了横亘在端侧大模型推理面前的“三座大山”:一是功耗、算力与成本的“不可能三角”,二是内存墙限制,三是通用方案与专用芯片之间的场景适配难题。
迈特芯采用张量脉动架构叠加3D近存计算来打破“内存墙”,将带宽利用率提升至80%左右。经测算,同样实现600GB/s带宽,传统2D方案功耗约为30~50W,而3D方案可将功耗降至3~7W。
据李凯博士透露,迈特芯3D TPU芯片已于今年流片,预计今年11月回片并点亮,首批将适配2B至9B模型,平均功耗约6W,预计推理速度可达80tokens/s。

▲深圳迈特芯科技芯片产品经理李凯博士
4、Imagination艾克:端侧芯片需要融合GPU
Imagination应用工程总监艾克观察到,端侧芯片已经开始同时承担感知、计算、推理与图形渲染等任务,传统异构架构暴露出数据搬运、内存吞吐、任务调度与软件适配等短板,如何应对5-10年生命周期中不断变化的模型与应用需求,成为端侧芯片设计的新挑战。
产业正探索更灵活的异构融合计算架构,趋势是让GPU从单纯的图形处理向通用计算与AI计算中心演进。ImaginationE系列GPU IP通过矩阵乘法直接嵌入GPU核心来提高GPU利用率,AI计算、通用计算与图形处理由固件统一调度并隔离多任务,再通过算子库、图优化与多格式量化支持轻量化部署,减少计算单元间的数据搬运与调度成本。

▲Imagination应用工程总监艾克
5、硅芯科技赵毅:3D芯片EDA是“无人区”,需要STCO+AI开路
硅芯科技创始人兼总经理赵毅博士指出,3D IC EDA领域被视为”无人区”——2D时代积累的设计方法学与工具链在三维堆叠场景下面临比较大的变革,需要重构工具链与设计范式。当前3D DRAM多层堆叠与存算芯片企业亟需一套全新工具链,信号、电源、热等多物理场仿真也需从单点后置转向协同前置。
芯片设计正从传统单芯片时代的DTCO(芯片设计与硅工艺协同),向端到端深度协同的STCO(系统-工艺协同优化)升级。硅芯科技STCO闭环协同流程贯通架构、设计、工艺与制造,将翘曲、电源完整性等量产风险前置管控。
同时,AI将赋能EDA新范式。硅芯科技推出了3Sheng Integration平台,核心AI Agent“Chips Z”实现自动迭代、闭环寻优等功能,显著压缩研发周期,加速芯片产品推向市场。

▲硅芯科技创始人兼总经理赵毅博士
6、启芯宸光陈文超:以DeepChip平台推动AI赋能芯片设计全流程
启芯宸光副总裁、EDA智算平台首席架构师陈文超介绍了DeepChip平台的技术布局与应用实践,分享了通过AI智能体、行业知识库与EDA工具协同,提升芯片设计、验证及测试效率的探索。
启芯宸光DeepChip平台涵盖DeepEDA、DeepIP、DeepATE与DeepEDU四大业务模块。DeepEDA融合EDA智算平台与AI²C智能体平台,通过算力调度、参数优化和流程自动化提升设计仿真效率;DeepIP接入本地或云端大模型,结合企业知识库与EDA工具,覆盖系统设计、RTL生成、功能验证和调试优化;DeepATE聚焦测试程序生成、测试向量转换与引脚自动匹配,提升芯片测试自动化水平;DeepEDU则将产业级AI工具与真实项目引入教学实训,培养AI与芯片设计复合型人才。
通过演示搭建测试平台、完成指定驱动代码生成与验证的案例,呈现了AI辅助工程师减少重复工作、加快研发迭代的应用价值。

▲启芯宸光副总裁、EDA智算平台首席架构师陈文超
7、九天睿芯刘铮:HBF AI芯片国内外研发竞速中
九天睿芯副总裁刘铮谈道,MoE模型参数量越来越大,存储容量的重要性越来越高,基于HBF高带宽闪存的解决方案愈发重要,预计国内外厂商将在2027年上半年完成计算、存储层流片,HBF AI芯片有望在2027年下半年推出。
在先进“存算+近存”的技术路线上,国内厂商探索出三维堆叠芯片设计方案,能够把TB级大模型权重置于超高容量存储层;结合SRAM存算一体技术,解决存储墙、功耗墙。该方案可支持超高参数量MoE大模型在云端推理场景和AI手机等智能终端场景落地应用,给用户带来更优的智能体验。
据刘铮分享,九天睿芯云端推理芯片可高效支持FFN阶段的计算,可独立或搭配其他GPU方案完成Attention(注意力机制)阶段的处理,在系统层级形成A/F分离的高效异构计算方案。

▲九天睿芯副总裁刘铮
8、安纳智芯向锐:现代模拟计算“一步”解矩阵方程,AI训练少走弯路
安纳智芯联合创始人兼CEO向锐认为,矩阵方程求解是AI训练的重要数学基础,但数字芯片直接求解效率较低,工程上需将其转化为一系列矩阵乘法。同等精度下,现代模拟计算方案在运算速度和能效比上大幅超越先进数字芯片,为广泛的矩阵方程求解需求,提供了颠覆性的解决方案。
对此,安纳智芯提出“现代模拟计算”,利用天然并行的物理法则,将计算压缩至一步操作。2025年,其方案实现24位定点精度,向锐称,这是世界首个全模拟高精度矩阵方程求解方案。
其芯片在应用上,面向云端,计划支持二阶优化器—现在几乎所有开源大模型厂商开始采用这类训练方法,降低大模型训练成本;面向端侧,则希望凭借近百倍能效优势支持后训练,并探索具身智能采训推一体化和在线自进化。

▲安纳智芯联合创始人兼CEO向锐
四、Agent推理需求爆发!AI算力告别单一芯片,CPU、异构算力、RISC‑V成下一程关键
随着智能体走向规模化落地,AI产业正式迈入推理算力主导的全新发展阶段。区别于传统AI模型的交互模式,智能体具备自主决策、持续运行、长任务处理的特征,催生了指数级增长的推理算力需求,也让行业长期面临的Token供给不足、推理成本高昂、端云适配脱节等痛点愈发凸显。
在此产业变革关键节点,6位嘉宾在Agent推理芯片高峰论坛上,聚焦推理芯片的落地痛点与产业未来路径,亮出了自家的前沿技术方案与实战经验。
1、光羽芯辰张晴:异构算力替代单一结构,公布端云协作和云端推理新路线
光羽芯辰联合创始人、董秘张晴称,AI推理需求正迎来指数级增长,但推理侧的Token供给严重受限。为此,光羽芯辰提出通过3D堆叠、异构计算和存储分层,大幅增强端侧推理能力并推动能落地的端云协同,同时在云端通过PD分离大幅降低云端推理成本。
作为光羽芯辰解决方案的第一步,TC1000系列芯片已量产部署,可在低功耗下高性能运行35B MoE模型。第二代TC2000系列将于明年量产,以更低的功耗服务于AI手机登手持式设备;第三代TC3000系列将专门面向超大规模模型的端侧部署和云端PD分离市场,目标是单芯片支持万亿参数模型,并降低HBM需求及云端推理成本。

▲光羽芯辰联合创始人、董秘张晴
2、博伦智汇张磊:从“有卡”到“用好卡”,异构算力调度成关键一环
国内算力需求快速增长,但算力供给和需求之间存在大量缺口,存在大量CPU闲置问题。博伦智汇技术架构师、资深算力架构专家张磊认为主要原因在于异构GPU规模化部署后,软件生态和调度能力在国产芯片上的适配仍不完善。
对此,博伦智汇通过DRA Proxy连接厂商设备插件与K8S,统一转换、补全设备信息并上报,实现异构GPU的资源发现与调度。同时,其自研TOLD架构面向Token,以低时延、高吞吐、低成本为目标,进一步串联资源规划、资源管理与推理服务部署。
在此基础上,博伦智汇的MIX调度平台通过复用厂商设备插件,降低芯片接入成本,让不同厂商的GPU释放算力价值。

▲博伦智汇技术架构师、资深算力架构专家张磊
3、灵睿智芯李华庆:智能体时代,CPU将扛起Agent Harness大旗
灵睿智芯联合创始人兼副总裁李华庆认为,Agentic AI正推动计算范式从以GPU为中心的计算密集型,转向以CPU为中心的控制密集型和I/O密集型。模型推理主要由GPU或其他AI芯片完成,长短期记忆管理、工具调用、多智能体调度和安全隔离等Harness环节则主要依赖CPU。
在他看来,智能体的爆发会给CPU带来巨大机会。未来业务将越来越长尾化、碎片化,底层芯片需求也会千差万别。随着摩尔定律放缓、工艺红利变薄及能耗约束加剧,芯片仅靠工艺演进已不足以继续提升计算效率和能效,需要结合不同业务特性定制芯片。因此,智能体时代的CPU需要具备高性能、高并发、高可靠、AI增强与可扩展性,而RISC-V则是最适合的指令集选择。

▲灵睿智芯联合创始人兼副总裁李华庆
4、芯来科技胡振波:RISC‑V是AI芯片时代最好的ISA,NI系列IP赋能AI芯片
芯来科技创始人、董事长胡振波提到,AI芯片对通用辅助算力的需求日益增长,RISC-V凭借开放、灵活的架构,可在AI芯片中承担主控核、算力核及启动核三类角色。其中,算力核的重要性正日益凸显。
今年,芯来科技推出面向AI推理的NI1000系列RISC-V处理器IP,支持1024至4096位向量宽度,融合算力内核,以RWV、VME、SFU全域加速AI芯片发展。
相比仅传统RVV架构,RVV+VME仅增加约15%的芯片面积,即可带来约2.5倍的矩阵运算性能提升,对比纯标量计算提升100多倍以上,NI系列同时兼容现有RVV软件生态。胡振波认为,RISC-V的开放性及自定义扩展能力,有助于AI芯片企业在共享软件生态的基础上实现差异化创新,降低开发和学习成本。

▲芯来科技创始人、董事长胡振波
5、沨呵智慧丁阔:Token工厂进入精益运营阶段,两大指标形成飞轮效应
沨呵智慧智算产品总监丁阔提到,围绕能耗、产能和售卖效率等维度,他们基于两大指标建立了Token工厂的运营指标体系。
其中TEF(Token效率因子)用来衡量GPU集群生产Token的效率,由GPU可用率、算力占用率和有效计算效率共同决定;TFI(Token工厂指数)用于评估商用Token平台的售卖情况,将TEF与服务交付率、Token售出率、价格实现率进行结合。
通过TEF和TFI,Token工厂可以形成飞轮效应,企业能够凭借对两大指标中参数的诊断和调整,从而改善Token业务的利润,满足企业经营的目标。沨呵智慧如今的产品交付形态已经从底层算力资源逐步走向标准化的Token产能。

▲沨呵智慧智算产品总监丁阔
6、IO资本俞枫:芯片创业机会相对平权,硬件公司需要懂模型、懂芯片、懂系统
IO资本联合创始人俞枫对AI芯片及半导体创业比较乐观。他认为,Agentic AI正处于指数级膨胀的过程,旧的生态壁垒正在加速瓦解。模型快速迭代的同时,AI芯片的需求也走向差异化,大公司无法垄断所有创新场景,市场正在充分奖励创新带来的效能提升,创业公司获得了与大公司相对平权的机会。
随着机会增加,创业门槛比以前高得多,团队不仅要懂芯片,还要懂模型、懂工艺、懂系统。他谈道:“没有模型公司能预测未来两年会发生什么变化,但硬件公司却要提前下注,这对创业公司管理层判断提出了更高要求。”

▲IO资本联合创始人俞枫
五、不止堆算力!具身智能产业还要拼架构与生态
具身智能正逐步从实验研究走向工业制造、家庭服务等实际应用,然而机器人端仍旧需要同时处理高维视觉信息、动态三维场景以及生成式的动作策略。面临计算量大、数据翻译频繁以及存储开销高、实时性要求严格和功耗受限等多重挑战,传统通用计算平台难以兼顾性能、能效和持续运行能力。
围绕AI芯片在具身智能赛道的落地,在具身智能芯片高峰论坛上,6位嘉宾分享了各自的最新实践与思考。
1、复旦大学朱浩哲:具身智能的核心是物理世界下“理解‑行动”的实时闭环
复旦大学芯片与系统前沿技术研究院助理教授朱浩哲提出,具身智能的关键性能指标通常不是平均的TOPS或者吞吐率,专用芯片最终要服务机器人的端到端闭环。
报告从“感知—建模—决策—行动”闭环出发,分析三维场景表示、实时定位建图和视觉—语言—动作模型的计算特点。他介绍了三维高斯泼溅的训练、渲染与硬件加速方法,并讨论VLA模型的推理流程、实时性需求及部署挑战。结合团队在3DGS、SLAM和VLA芯片架构方面的研究,报告说明算法与体系结构协同设计的必要性,并就具身智能专用计算平台的发展方向展开交流。

▲复旦大学芯片与系统前沿技术研究院助理教授朱浩哲
2、迈特芯谢齐家:以3D-IC芯片破解端侧VLA落地难题
迈特芯科技具身智能产品经理谢齐家分享了公司为解决端侧VLA模型落地而设计的3D芯片方案。他认为,目前VLA模型正在经历三大趋势:数据飞轮推动模型参数规模持续变大、快慢系统协同提升动作流畅度、Few-shot模型将率先落地。在此背景下,端侧算力需在实时性、功耗、带宽之间实现平衡。
迈特芯核心技术为3D-IC。在等带宽条件下,传统2D方案功耗最高约40多瓦,难以满足端侧要求,而3D-IC方案最高仅需约7W。在PPA微架构上,传统3D/2D IC共用统一总线,数据需要先经总线traffic再分发至各PE,耗时明显。迈特芯采用3D直连架构,让上层IO直接对应下层PE,显著缩短带宽访问路径,带宽利用率可提升至80%以上。
此外,谢齐家还提到,针对Transformer的算术特性进行优化、避免算子间的 reshape overhead,是PPA提升的关键贡献点。

▲迈特芯科技具身智能产品经理谢齐家
3、天数智芯夏广武:具身下一步是“大小脑”在物理上合一
天数智芯边端产品线副总裁夏广武提出,后续大模型需要从数字世界走向物理世界,具身智能就是物理AI的具象化,而主控芯片就是物理AI的核心引擎。
在技术特点上,他提到当前是算力分层对应模型分层,大脑负责规划,小脑负责运控,大小脑在物理上是分离的,下一步会首先在物理上将二者合一;并简介了天数智芯在具身智能领域的产品布局和方案特点。就如何推进具身智能产业发展和落地,他总结了四个抓手:开放的软件栈平台及工具链、开发者生态社区、产业链协同发展、具身落地的工程化思考,并指出产业发展需小步快跑,重在跑通某一具体场景的端到端业务,积小成至大成。同时还需各方合作,建立人才培养资源池,夯实具身智能发展的基础。

▲天数智芯边端产品线副总裁夏广武
4、进迭时空陈俭东:RISC‑V同构融合计算,打造机器人软硬同构算力平台
进迭时空芯片产品总监陈俭东认为,行业正迈入机器人计算机的新时代。当前具身机器人普遍采用多异构计算方案,存在软件生态割裂、数据反复搬运、硬件冗余、开发门槛高等痛点。
团队针对这些痛点,基于RISC‑V架构推进同构融合计算,依靠统一架构、内存和软件系统实现CPU算力、AI算力和实时算力的按需分配。
目前,进迭时空两代芯片已量产发布。K1为第一代,AI算力为2T;第二代K3为八核CPU,主频达到2.4G,AI算力达60T,支持部署30B模型。陈俭东透露,后续将开发更高平台算力的大小脑融合芯片。

▲进迭时空芯片产品总监陈俭东
5、维泛智能殷积磊:不只拼算力,还要构建具身算力生态
维泛智能创始人兼CEO殷积磊指出,“大脑”芯片当前面临算力不足、能效失衡痛点,百TOPS算力只是具身大模型端侧运行的起步门槛,同时还需要兼顾FP8、BF16、FP16等混合精度计算,以及实时响应和7×24小时稳定运行。
为此,他提出仿生类脑芯片BiGPU架构,引入新的计算范式减少数据搬运和存储带来的能耗,并原生支持FP8及脉冲神经网络,适配具身场景下不同模型和计算任务。
殷积磊称,目前规划的芯片算力为100~1000TOPS,但机器人芯片的竞争不只看峰值算力,还要看有效算力、能效和部署效率。未来,维泛智能将探索构建面向机器人的“Brain OS”,推动多方生态协同发展。

▲维泛智能创始人兼CEO殷积磊
6、肇观电子周骥:降低视觉处理功耗和成本,有利于具身智能更快落地
具身智能落地的关键在于低功耗、低价格,而降低视觉处理的功耗和复杂度是其中关键的一环。作为生物进化的顶端,人类视觉给具身智能的视觉系统的设计提供了参考和启发。肇观电子CTO周骥认为,未来视觉芯片不应一味追求大吞吐与大分辨率,应利用时域信息与生成式模型提升性能。视觉系统和语言/运动之间以高度压缩的Token传递信息,用生成式模型来取代传统ISP(传统信号处理),大分辨率图像只在需要对智能体行为进行解释时输出。
现阶段的视觉芯片有四大问题待解决:需补全机器人感知能力,缺失其他感官输入不利于降功耗;需要业界共同努力改变软硬件架构;VLM在端上运行仍然很吃力;目前现有Token压缩效率相比人脑差距较大。

▲肇观电子CTO周骥
结语:奔赴智能体时代,AI算力开启精细化、场景化新周期
从芯片架构革新、3D堆叠先进制程,到KV Cache优化、异构混训混推等算法算力协同技术,再到智能体、具身智能全新推理场景的探索,2026全球AI芯片峰会全方位覆盖当下AI算力产业的热点、难点与痛点议题。
当前,智能体技术的全面爆发,正在倒逼全球AI芯片产业格局迎来重构。过往单一的峰值算力指标,已无法适配大模型时代复杂的算力需求,数据存储、传输、交互、互联的全链条效率,以及功耗控制、成本可控性、工程化落地能力,共同定义了新时代AI芯片的“有效算力”。
随着架构创新持续深化、软硬件生态不断完善、场景落地持续渗透,AI芯片或进一步摆脱“重参数、高消耗、低效能”的发展瓶颈,实现算力、功耗、成本、场景的更优匹配。
放眼未来,AI算力作为AI产业的核心底座,其迭代进化将持续牵引整个AI产业的发展走向。


