端侧部署!高通携手阶跃、无量火与江波龙达成合作

CNMO科技
 来自北京

【CNMO科技消息】9月23日,在2026骁龙峰会期间,高通技术公司正式宣布携手阶跃、无量火与江波龙开展四方合作,基于第六代骁龙8超级至尊版移动平台,将阶跃StepEdge-Omni 30B-MoE(混合专家)模型面向端侧进行深度适配与推理优化,成功打造具备自主服务和个性化能力的端侧智能体助手,并在峰会现场完成基于高通参考设计的现场演示。

高通公司总裁兼CEO安蒙

高通公司总裁兼CEO安蒙

此次合作的核心技术路径,是混合专家(MoE)架构与存储方案的联合优化。StepEdge-Omni 30B-MoE模型拥有300亿参数,但依托MoE架构,仅根据任务需要激活部分专家模块,每次生成一个词元仅需激活约30亿参数,大幅降低了实际计算负载和内存带宽需求。

合作方通过推理引擎、异构调度及存储方案的协同优化,使模型运行时的内存需求较行业常规方案降低超过50%,并支持在智能手机上稳定运行。在高端内存成本居高不下的当下,这一方案让大参数MoE模型在端侧的规模化部署成为现实。

第六代骁龙8超级至尊版移动平台

第六代骁龙8超级至尊版移动平台

测试数据显示,该端侧方案的预填充吞吐性能超过每秒330个Token,解码吞吐性能超过每秒28个Token。预填充吞吐性能是大语言模型推理预填充阶段的关键指标,直接反映系统处理长提示词和批量请求的能力,超330 Token/s的水平意味着端侧模型能够流畅处理复杂的智能体任务输入。

高通表示,该方案无需调用云端服务,即可在本地完成邮件理解、行程规划、日历同步、航班及酒店推荐、行程分享和邮件草拟等多项任务。这意味着用户数据全程留存于设备端,在实现智能体主动服务的同时,提供了更强的隐私保护。

业内分析认为,大参数MoE模型在手机端的部署,有助于推动低时延和隐私保护型智能体应用的发展。与云端智能体相比,端侧方案在响应速度、数据隐私和离线可用性方面具有天然优势。不过,其实际规模化应用仍取决于终端成本、功耗、模型可靠性及用户接受度等多重因素。

“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。

Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”

热点新闻