智谱推出GLM-5.3-FlashX 推理速度最高达200 tokens/s

CNMO科技
 来自北京

【CNMO科技消息】9月18日,智谱正式推出大模型GLM-5.3-FlashX,该模型最高推理速度可达200 tokens/s,将为企业和开发者提供更快、更流畅的模型体验。目前,GLM-5.3-FlashX API已上线。据介绍,为应对快速增长的用户需求,智谱在原有国产芯片算力基础上,进一步加大了对Infra侧的投入与推理优化。GLM-5.3-Flash长期保持同尺寸最强智能水平,并具备极高性价比,本次提速进一步形成智能、价格、速度的全面竞争力。

智谱

智谱

据CNMO科技了解,智谱此前推出了GLM-5.3-Flash,该模型在正式发布前,曾以匿名模型“Ox Alpha”面向全球开发者进行了大规模测试,获得广泛认可,上线后调用量持续攀升,曾登顶OpenRouter平台使用量排行榜第一,同时创下OpenCode、OpenRouter双平台调用量新高。智谱表示,处理GLM-5.3-Flash全部线上调用请求共投入了10万颗国产芯片。虽未公开具体芯片厂商,但有行业分析师推测其大概率采用华为昇腾系列芯片。

在集群层面,智谱采用生产级EPD分离式架构,将多模态编码、prompt预填充和逐token解码拆分为独立调度、独立扩缩容的工作池,端到端服务性能较初始基线提升3倍,硬件效率和单token成本已达到与主流英伟达GPU相当的水平。智谱方面表示,此次优化验证了国产芯片可在大规模场景下高效、经济地支撑前沿模型的推理需求。

“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。

Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”

热点新闻