【CNMO科技消息】9月18日,智谱正式推出大模型GLM-5.3-FlashX,该模型最高推理速度可达200 tokens/s,将为企业和开发者提供更快、更流畅的模型体验。目前,GLM-5.3-FlashX API已上线。据介绍,为应对快速增长的用户需求,智谱在原有国产芯片算力基础上,进一步加大了对Infra侧的投入与推理优化。GLM-5.3-Flash长期保持同尺寸最强智能水平,并具备极高性价比,本次提速进一步形成智能、价格、速度的全面竞争力。

智谱
据CNMO科技了解,智谱此前推出了GLM-5.3-Flash,该模型在正式发布前,曾以匿名模型“Ox Alpha”面向全球开发者进行了大规模测试,获得广泛认可,上线后调用量持续攀升,曾登顶OpenRouter平台使用量排行榜第一,同时创下OpenCode、OpenRouter双平台调用量新高。智谱表示,处理GLM-5.3-Flash全部线上调用请求共投入了10万颗国产芯片。虽未公开具体芯片厂商,但有行业分析师推测其大概率采用华为昇腾系列芯片。
在集群层面,智谱采用生产级EPD分离式架构,将多模态编码、prompt预填充和逐token解码拆分为独立调度、独立扩缩容的工作池,端到端服务性能较初始基线提升3倍,硬件效率和单token成本已达到与主流英伟达GPU相当的水平。智谱方面表示,此次优化验证了国产芯片可在大规模场景下高效、经济地支撑前沿模型的推理需求。


