智谱于 9 月 18 日正式推出大模型 GLM-5.3-FlashX,该模型的最高推理速度可达 200 tokens/s,旨在为企业和开发者提供更快、更流畅的模型体验。目前,GLM-5.3-FlashX 的 API 已经上线。根据介绍,为应对快速增长的用户需求,智谱在原有国产芯片算力基础上,进一步加大了对 Infra 方面的投入与推理优化。GLM-5.3-Flash 仍然保持同尺寸最强的智能水平,并具备极高性价比,此次提速进一步增强了其在智能、价格和速度上的全面竞争力。
据了解,智谱此前推出的 GLM-5.3-Flash 在正式发布前,以匿名模型「Ox Alpha」面向全球开发者进行了大规模测试,获得了广泛认可。上线后的调用量持续攀升,曾登顶 OpenRouter 平台使用量排行榜第一,同时创下 OpenCode 和 OpenRouter 双平台调用量新高。智谱表示,处理 GLM-5.3-Flash 所有线上调用请求共投入了 10 万颗国产芯片。
虽然未公开具体芯片厂商,但有行业分析师推测其大概率采用华为昇腾系列芯片。
智谱 GLM-5.3-FlashX 具备高效推理能力
在集群层面,智谱采用生产级 EPD 分离式架构,将多模态编码、prompt 预填充和逐 token 解码拆分为独立调度、独立扩缩容的工作池,端到端服务性能较初始基线提升三倍,硬件效率和单 token 成本已达到与主流英伟达 GPU 相当的水平。智谱方面表示,此次优化验证了国产芯片在大规模场景下高效、经济地支撑前沿模型的推理需求。
The TechRitual editorial desk in Hong Kong. Articles on TechRitual World are translated from the Traditional Chinese originals on techritual.com.

