智谱推出 GLM-5.3-FlashX 大模型 最高推理速度达到 200 tokens/s

·作者 TechRitual Editorial·AI - 人工智能
智谱推出 GLM-5.3-FlashX 大模型 最高推理速度达到 200 tokens/s
✏️ 原创内容| TechRitual World 编辑部

智谱于 9 月 18 日正式推出大模型 GLM-5.3-FlashX,该模型的最高推理速度可达 200 tokens/s,旨在为企业和开发者提供更快、更流畅的模型体验。目前,GLM-5.3-FlashX 的 API 已经上线。根据介绍,为应对快速增长的用户需求,智谱在原有国产芯片算力基础上,进一步加大了对 Infra 方面的投入与推理优化。GLM-5.3-Flash 仍然保持同尺寸最强的智能水平,并具备极高性价比,此次提速进一步增强了其在智能、价格和速度上的全面竞争力。

据了解,智谱此前推出的 GLM-5.3-Flash 在正式发布前,以匿名模型「Ox Alpha」面向全球开发者进行了大规模测试,获得了广泛认可。上线后的调用量持续攀升,曾登顶 OpenRouter 平台使用量排行榜第一,同时创下 OpenCode 和 OpenRouter 双平台调用量新高。智谱表示,处理 GLM-5.3-Flash 所有线上调用请求共投入了 10 万颗国产芯片。

虽然未公开具体芯片厂商,但有行业分析师推测其大概率采用华为昇腾系列芯片。

智谱 GLM-5.3-FlashX 具备高效推理能力

在集群层面,智谱采用生产级 EPD 分离式架构,将多模态编码、prompt 预填充和逐 token 解码拆分为独立调度、独立扩缩容的工作池,端到端服务性能较初始基线提升三倍,硬件效率和单 token 成本已达到与主流英伟达 GPU 相当的水平。智谱方面表示,此次优化验证了国产芯片在大规模场景下高效、经济地支撑前沿模型的推理需求。

阅读 techritual.com 繁体中文原文

T
关于作者
TechRitual Editorial

The TechRitual editorial desk in Hong Kong. Articles on TechRitual World are translated from the Traditional Chinese originals on techritual.com.