A Zhituo lançou oficialmente o modelo grande GLM-5.3-FlashX a 18 de setembro, com uma velocidade máxima de inferência que pode atingir 200 tokens/s, destinado a proporcionar uma experiência de modelo mais rápida e fluida para empresas e desenvolvedores. Neste momento, a API do GLM-5.3-FlashX já está disponível. De acordo com a apresentação, para atender à crescente demanda dos utilizadores, a Zhituo aumentou ainda mais o investimento em Infra e otimização de inferência, com base na capacidade computacional dos chips nacionais existentes. O GLM-5.3-Flash mantém o nível de inteligência mais forte na mesma dimensão e possui uma relação custo-benefício extremamente alta, e esta aceleração reforçou ainda mais a sua competitividade global em termos de inteligência, preço e velocidade.
Segundo se sabe, o GLM-5.3-Flash, lançado anteriormente pela Zhituo, foi submetido a testes em larga escala sob o modelo anónimo "Ox Alpha" antes do seu lançamento oficial, recebendo ampla aceitação. Após o lançamento, o volume de chamadas continuou a subir, tendo alcançado o primeiro lugar no ranking de utilização da plataforma OpenRouter, ao mesmo tempo que estabeleceu novos recordes de chamadas nas plataformas OpenCode e OpenRouter. A Zhituo afirmou que foram investidos 100 mil chips nacionais para lidar com todos os pedidos de chamadas online do GLM-5.3-Flash.
Embora não tenha sido divulgada a fabricante específica dos chips, alguns analistas do setor especulam que é muito provável que sejam utilizados chips da série Ascend da Huawei.
Zhituo GLM-5.3-FlashX possui capacidade de inferência eficiente
No nível do agrupamento, a Zhituo adotou uma arquitetura EPD separada de nível de produção, dividindo a codificação multimodal, o preenchimento prévio de prompts e a decodificação token a token em pools de trabalho independentes e escaláveis, melhorando o desempenho do serviço de ponta a ponta em três vezes em relação à linha de base inicial, com eficiência de hardware e custo por token já a níveis comparáveis aos GPUs da NVIDIA. A Zhituo afirmou que esta otimização validou a capacidade dos chips nacionais de suportar de forma eficiente e económica as necessidades de inferência de modelos de ponta em cenários de grande escala.
Ler o artigo original em techritual.com (chinês tradicional) →
The TechRitual editorial desk in Hong Kong. Articles on TechRitual World are translated from the Traditional Chinese originals on techritual.com.

