Zhiyu hat am 18. September das große Modell GLM-5.3-FlashX offiziell vorgestellt, dessen maximale Inferenzgeschwindigkeit bis zu 200 Tokens/s beträgt und das darauf abzielt, Unternehmen und Entwicklern eine schnellere und flüssigere Modellerfahrung zu bieten. Der API von GLM-5.3-FlashX ist bereits online. Laut den Informationen hat Zhiyu, um der schnell wachsenden Nutzeranfrage gerecht zu werden, die Investitionen in die Infra-Seite und die Inferenzoptimierung auf der Grundlage der bestehenden Rechenleistung inländischer Chips weiter erhöht. GLM-5.3-Flash bleibt auf dem gleichen Größeniveau das leistungsstärkste intelligente Modell und bietet ein hervorragendes Preis-Leistungs-Verhältnis. Die Geschwindigkeitssteigerung hat seine umfassende Wettbewerbsfähigkeit in Bezug auf Intelligenz, Preis und Geschwindigkeit weiter gestärkt.
Nach Informationen hat Zhiyu das zuvor veröffentlichte GLM-5.3-Flash vor der offiziellen Veröffentlichung unter dem anonymen Modell „Ox Alpha“ einem großflächigen Test mit globalen Entwicklern unterzogen, der weitreichende Anerkennung fand. Nach dem Launch stieg die Abrufmenge kontinuierlich an und erreichte den ersten Platz in der Nutzungsstatistik der OpenRouter-Plattform, während gleichzeitig neue Höchstwerte in der Abrufmenge auf den Plattformen OpenCode und OpenRouter erzielt wurden. Zhiyu gab an, dass für die Bearbeitung aller Online-Abrufanfragen von GLM-5.3-Flash insgesamt 100.000 inländische Chips eingesetzt wurden.
Obwohl die spezifischen Chip-Hersteller nicht bekannt gegeben wurden, vermuten Branchenanalysten, dass wahrscheinlich Chips der Huawei Ascend-Serie verwendet werden.
Zhiyu GLM-5.3-FlashX bietet effiziente Inferenzfähigkeiten
Auf der Cluster-Ebene verwendet Zhiyu eine produktionsgerechte EPD-getrennte Architektur, die multimodale Kodierung, Prompt-Vorbefüllung und tokenweise Dekodierung in unabhängige Arbeitspools mit separater Planung und Skalierung aufteilt. Die End-to-End-Serviceleistung hat sich im Vergleich zur ursprünglichen Basislinie verdreifacht, und die Hardwareeffizienz sowie die Kosten pro Token haben ein Niveau erreicht, das mit den gängigen NVIDIA-GPUs vergleichbar ist. Zhiyu erklärte, dass diese Optimierung die Fähigkeit inländischer Chips validiert hat, die Inferenzanforderungen fortschrittlicher Modelle in großflächigen Szenarien effizient und wirtschaftlich zu unterstützen.
Originalartikel auf techritual.com lesen (traditionelles Chinesisch) →
The TechRitual editorial desk in Hong Kong. Articles on TechRitual World are translated from the Traditional Chinese originals on techritual.com.

