GLM-5.3-Flash läuft ohne Nvidia und ist 7,5-mal günstiger
GLM-5.3-Flash von Z.ai erreicht fast die Leistung von GLM-5.3, kostet pro Aufgabe aber 7,5-mal weniger und lief beim Testlauf komplett auf chinesischen KI-Chips statt auf Nvidia-Hardware.

Z.ai hat mit GLM-5.3-Flash ein Modell veröffentlicht, das zwei Dinge gleichzeitig zeigt: chinesische KI-Chips können inzwischen ohne Nvidia-Hardware auskommen, und ein deutlich günstigeres Modell muss kaum schlechter sein als sein großer Bruder. Für Unternehmen, die KI-Kosten im Blick behalten oder unabhängiger von einzelnen Hardware-Anbietern werden wollen, ist das ein Signal, das über ein einzelnes Modell-Release hinausgeht.
Was ist passiert?
Z.ai hat GLM-5.3-Flash als erstes nativ multimodales Modell der GLM-5-Serie vorgestellt. Es verfügt über 320 Milliarden Gesamtparameter, von denen nur 18 Milliarden aktiv sind, steht unter MIT-Lizenz und bietet ein Kontextfenster von einer Million Token. Die Gewichte stehen auf Hugging Face zum Download bereit.
Nach Messungen von Artificial Analysis erreicht das Modell im Intelligence Index 57 Punkte und liegt damit nur drei Punkte hinter dem größeren GLM-5.3 mit 60 Punkten. Bei den Kosten ist der Abstand deutlich größer: Eine Aufgabe im Index kostet bei GLM-5.3-Flash rund 0,09 US-Dollar, bei GLM-5.3 dagegen 0,68 US-Dollar, ein Faktor von etwa 7,5. Auf der API von Z.ai liegt der Preis bei 0,15 US-Dollar pro Million Input-Token und 0,50 US-Dollar pro Million Output-Token, gut zehn Prozent des Preises von GLM-5.3.

Bei agentischen Aufgaben zieht das kleinere Modell mit dem großen fast gleich: Auf dem GDPval-AA-Benchmark erreicht GLM-5.3-Flash einen Elo-Wert von rund 1770, ebenbürtig mit GLM-5.3 und Grok 4.6, nur hinter Claude Opus 5. Ein Nachteil bleibt die Effizienz: Laut Artificial Analysis entfielen rund 90 Prozent der verbrauchten Output-Token auf internes Reasoning statt auf die eigentliche Antwort.
Chinesische Chips statt Nvidia
Bemerkenswert ist der Infrastruktur-Hintergrund: Vor dem offiziellen Start lief das Modell anonym unter dem Namen "ox-alpha" auf OpenCode und OpenRouter, wo es zum meistgenutzten Modell der Woche wurde. Der gesamte Traffic dabei lief laut Z.ai auf chinesischen KI-Chips, nicht auf Nvidia-Hardware.
Laut SemiAnalysis wurden dabei bis zu 100 Billionen Token pro Tag ausgeliefert, eine Kapazität, die bislang nur den führenden westlichen KI-Laboren zugetraut wurde. Z.ai beziffert Hardware-Effizienz und Kosten pro Token als vergleichbar mit gängigen Nvidia-GPUs.
Möglich wurde das durch eine eigene Auslieferungssoftware auf Basis von SGLang, bei der die Verarbeitung in einzeln skalierbare Stufen zerlegt wurde. Nach eigenen Angaben verdreifachte Z.ai so den Durchsatz gegenüber dem ersten Versuch auf derselben Hardware. Hintergrund ist die sogenannte CUDA-Abhängigkeit: Nvidias Programmierschicht CUDA ist seit fast 20 Jahren gewachsen, praktisch jedes KI-Framework ist darauf zugeschnitten. Wer auf andere Chips wechselt, muss Rechenoperationen, Speicherzugriffe und Engpässe neu optimieren, woran bisherige Nvidia-Konkurrenten oft gescheitert sind.
Für wen ist das relevant?
Für Admins und Entwicklerteams, die GLM-5.3-Flash bereits über Ollama nutzen, ändert sich an der praktischen Handhabung nichts, das Modell bleibt wie gewohnt über glm-5.3-flash:cloud abrufbar. Interessant ist vor allem der Preis-Leistungs-Aspekt für alle, die KI-Agenten für Coding- oder Automatisierungsaufgaben produktiv einsetzen und dabei auf laufende API-Kosten achten. Für IT-Entscheider ist zudem relevant, dass ein zunehmender Teil der KI-Infrastruktur nicht mehr zwingend an Nvidia-Hardware gebunden ist, ein Trend, der mittelfristig auch Preise und Verfügbarkeit bei anderen Anbietern beeinflussen kann.
Einordnung
GLM-5.3-Flash reiht sich in eine Reihe chinesischer Modelle ein, die zuletzt spürbaren Preisdruck auf westliche Anbieter ausüben. Laut Artificial Analysis liegt das Modell auf der sogenannten Pareto-Grenze aus Intelligenz und Kosten, es bietet also für seinen Preis ein besonders gutes Verhältnis aus Leistung und Kosten im Vergleich zu anderen verfügbaren Modellen.
Quellen
- THE DECODER: Chinesisches KI-Modell GLM-5.3-Flash läuft ohne Nvidia
- Ollama: GLM-5.3-Flash Modellseite
- Z.ai: GLM-5.3-Flash Ankündigung