Product
GLM-5.3 und GLM-5.3 Flash auf GreenPT
GLM-5.3 von z.ai, das stärkste Open-Weight-Coding-Modell, und die 320B-Flash-Variante mit Bildverständnis laufen jetzt auf GreenPT: grünes EU-Hosting, 1M Tokens Kontext, volle Privatsphäre.
Zwei neue Modelle von z.ai laufen ab heute auf GreenPT: GLM-5.3, das stärkste verfügbare Open-Weight-Coding-Modell, und GLM-5.3 Flash, ein kleineres multimodales Schwestermodell zu einem Zehntel des Preises. Beide laufen über unsere OpenAI-kompatible API auf 100 % erneuerbarer europäischer Energie, mit 1M Tokens Kontext und ohne Training auf Ihren Daten.
GLM-5.3: gleiche Basis, besseres Training
z.ai veröffentlichte GLM-5.3 am 14. August 2026 mit einem ungewöhnlichen Rezept. Das Basismodell ist unverändert gegenüber GLM-5.2, dem Mixture-of-Experts-Modell mit 753B Parametern, das seit dem Start von GreenPT Code unser Flaggschiff fürs Coding ist. Statt Parameter zu skalieren, skalierte z.ai das Post-Training: mehr Umgebungen, vielfältigere Aufgaben und mehr Rechenleistung für Reinforcement Learning.
Das Ergebnis ist ein Modell, das pro Aufgabe stärker und zugleich sparsamer ist:
- Z.ai Code Bench steigt bei maximalem Aufwand von 23,4 % auf 34,5 %, ein relativer Gewinn von 50 %, während die Output-Tokens pro Aufgabe von rund 96.000 auf 75.000 sinken.
- Terminal-Bench 3.0 klettert von 4,6 auf 28,3 und DeepSWE v1.1 von 46,2 auf 66,9, knapp hinter Kimi K3 und Claude Fable 5.
- CyberGym, ein Benchmark für das Aufspüren von Schwachstellen, erreicht 84,5 %, das beste Open-Weight-Ergebnis und laut z.ai nicht einmal geplant.
Dieser letzte Punkt erklärt, warum die Gewichte zwei Wochen nach der API kamen. z.ai hielt sie für eine Cybersecurity-Bewertung zurück, und während dieser Prüfung fand das Modell 2.436 Schwachstellen in 269 Open-Source-Projekten, 1.097 davon mit mittlerem bis hohem Schweregrad. Die Gewichte erschienen am 28. August auf Hugging Face unter der eigenen Lizenz von z.ai statt unter MIT.
Für die meisten Teams ist die praktische Zusammenfassung einfach: GLM-5.3 tut, was GLM-5.2 tat, besser, zum gleichen Preis, und es braucht weniger Tokens dafür. Es ist ab heute unser Flaggschiff fürs Coding und die Standardempfehlung in allen unseren Anleitungen für Coding-Agents.
GLM-5.3 Flash: 18B aktiv, mit Augen
GLM-5.3 Flash, veröffentlicht am 26. August, ist ein eigenes Modell, keine destillierte Version. Es ist ein Mixture-of-Experts-System mit 320B Parametern, das 18B pro Token aktiviert, jeden Token durch 8 von 288 Experten leitet, und es ist das erste GLM-5-Modell mit nativer Bild- und Videoeingabe.
Drei Architekturentscheidungen machen es günstig im Betrieb:
- Hybride Attention. Lineare Kimi-Delta-Attention-Schichten wechseln sich mit Sparse-Attention-Schichten ab, was z.ai mit rund 3× weniger Attention-Rechenaufwand und einem 4,4× kleineren KV-Cache angibt.
- IndexPool-Kompression hält das Abrufen aus einer Million Tokens Kontext handhabbar.
- Native FP8-Gewichte mit einer Multi-Token-Prediction-Schicht, sodass der veröffentlichte Checkpoint bereits die effiziente Version ist.
Die Benchmarks liegen näher am Flaggschiff, als die Parameterzahl vermuten lässt: 84,3 auf Terminal-Bench 2.1 (Claude Opus 4.8 erreicht 85,0), 63,4 auf DeepSWE v1.1 und 29,0 auf Z.ai Code Bench, gegenüber 34,5 beim Flaggschiff. Die Gewichte liegen auf Hugging Face unter der MIT-Lizenz.
Aktive Parameter sind die Zahl, die bei GreenPT zählt, weil sie die Energie pro Token bestimmen. Achtzehn Milliarden sind weniger als die Hälfte dessen, was GLM-5.2 aktiviert, und unsere Energieschätzungen pro Anfrage für glm-5.3-flash spiegeln das wider.
Reasoning, das Sie steuern
Beide Modelle denken standardmäßig nach, und beide akzeptieren dieselben fünf Werte für reasoning_effort auf unserer API: none, minimal, low, medium und high. Schnelle Abfragen bleiben günstig; ein Refactoring über Nacht bekommt die nötige Bedenkzeit. Weil Reasoning standardmäßig aktiv ist, geben Sie dem Flash-Modell genug Output-Budget dafür. Alle Details stehen in der Reasoning-Dokumentation.
Offene Gewichte, europäische Energie
Wir hosten Open-Weight-Modelle selbst in grünen EU-Rechenzentren. GLM-5.3 oder GLM-5.3 Flash auf GreenPT zu betreiben bedeutet:
- 100 % erneuerbare Energie, mit CO2- und Energieverbrauch pro API-Aufruf ausgewiesen.
- Verarbeitung in der EU und DSGVO-Konformität, mit Auftragsverarbeitungsverträgen auf Anfrage.
- Kein Training auf Ihren Daten. Kein Opt-out. Niemals.
- Eine API. Beide Modelle stehen neben kimi-k3, glm-5.2 und dem Rest des Katalogs.
| Modell | Eingabe | Gecachte Eingabe | Ausgabe |
|---|---|---|---|
| glm-5.3 | 1,10 € | 0,275 € | 4,40 € |
| glm-5.3-flash | 0,11 € | 0,022 € | 0,44 € |
Preise gelten pro Million Tokens. glm-5.2 bleibt zum Preis von glm-5.3 verfügbar, zusammen mit den Kompressionsvarianten Caveman, Ponytail und Honey.
Ausprobieren
Richten Sie ein beliebiges OpenAI-kompatibles Tool auf unseren Endpunkt und wählen Sie ein Modell:
Base URL: https://api.greenpt.ai/v1
API key: GREENPT_API_KEY
Model: glm-5.3 (oder glm-5.3-flash)
Starten Sie eine kostenlose 14-tägige Testphase ohne Kreditkarte: Konto anlegen, glm-5.3 oder glm-5.3-flash wählen, und Sie betreiben das beste Open-Weight-Coding-Modell auf erneuerbarer Energie. Die vollständigen Spezifikationen stehen in der Modelldokumentation.
Häufig gestellte Fragen
Was ist der Unterschied zwischen GLM-5.3 und GLM-5.3 Flash?
GLM-5.3 ist das Flaggschiff von z.ai: die GLM-5.2-Basis mit 753B Parametern und stark skaliertem Post-Training, gebaut für agentisches Coding und Tool-Nutzung. GLM-5.3 Flash ist ein eigenständiges, kleineres Modell mit 320B Parametern, das 18B pro Token aktiviert, native Bild- und Videoeingabe mitbringt und ein Zehntel kostet. Beide lesen 1M Tokens Kontext und unterstützen dieselben Reasoning-Stufen.
Was kosten GLM-5.3 und GLM-5.3 Flash auf GreenPT?
GLM-5.3 kostet 1,10 € pro Million Eingabe-Tokens, 0,275 € für gecachte Eingabe und 4,40 € pro Million Ausgabe-Tokens. GLM-5.3 Flash kostet 0,11 € Eingabe, 0,022 € gecacht und 0,44 € Ausgabe. Beide werden über die OpenAI-kompatible GreenPT API aus erneuerbarer EU-Infrastruktur bereitgestellt.
Sind die GLM-5.3-Modelle Open-Weight?
Ja. GLM-5.3 Flash erschien am 26. August 2026 auf Hugging Face unter der MIT-Lizenz. GLM-5.3 folgte am 28. August unter einer eigenen z.ai-Lizenz, nach zwei Wochen Cybersecurity-Prüfung. Beide laufen auf GreenPT, Sie müssen sie also nicht selbst hosten.
Welches Modell eignet sich für einen Coding-Agent?
Starten Sie mit glm-5.3 für lange agentische Sessions, schwere Refactorings und alles, bei dem Korrektheit pro Token zählt. Nutzen Sie glm-5.3-flash für Routineänderungen, Pipelines mit hohem Volumen und Aufgaben mit Screenshots oder Video, wo es den Großteil der Flaggschiff-Leistung zu einem Zehntel der Kosten liefert.