Product
GLM-5.3 en GLM-5.3 Flash op GreenPT
GLM-5.3 van z.ai, het sterkste open-weight codeermodel, en de 320B Flash-variant met beeldbegrip draaien nu op GreenPT: duurzame EU-hosting, 1M tokens context, volledige privacy.
Twee nieuwe modellen van z.ai draaien vanaf vandaag op GreenPT: GLM-5.3, het sterkste open-weight codeermodel dat beschikbaar is, en GLM-5.3 Flash, een kleinere multimodale variant die een tiende kost. Beide draaien op honderd procent duurzame Europese energie via onze OpenAI-compatibele API, met een context van 1M tokens en zonder training op jouw data.
GLM-5.3: dezelfde basis, betere training
z.ai bracht GLM-5.3 uit op 14 augustus 2026 met een ongebruikelijk recept. Het basismodel is onveranderd ten opzichte van GLM-5.2, het mixture-of-experts-model van 753B dat sinds de lancering van GreenPT Code ons vlaggenschip voor codeerwerk is. In plaats van parameters schaalde z.ai de post-training op: meer omgevingen, meer verschillende taken en meer rekenkracht voor reinforcement learning.
Het resultaat is een model dat per taak zowel sterker als zuiniger is:
- Z.ai Code Bench stijgt van 23,4% naar 34,5% op maximale inspanning, een relatieve winst van 50%, terwijl het aantal uitvoertokens per taak daalt van ongeveer 96.000 naar 75.000.
- Terminal-Bench 3.0 klimt van 4,6 naar 28,3 en DeepSWE v1.1 van 46,2 naar 66,9, vlak achter Kimi K3 en Claude Fable 5.
- CyberGym, een benchmark voor het vinden van kwetsbaarheden, komt op 84,5%, het hoogste open-weight resultaat en volgens z.ai niet eens gepland.
Dat laatste verklaart waarom de weights twee weken na de API kwamen. z.ai hield ze vast voor een cybersecurity-evaluatie, en tijdens dat onderzoek vond het model 2.436 kwetsbaarheden in 269 open-sourceprojecten, waarvan 1.097 van gemiddelde tot hoge ernst. De weights verschenen op 28 augustus op Hugging Face onder de eigen licentie van z.ai in plaats van MIT.
Voor de meeste teams is de praktische samenvatting simpel: GLM-5.3 doet wat GLM-5.2 deed, beter, voor dezelfde prijs, en het gebruikt minder tokens om er te komen. Het is vanaf vandaag ons vlaggenschip voor codeerwerk en de standaardkeuze in al onze handleidingen voor codeeragents.
GLM-5.3 Flash: 18B actief, met ogen
GLM-5.3 Flash, uitgebracht op 26 augustus, is een ander model, geen gedistilleerde versie. Het is een mixture-of-experts-systeem van 320B dat 18B parameters per token activeert, elke token door 8 van de 288 experts stuurt, en het is het eerste GLM-5-model met native beeld- en video-invoer.
Drie architectuurkeuzes maken het goedkoop om te draaien:
- Hybride attention. Lineaire Kimi Delta Attention-lagen wisselen af met sparse attention-lagen, wat volgens z.ai ongeveer 3× minder attention-rekenwerk en een 4,4× kleinere KV-cache oplevert.
- IndexPool-compressie houdt ophalen uit een context van een miljoen tokens werkbaar.
- Native FP8-weights met één multi-token-prediction-laag, zodat de gepubliceerde checkpoint meteen de efficiënte versie is.
De benchmarks liggen dichter bij het vlaggenschip dan het aantal parameters doet vermoeden: 84,3 op Terminal-Bench 2.1 (Claude Opus 4.8 scoort 85,0), 63,4 op DeepSWE v1.1 en 29,0 op Z.ai Code Bench, tegenover 34,5 voor het vlaggenschip. De weights staan op Hugging Face onder de MIT-licentie.
Actieve parameters zijn het getal dat bij GreenPT telt, omdat ze de energie per token bepalen. Achttien miljard is minder dan de helft van wat GLM-5.2 activeert, en onze energieschattingen per verzoek voor glm-5.3-flash weerspiegelen dat.
Redeneren dat jij bepaalt
Beide modellen denken standaard na, en beide accepteren dezelfde vijf waarden van reasoning_effort op onze API: none, minimal, low, medium en high. Snelle vragen blijven goedkoop; een refactor van een nacht krijgt de aandacht die hij nodig heeft. Omdat redeneren standaard aan staat, geef je het Flash-model genoeg uitvoerbudget. Alle details staan in de documentatie over redeneren.
Open weights, Europese energie
We hosten open-weight modellen zelf in groene EU-datacenters. GLM-5.3 of GLM-5.3 Flash op GreenPT draaien betekent:
- 100% duurzame energie, met CO2- en energieverbruik per API-aanroep gerapporteerd.
- Verwerking in de EU en AVG-naleving, met verwerkersovereenkomsten op aanvraag.
- Geen training op jouw data. Geen opt-out. Nooit.
- Eén API. Beide modellen staan naast kimi-k3, glm-5.2 en de rest van de catalogus.
| Model | Invoer | Gecachte invoer | Uitvoer |
|---|---|---|---|
| glm-5.3 | €1,10 | €0,275 | €4,40 |
| glm-5.3-flash | €0,11 | €0,022 | €0,44 |
Prijzen zijn per miljoen tokens. glm-5.2 blijft beschikbaar voor dezelfde prijs als glm-5.3, samen met de compressievarianten Caveman, Ponytail en Honey.
Probeer ze
Wijs elke OpenAI-compatibele tool naar ons endpoint en kies een model:
Base URL: https://api.greenpt.ai/v1
API key: GREENPT_API_KEY
Model: glm-5.3 (of glm-5.3-flash)
Start een gratis proefperiode van 14 dagen, zonder creditcard: maak een account aan, kies glm-5.3 of glm-5.3-flash, en je draait het beste open-weight codeermodel op duurzame energie. De volledige specificaties staan in de modeldocumentatie.
Veelgestelde vragen
Wat is het verschil tussen GLM-5.3 en GLM-5.3 Flash?
GLM-5.3 is het vlaggenschip van z.ai: de GLM-5.2-basis van 753B met fors opgeschaalde post-training, gebouwd voor agentisch codeerwerk en toolgebruik. GLM-5.3 Flash is een apart, kleiner model van 320B dat 18B parameters per token activeert, native beeld- en video-invoer toevoegt en een tiende van de prijs kost. Beide lezen 1M tokens aan context en ondersteunen dezelfde redeneerniveaus.
Wat kosten GLM-5.3 en GLM-5.3 Flash op GreenPT?
GLM-5.3 kost €1,10 per miljoen invoertokens, €0,275 voor gecachte invoer en €4,40 per miljoen uitvoertokens. GLM-5.3 Flash kost €0,11 invoer, €0,022 gecacht en €0,44 uitvoer. Beide worden geleverd vanaf duurzame EU-infrastructuur via de OpenAI-compatibele GreenPT API.
Zijn de GLM-5.3-modellen open-weight?
Ja. GLM-5.3 Flash verscheen op 26 augustus 2026 op Hugging Face onder de MIT-licentie. GLM-5.3 volgde op 28 augustus onder een eigen z.ai-licentie, na twee weken cybersecurity-onderzoek. Beide draaien op GreenPT, dus je hoeft ze niet zelf te hosten.
Welk model kies ik voor een codeeragent?
Begin met glm-5.3 voor lange agentische sessies, zware refactors en alles waar correctheid per token telt. Gebruik glm-5.3-flash voor routinewijzigingen, pijplijnen met veel volume en taken met screenshots of video, waar het het grootste deel van de kracht van het vlaggenschip levert voor een tiende van de kosten.