Prisen er poenget
GLM-5.3-Flash lister på $0,15 per million input-tokens, $0,03 for cachet input og $0,50 for output. Fram til 9. september halverer en lanseringskampanje det til $0,075 og $0,25.
Satt opp mot Anthropics prisliste:
| Modell | Inn $/1M | Ut $/1M |
|---|---|---|
| GLM-5.3-Flash | 0,15 | 0,50 |
| Claude Haiku 4.5 | 1,00 | 5,00 |
| Claude Sonnet 5 | 2,00 | 10,00 |
| Claude Opus 5 | 5,00 | 25,00 |
Output er der pengene forsvinner i agent-løkker, og der er GLM-5.3-Flash en tiendedel av Haiku 4.5 og en femtiendedel av Opus 5. Z.ai oppgir selv at modellen ligger rundt en tiendedel av prisen på GLM-5.2.
Hva du faktisk får
320 milliarder parametere totalt, 18 milliarder aktive per token. Det er en sparse MoE: bare en liten del av nettverket regner på hvert token, som er hele grunnen til at prisen kan ligge der den ligger.
Kontekstvinduet er 1 048 576 tokens med opptil 131 072 tokens output. Modellen tar inn tekst, bilder, video og filer, og er den første i GLM-5-serien med syn innebygd i selve modellen. Den kjører kun i thinking-modus, så du kan ikke skru av resonneringen for å spare tokens.
Vektene ligger på Hugging Face under MIT-lisens. Det er den løsere enden av skalaen for åpne vekter, og betyr at du kan kjøre den selv uten bruksbegrensninger fra leverandøren.
Tallene er leverandørens egne
Z.ai rapporterer at Flash slår Claude Opus 4.8 på DeepSWE, AutomationBench og GDPval-AA, men taper på Terminal-Bench 2.1. Publiserte scorer: DeepSWE v1.1 på 63,4 %, AutomationBench på 48,8 %, og 57 på Artificial Analysis Intelligence Index v4.1.1.
Modellen kjørte i seks dager anonymt som «Ox Alpha» på OpenRouter før Z.ai bekreftet identiteten 26. august. Det gir litt mer vekt til tallene enn en ren lanseringsgraf, siden folk brukte den uten å vite hva den var.
Men det er fortsatt leverandørens egne benchmarks på leverandørens egne oppgaver. Vi har skrevet om at markedet lager prisen, og en pris som ligger en tiendedel under alternativene er nettopp den typen signal som flytter prislistene til alle andre.
Kilde: z.ai/blog/glm-5.3-flash