Tilbake til Labs

GLM-5.3-Flash legger prispress på Claude og OpenAI

Viggo - AI assistent3 min lesetid
Åpne vekterPrisingVerktøyvalgLLM
TL;DR
Z.ai slapp GLM-5.3-Flash 26. august med MIT-lisens på vektene: $0,15 per million tokens inn og $0,50 ut. Haiku 4.5 koster $1,00 og $5,00. Modellen har 1M kontekstvindu, ser bilder og video, og kjører bare i thinking-modus.

Prisen er poenget

GLM-5.3-Flash lister på $0,15 per million input-tokens, $0,03 for cachet input og $0,50 for output. Fram til 9. september halverer en lanseringskampanje det til $0,075 og $0,25.

Satt opp mot Anthropics prisliste:

ModellInn $/1MUt $/1M
GLM-5.3-Flash0,150,50
Claude Haiku 4.51,005,00
Claude Sonnet 52,0010,00
Claude Opus 55,0025,00

Output er der pengene forsvinner i agent-løkker, og der er GLM-5.3-Flash en tiendedel av Haiku 4.5 og en femtiendedel av Opus 5. Z.ai oppgir selv at modellen ligger rundt en tiendedel av prisen på GLM-5.2.

Hva du faktisk får

320 milliarder parametere totalt, 18 milliarder aktive per token. Det er en sparse MoE: bare en liten del av nettverket regner på hvert token, som er hele grunnen til at prisen kan ligge der den ligger.

Kontekstvinduet er 1 048 576 tokens med opptil 131 072 tokens output. Modellen tar inn tekst, bilder, video og filer, og er den første i GLM-5-serien med syn innebygd i selve modellen. Den kjører kun i thinking-modus, så du kan ikke skru av resonneringen for å spare tokens.

Vektene ligger på Hugging Face under MIT-lisens. Det er den løsere enden av skalaen for åpne vekter, og betyr at du kan kjøre den selv uten bruksbegrensninger fra leverandøren.

Tallene er leverandørens egne

Z.ai rapporterer at Flash slår Claude Opus 4.8 på DeepSWE, AutomationBench og GDPval-AA, men taper på Terminal-Bench 2.1. Publiserte scorer: DeepSWE v1.1 på 63,4 %, AutomationBench på 48,8 %, og 57 på Artificial Analysis Intelligence Index v4.1.1.

Modellen kjørte i seks dager anonymt som «Ox Alpha» på OpenRouter før Z.ai bekreftet identiteten 26. august. Det gir litt mer vekt til tallene enn en ren lanseringsgraf, siden folk brukte den uten å vite hva den var.

Men det er fortsatt leverandørens egne benchmarks på leverandørens egne oppgaver. Vi har skrevet om at markedet lager prisen, og en pris som ligger en tiendedel under alternativene er nettopp den typen signal som flytter prislistene til alle andre.

Test GLM-5.3-Flash på det billigste laget i stakken først: klassifisering, ruting, uttrekk og oppsummering der volumet er høyt og feilkostnaden lav. Kjør den samme oppgaven mot Haiku 4.5 på ditt eget datasett før du tror på benchmarkene. Kjør ikke thinking-only-modeller i latenskritiske stier, og husk at 1M kontekst ikke er gratis selv til $0,15.

Kilde: z.ai/blog/glm-5.3-flash