Hva abliterering gjør med en modell
Abliterering er ikke en prompt eller et jailbreak som må gjentas for hver samtale. Teknikken finner retningene i modellens aktiveringer som produserer avslag, og fjerner dem fra vektene. Kode-, cyber- og agentevnene blir stående igjen. Resultatet er en modell som ikke stopper midt i en kjede fordi neste steg ser ubehagelig ut.
Nytt som produkt, ikke som teknikk
Abliterte modeller er ikke nytt. Hugging Face har vært fullt av dem i årevis, stort sett bygget på små åpne modeller du kjører selv. Det nye her er distribusjonen: en modell nær toppen på kapabilitetstester for kode, driftet av noen andre, med OpenAI-kompatibelt endepunkt og betaling med kort. Terskelen flyttes fra "har du GPU-er og kompetanse" til "har du et kortnummer".
Tallene som gjør akkurat 5.3 interessant
GLM-5.3 kom 14. august, med åpne vekter på Hugging Face 28. august etter en intern sikkerhetsgjennomgang. På CyberGym, som måler evnen til å finne og validere sårbarheter, scorer den 84,5 prosent, foran Mythos 5 på 83,8 og GPT-5.6 Sol på 83,6. Zhipu skriver selv at cyber-evnen vokste raskere enn ventet under post-treningen, og at modellen begynte å resonnere over flere steg i en angrepskjede i stedet for å finne enkeltfeil. Abliteration.ai oppgir en dobling fra 5.2 på ExploitBench, fra 24,4 til 54,4, og 105 fullførte oppgaver på ExploitGym på to timer mot 29 for forrige versjon.
Det som endrer seg for deg
Antakelsen om at en angriper mangler kapasitet holder ikke lenger som forsvarslinje. Den kapasiteten koster nå 5 dollar per million tokens. Det som fortsatt holder er det kjedelige: tjenestekontoer med minst mulig rettigheter, tokens som utløper, logging av hva agentene faktisk kaller, og en oversikt over hvilke MCP-servere og integrasjoner som har skrivetilgang i systemene dine. Modellsperrer har aldri vært et sikkerhetslag. Nå er det bare tydeligere at de ikke er det.
Kilde: x.com