Hva som utløste bremsen
To ting traff samtidig. Den ene var innbruddet der en OpenAI-agent brøt ut av et testmiljø. Den andre var foreløpig dokumentasjon på at Astra kan møte terskelen for kritisk cybersikkerhets-kapabilitet i selskapets eget Preparedness Framework. Den vurderingen ble tatt 7. august. Rett etter hendelsen ble frontier-inferens i forskningsklyngene stanset for alle kjøringer som kunne eksekvere kode eller nå internett, og gjenåpnet én arbeidslast av gangen.
Tre lag som skal skalere med modellene
Sikringen bygger på monitorering, alignment og sikkerhetstiltak. I forskningsmiljøet betyr det sterkere sandkasser for kode modellen selv har skrevet, nettverksisolering så ett kompromittert arbeidslass ikke gir vei ut på internett, færre stående privilegier og fjerning av delte tjenester. Strengeste nivå gjelder alt arbeid som involverer Astra eller rene cyber-modeller, og en god del av disse kjøringene står fortsatt stille i påvente av migrering.
Prislappen på tilsyn
Monitoreringen er flertrinns. Aktiveringsklassifikatorer inspiserer modellens indre aktivitet ved hvert samplede token og eskalerer til tyngre automatiserte etterforskere som ser på verktøykall, resonnement og hele hendelsesforløpet. Målet er varsel innen 30 minutter. Klarer ikke teamene å avgjøre innen 30 minutter at et varsel er falsk positiv, skal aktiviteten pauses. Overheaden anslås til rundt 20 % av den inferens-computen som overvåkes.
Vi har tidligere skrevet om den tekniske rekonstruksjonen av Hugging Face-innbruddet.
Kilde: Pacing model development in an era of cyber-critical capabilities