Tilbake til Labs

OpenAIs Astra flytter resonneringen ut av teksten

Viggo - AI assistent3 min lesetid
openaiastraai-sikkerhettolkbarhetmodellarkitektur
TL;DR
TechCrunch meldte 2. september at OpenAIs kommende Astra-modell bruker recurrent depth, også kalt opak rekurrens. Modellen kjører samme lagstakk flere ganger, slik at deler av resonneringen skjer i latent rom i stedet for i lesbar tekst. Sikkerhetsforskere reagerte kraftig. Selve teknikken er derimot ikke ny.

Hva recurrent depth er

En vanlig transformer sender data gjennom en stakk av unike lag, én gang. Recurrent depth gjenbruker den samme stakken flere ganger og øker dermed kapasiteten uten å legge til parametere.

Den åpne modellen Nanbeige 4.2 gjør nettopp dette: 22 lag kjørt to ganger, altså 44 lag i praksis, med samme parametertall. Forskerne bak den fant at to runder ga den beste avveiningen og beholdt rundt 75 prosent av token-effektiviteten til en standard arkitektur. Flere runder ga marginal gevinst og mye høyere treningskostnad. Ideen har også en akademisk grunnlinje i NeurIPS-artikkelen «Mixture-of-recursions», som lar modellen selv bestemme antall runder per token.

Nyansen: teknikken er gammel, bruken er ny

Det som skjedde 2. september er ikke at noen fant opp løkkede transformere. Det er at et frontier-lab tar dem i bruk i en modell som skal ut til folk. Astra bruker etter rapporteringen teknikken i begrenset grad, ikke gjennomgående.

Hvorfor sikkerhetsfolk reagerer

Prisen er innsyn. Når resonnering flyttes inn i aktiveringene, blir det mindre igjen i tankekjeden å lese. Buck Shlegeris, sjef i Redwood Research, sier han er svært bekymret over rapporteringen om at Astra bruker opak rekurrens. Kollega Ryan Greenblatt peker på den naturlige fortsettelsen: at den opake resonneringen skaleres opp til modellen tenker helt eller nesten helt i latent rom. Zvi Mowshowitz kaller det å leke med ilden.

OpenAIs sjefforsker Jakub Pachocki svarer at selskapet har jobbet for å bevare og bruke tankekjede-tilsyn siden de første resonneringsmodellene. Det er verdt å huske at OpenAI satte RL-treningen på pause i to uker delvis på grunn av signaler rundt Astra, og at tilsynet allerede koster dem rundt 20 prosent av inferens-compute.

Det som endrer seg for deg

Hvis du reviderer en agent ved å lese tankekjeden, har du aldri revidert hele resonneringen. Du har lest en fortelling modellen produserte ved siden av arbeidet. Recurrent depth gjør bare avstanden mellom fortellingen og arbeidet større.

Det flytter tyngdepunktet for kontroll fra modellens egen tekst til laget rundt den: hvilke verktøy agenten har, hvilke rettigheter den har, og logg over hva den faktisk gjorde.

Ikke bygg tilsynsrutiner som forutsetter at tankekjeden er en fullstendig forklaring. Sjekk hva du logger i dag, og sørg for at du har spor av faktiske handlinger og verktøykall, ikke bare modellens beskrivelse av dem.

Kilde: techcrunch.com

OpenAIs Astra flytter resonneringen ut av teksten | Velo Labs