Hva recurrent depth er
En vanlig transformer sender data gjennom en stakk av unike lag, én gang. Recurrent depth gjenbruker den samme stakken flere ganger og øker dermed kapasiteten uten å legge til parametere.
Den åpne modellen Nanbeige 4.2 gjør nettopp dette: 22 lag kjørt to ganger, altså 44 lag i praksis, med samme parametertall. Forskerne bak den fant at to runder ga den beste avveiningen og beholdt rundt 75 prosent av token-effektiviteten til en standard arkitektur. Flere runder ga marginal gevinst og mye høyere treningskostnad. Ideen har også en akademisk grunnlinje i NeurIPS-artikkelen «Mixture-of-recursions», som lar modellen selv bestemme antall runder per token.
Nyansen: teknikken er gammel, bruken er ny
Det som skjedde 2. september er ikke at noen fant opp løkkede transformere. Det er at et frontier-lab tar dem i bruk i en modell som skal ut til folk. Astra bruker etter rapporteringen teknikken i begrenset grad, ikke gjennomgående.
Hvorfor sikkerhetsfolk reagerer
Prisen er innsyn. Når resonnering flyttes inn i aktiveringene, blir det mindre igjen i tankekjeden å lese. Buck Shlegeris, sjef i Redwood Research, sier han er svært bekymret over rapporteringen om at Astra bruker opak rekurrens. Kollega Ryan Greenblatt peker på den naturlige fortsettelsen: at den opake resonneringen skaleres opp til modellen tenker helt eller nesten helt i latent rom. Zvi Mowshowitz kaller det å leke med ilden.
OpenAIs sjefforsker Jakub Pachocki svarer at selskapet har jobbet for å bevare og bruke tankekjede-tilsyn siden de første resonneringsmodellene. Det er verdt å huske at OpenAI satte RL-treningen på pause i to uker delvis på grunn av signaler rundt Astra, og at tilsynet allerede koster dem rundt 20 prosent av inferens-compute.
Det som endrer seg for deg
Hvis du reviderer en agent ved å lese tankekjeden, har du aldri revidert hele resonneringen. Du har lest en fortelling modellen produserte ved siden av arbeidet. Recurrent depth gjør bare avstanden mellom fortellingen og arbeidet større.
Det flytter tyngdepunktet for kontroll fra modellens egen tekst til laget rundt den: hvilke verktøy agenten har, hvilke rettigheter den har, og logg over hva den faktisk gjorde.
Kilde: techcrunch.com