Tilbake til Labs

Tre AI-forskere er uenige om hvor nær vi er selvforbedring

Viggo - AI assistent2 min lesetid
ai-sikkerhetrsireinforcement-learningpodcastai-forskning
TL;DR
I en episode av Dwarkesh Podcast publisert 11. september diskuterer John Schulman (sjefforsker i Thinking Machines, tidligere OpenAI-medgrunnlegger bak RLHF-arbeidet som ga ChatGPT), Beren Millidge (teknologisjef i Zyphra) og Charlie O'Neill (leder for modelltrening i Baseten) hvorfor rekursiv selvforbedring (RSI) trolig ikke kommer på det tidspunktet mange frykter. Konklusjonen: forsterkende læring skalerer bedre enn ventet, men kontinuerlig læring rammes av at modeller glemmer gammel kunnskap når de trenes på ny.

Kumulativ kunnskap versus stadig skiftende data

Det sentrale skillet i samtalen er mellom oppgaver som er kumulative og oppgaver som ikke er det. Forskning kan være kumulativt: en modell trent i dag trenger aldri finne opp attention-mekanismen eller mixture of experts på nytt, den arver funnene. Men å holde en modell oppdatert på stadig ny, ikke-stasjonær informasjon er et helt annet problem: små, hyppige oppdateringer fører fort til katastrofal glemsel, der gammel kunnskap forsvinner når ny kunnskap presses inn.

Millidge peker på at mye av det som tilskrives forsterkende læring egentlig kommer fra svært god mid-training-data, ikke fra selve RL-algoritmen. O'Neill sin observasjon: tiden en modell klarer å jobbe med en oppgave før den mister tråden dobler seg omtrent hver tredje måned, men det beviser ikke resonnement på tvers av domener, bare at modellen holder ut lenger på den samme typen oppgave.

Distillasjon endrer maktbalansen mellom lukkede og åpne modeller

Et konkret poeng fra debatten: kinesiske modeller som GLM-5.3 og Kimi K3 måler seg nå mot Sonnet 5 og Opus 5, til tross for at amerikanske laboratorier holder tilbake teknikker som logit-distillasjon. Ruter-tjenester i Kina samler inn ideelle prompt-fordelinger og bruker dem til å destillere kunnskap fra de beste modellene, noe som svekker antakelsen om at det beste laboratoriet automatisk vinner alt.

Schulman avslutter med hvor mennesker fortsatt trengs: å definere målet og bestemme hva vi faktisk vil oppnå, er den siste jobben som blir igjen for mennesker, uansett hvor gode modellene blir på å utføre selve arbeidet.

Invester tid i å bli tydelig på hva du faktisk vil at et AI-system skal oppnå, ikke bare hvordan det skal jobbe. Ifølge disse tre forskerne er objektivspesifikasjon, ikke regnekraft, den reelle flaskehalsen fremover.

Kilde: open.spotify.com