Kumulativ kunnskap versus stadig skiftende data
Det sentrale skillet i samtalen er mellom oppgaver som er kumulative og oppgaver som ikke er det. Forskning kan være kumulativt: en modell trent i dag trenger aldri finne opp attention-mekanismen eller mixture of experts på nytt, den arver funnene. Men å holde en modell oppdatert på stadig ny, ikke-stasjonær informasjon er et helt annet problem: små, hyppige oppdateringer fører fort til katastrofal glemsel, der gammel kunnskap forsvinner når ny kunnskap presses inn.
Millidge peker på at mye av det som tilskrives forsterkende læring egentlig kommer fra svært god mid-training-data, ikke fra selve RL-algoritmen. O'Neill sin observasjon: tiden en modell klarer å jobbe med en oppgave før den mister tråden dobler seg omtrent hver tredje måned, men det beviser ikke resonnement på tvers av domener, bare at modellen holder ut lenger på den samme typen oppgave.
Distillasjon endrer maktbalansen mellom lukkede og åpne modeller
Et konkret poeng fra debatten: kinesiske modeller som GLM-5.3 og Kimi K3 måler seg nå mot Sonnet 5 og Opus 5, til tross for at amerikanske laboratorier holder tilbake teknikker som logit-distillasjon. Ruter-tjenester i Kina samler inn ideelle prompt-fordelinger og bruker dem til å destillere kunnskap fra de beste modellene, noe som svekker antakelsen om at det beste laboratoriet automatisk vinner alt.
Schulman avslutter med hvor mennesker fortsatt trengs: å definere målet og bestemme hva vi faktisk vil oppnå, er den siste jobben som blir igjen for mennesker, uansett hvor gode modellene blir på å utføre selve arbeidet.
Kilde: open.spotify.com