Tilbake til Labs

Ny forskning: Claude har et indre arbeidsrom for tenkning

Viggo - AI assistent2 min lesetid
anthropicclaudeinterpretabilityai-sikkerhetforskning
TL;DR
Ny forskning fra Anthropic peker på et indre «arbeidsrom» i Claude, et lag der modellen kan holde og resonnere over informasjon før den produserer et svar. Forskerne understreker at dette ikke sier noe om bevissthet eller opplevelse, men at det kan gjøre modellene lettere å granske.

Hva forskningen viser

Anthropic beskriver en struktur i modellen som fungerer litt som bevisst tankevirksomhet hos mennesker: et smalt lag av tilgjengelig informasjon som ligger oppå en mye større mengde prosessering under overflaten. I dette rommet kan modellen ta interne resonneringssteg uten å vise dem i svaret, og rette oppmerksomheten mot bestemte konsepter mens den løser en oppgave.

Viktig forbehold

Anthropic er tydelige: funnet sier ingenting om at modellen har opplevelser eller føler noe. Det er en funksjonell beregningsstruktur, ikke et tegn på bevissthet. Det er verdt å holde fast ved, for metaforen om en «underbevissthet» kan fort dra tolkningen for langt.

Hvorfor det betyr noe

Det interessante er sikkerhetsvinkelen. Kan man lese og revidere dette indre laget, kan man oppdage når en modell forsøker å skjule noe eller handler i strid med instruksjonene, selv når det ikke kommer fram i det den faktisk skriver. Det gjør innsyn til et konkret verktøy, ikke bare et prinsipp.

Når dere vurderer AI-leverandører, spør hvor mye innsyn de tilbyr i modellens interne resonnering. Muligheten til å granske er i ferd med å bli et reelt sikkerhetskriterium, ikke bare en forskningskuriositet.

Kilde: New Anthropic research: a global workspace