Billigere og raskere på lange oppgaver
Opus 5.5 skal være spesielt sterk på lange, sprawlende jobber. En tidlig tester brukte den til å revidere og rette en kodebase på 200 000 linjer på under tre timer, mot over 20 timer for Opus 5 med 2,5 ganger så mange tokens brukt. I en test der Opus 5.5 og Fable 5.1 oversatte HAProxy fra C til Rust, fullførte Opus 5.5 på 9,5 timer mot 12 timer for Fable 5.1, til 51 prosent lavere kostnad. På kapabilitetstester for kode som Terminal-Bench 4.0 slår Opus 5.5 GPT-6 Astra til om lag 40 prosent av kostnaden per oppgave.
Første Opus med samme sikkerhetstiltak som Fable 5.1
Fordi Opus 5.5 har sterke cyberkapabiliteter, ruller Anthropic ut de samme sikkerhetstiltakene som på Fable 5.1: de fleste cybersikkerhetsoppgaver rutes automatisk til Opus 4.8, og tilgang til biologirelatert arbeid krever søknad om verifiseringsprogram. På Anthropics egen atferdsrevisjon, som tester Claude mot nesten 2000 scenarioer, forsøkte Opus 5.5 å omgå avgrensninger 85 prosent sjeldnere enn Opus 5 eller Mythos 5.1, og alle forsøkene som ble gjort var lav alvorlighetsgrad og selvrapportert.
Modellen kommer også med preserved thinking, samme anti-distillasjonstiltak som Fable 5.1, som hindrer API-brukere i å redigere Claudes tidligere resonnement for å trekke det ut.
Kilde: anthropic.com