Billigere enn Opus 5 på egne kapabilitetstester for kode
På AutomationBench, som tester agenter på virkelige arbeidsflyter på tvers av 47 verktøy, slår GPT-6 Sol ved høyest innsats Claude Opus 5 ved maks innsats til bare 9 prosent av Opus 5 sin kostnad per oppgave, ifølge OpenAIs egne tall. På DeepSWE, som tester komplekse programvareoppgaver i ekte kodebaser, scorer Sol 68,8 prosent ved maks innsats, innenfor 1,1 prosentpoeng av Fable 5 sitt beste resultat, til omtrent 80 prosent lavere kostnad per oppgave. Luna scorer 66,6 prosent, sammenlignbart med Opus 5 og Fable 5 ved middels innsats, men til 93 og 96 prosent lavere kostnad.
Tallene kommer fra OpenAI selv og bør leses deretter, men metodikken og kildene til sammenligningstallene er oppgitt åpent i innlegget.
Bedre cache-treff for agenter med lange samtaler
OpenAI har samtidig forbedret prompt-caching for hele GPT-6-familien, med høyere cache-treffrate som standard og 90 prosent rabatt på gjenbrukte input-tokens. Utviklere får et eget dashbord for å overvåke cache-bruk, og kan nå endre resonneringsinnsats eller slå verktøy av og på midt i en samtale uten at det ødelegger cachen. GitHub oppgir at endringene har redusert andelen prompt-tokens som må friskt prosesseres med over 50 prosent på tvers av milliarder forespørsler.
Kilde: openai.com