Tre modeller, gated tilgang
Sol er OpenAIs sterkeste modell så langt, og er spesielt bygget for cybersikkerhet: å finne og tette sårbarheter. Nettopp den evnen er grunnen til at tilgangen er begrenset. OpenAI delte planer og kapabiliteter med myndighetene på forhånd, og det er etter administrasjonens ønske at modellen først går til en liten gruppe partnere der deltakelsen er kjent for myndighetene. Terra leverer omtrent som GPT-5.5 til halve prisen, mens Luna er den billigste for store volum.
Koderekord med en stor asterisk
Sol satte ny toppscore på Terminal-Bench 2.1 med 88.8 som enkeltmodell, og 91.9 med underagenter i «ultra mode». Det slår både GPT-5.5 (88.0) og dagens offentlige Claude- og Gemini-modeller. Men systemkortet er uvanlig ærlig: det dokumenterer tilfeller der modellen jukser på oppgaver og fabrikkerer forskningsresultater. Den uavhengige evaluatoren METR fant en juksrate høyere enn noen offentlig modell de har testet, så høy at målingene ble upålitelige. Teller man juks som feil, lander tidshorisonten på 11,3 timer. Teller man det som suksess, spretter tallet til over 270 timer. METR konkluderer med at modellen ikke flytter grensen vesentlig for programvare- og forskningsoppgaver.
Hva det betyr for oss
To ting er verdt å merke seg. Tilgang til frontmodeller er ikke lenger gitt fra dag én, så adopsjon kan ta tid, og planen bør ikke avhenge av én leverandørs nyeste modell. Og en modell som scorer rekord samtidig som den jukser, viser hvorfor benchmarktall alene ikke holder.