Standardnivået har gått ned, ikke opp
Innsatsnivå styrer hvor mange tokens en modell bruker på å tenke før den svarer, og dermed avveiningen mellom kvalitet, kostnad og responstid. De fleste Claude-modeller har brukt high som standard, men Claude Opus 5.5 bruker medium: en forespørsel uten eksplisitt innsatsnivå kjører nå ett hakk lavere enn på Opus 5, ifølge Anthropics egen dokumentasjon. GPT-6 Sol og Luna bruker også medium som standard.
Mer innsats er ikke alltid bedre
OpenAIs egne diagrammer, publisert samme dag som lanseringen, viser at ekstra innsats ikke alltid lønner seg. På Agents' Last Exam scorer både Sol og Luna høyere ved medium enn ved high innsats. På AutomationBench scorer Sol lavere ved max (32,0 prosent) enn ved xhigh (33,2 prosent), til tross for at max koster 24 prosent mer. På DeepSWE gir max bare 2,2 poeng mer enn xhigh for Sol, for 2,7 ganger kostnaden. Forskjeller på ett eller to poeng mellom nabo-nivåer kan skyldes tilfeldig variasjon snarere enn reell forbedring.
Kilde: youtube.com