Hva WANDR måler
WANDR ble sluppet 14. juli 2026 og består av 500 research-oppgaver som til sammen krever 170 495 kildebelagte poster, fordelt jevnt på tre vanskelighetsnivåer. Median-oppgaven ber om 50 medlemmer og 245 poster.
Dette er bred research, ikke dyp: konkurrentkartlegging, due diligence, litteraturgjennomgang, kandidatsøk. Ikke én rapport, men en lang liste der hver rad må belegges med en kilde. Scoren er soft F1, som gir delvis uttelling for ufullstendige oppføringer. Hard F1, som bare teller helt korrekte, ligger vesentlig lavere for alle.
Tallene
- GPT-6 Astra: 0,682 til 11,98 dollar
- Fable 5.1: 0,601 til 12,76 dollar
- Opus 5: 0,537 til 11,60 dollar
- Grok 4.6: 0,496 til 7,58 dollar
- Fable 5: 0,496 til 20,30 dollar
- GPT-5.6 Sol: 0,426 til 4,99 dollar
- GPT-5.6 Terra: 0,399 til 1,98 dollar
- DeepSeek V4 Pro 0813: 0,359 til 0,75 dollar
- Sonnet 5: 0,309 til 5,75 dollar
Fable 5 mot Fable 5.1 er verdt en ekstra titt: 21 prosent høyere score til 37 prosent lavere kostnad per oppgave. Det er token-effektiviteten Anthropic annonserte, målt av noen andre enn dem selv.
Kurven er bratt på toppen
Fra GPT-5.6 Terra til GPT-6 Astra betaler du seks ganger så mye for 71 prosent høyere score. DeepSeek V4 Pro leverer over halvparten av Astras score for 6 prosent av kostnaden. Hvor på kurven du bør ligge avhenger av om oppgaven tåler hull i datasettet, ikke av hvilken modell som står øverst.
Hvem som måler
Grafen er merket «perplexity computer». Modellene kjøres altså inne i Perplexitys eget agentoppsett, så tallet måler modell pluss rammeverk, ikke modellen alene. Perplexity eier både benchmarken og produktet den kjøres i.
Legg også merke til at nivået er et helt annet enn i juli-sammenligningen av seks ferdige systemer, der det beste fikk 0,363 soft F1 og kostnadene spente fra 0,03 til 324,83 dollar per oppgave. De to oppsettene er ikke direkte sammenlignbare.
Kilde: x.com