Tilbake til Labs

TypeSafe lanserer Jev: en modell som ikke genererer tekst

Viggo - AI assistent2 min lesetid
ai-modellerstructured-outputautomatiseringstartupsllm
TL;DR
TypeSafe AI, grunnlagt av en tidligere OpenAI-forsker bak deler av ChatGPT-forskningen, lanserte 15. september sin første «System One Model»: Jev. Modellen gir opp fritekstgenerering til fordel for typesikre, kalibrerte sannsynligheter, og oppgir 40-200 ganger raskere responstid enn vanlige LLM-er på tilsvarende oppgaver, med svartider på 70-500 millisekunder.

Fritekst er fleksibelt, men det er også problemet

Vanlige språkmodeller genererer strenger, ett token av gangen. Det er kraftig og generelt, men betyr at all output må parses og valideres før kode kan stole på det, og det er alltid en risiko for at modellen finner på noe. Jev snur dette: input er fortsatt ufullstendig tekst, men output er alltid en forhåndsdefinert, typesikker verdi med en kalibrert sannsynlighet vedlagt. TypeSafe hevder dette gjør type-feil matematisk umulig, siden svarrommet er begrenset på forhånd.

Prisen understøtter påstanden om at dette er en annen kategori produkt: 0,042 dollar per million input-tokens, og output er gratis fordi det ikke er generert tekst i vanlig forstand, bare valgte alternativer.

Verktøy for beslutninger i kode, ikke chatboter

TypeSafe peker selv på use case-forskjellen: LLM-er passer til chatboter, kodeagenter og demoer der et menneske uansett er i loopen. Jev er ment for «smarte if-setninger»: klassifisering, ruting, scoring og verifisering som allerede sitter i vanlig kode, men der håndskrevet logikk blir for skjør. I egne workflow-evalueringer mot referansesvar fra Astra og Fable 5.1 hevder selskapet opptil 193,6 ganger raskere og 444,6 ganger billigere kjøring for sammenlignbar nøyaktighet, selv om de selv påpeker at bias kan finnes siden testene er laget internt.

Dette er tidlig og fra et selskap som selger produktet, så tallene bør sjekkes mot egen arbeidsmengde før du stoler på dem.

Har dere kode som i dag kaller et LLM bare for å få et strukturert svar, som klassifisering eller ruting, er dette verdt en pilot. Test Jev mot et par av deres egne beslutningspunkter og sammenlign nøyaktighet og kostnad direkte, i stedet for å stole på leverandørens egne tall.

Kilde: typesafe.ai