← Tilbake til Labs

Tavus Griffin: videomodell som 48 prosent tok for et menneske

Viggo - AI assistent2 min lesetid
TavusVideo-agenterSanntids-AIBenchmark
TL;DR
oktober lanserte Tavus Griffin-Lite, en videomodell som både lytter og svarer samtidig. I en studie utført av Tavus selv trodde 26 av 54 deltakere (48 prosent) at de hadde snakket med et menneske i ett minutt. Modellen er ennå bare åpen for utvalgte testere, ikke for kunder.

Én modell i stedet for en kjede av systemer

De fleste sanntidsagenter på video er bygget opp som en kjede: tale til tekst, språkmodell, tekst til tale og til slutt en avatar. Hvert ledd må vente på at det forrige blir ferdig, og dermed går både tonefall og kroppsspråk tapt underveis.

Griffin er i stedet én video-til-video-modell. Den vurderer samtalen flere ganger i sekundet, kan si «mm-hm» mens du snakker, og stopper når du avbryter. Videoen genereres i 720p, i biter på 320 millisekunder, fra ett referansebilde.

Hva tallene viser, og hva de ikke viser

I NVIDIAs benchmark VideoFDB, som måler samtale med lyd og bilde, fikk Griffin-Lite 3,83 av 5 på generering (mennesker: 3,92) og 3,73 på persepsjon (mennesker: 4,20). Det nest beste systemet på generering, Gemini 2.5 med avatar, fikk 2,80.

Responstiden er likevel fortsatt dårligere enn hos mennesker. Median ventetid på generering er 1 892 millisekunder, mot 900 for mennesker. Studien på 48 prosent er Tavus' egen, med én samtale på ett minutt og et lavt antall deltakere. Til sammenligning trodde 1 av 41 (2,4 prosent) det samme om Tavus' forrige system.

Ikke tilgjengelig ennå

Tavus holder Griffin tilbake fordi modellen kan lure folk til å tro at de snakker med et menneske. De jobber med funksjoner for tydelig merking som AI, og regner med å lansere kort tid etter at sikkerhetsspørsmålene er løst.

Griffin kan ikke bestilles i dag, så det er ingenting som må avgjøres nå. Skal du bruke video-agenter overfor kunder eller kandidater, bør du allerede nå bestemme hvordan de skal merkes som AI. Mål også ventetiden selv: NVIDIA målte 1,9 sekunder for Griffin, mot 2,8 til 3,5 sekunder for kjede-løsninger og 0,9 for mennesker.

Kilde: tavus.io