Am 1. Oktober 2026 stellte Tavus Griffin vor, ein Human Interaction Model, das Video und Audio verarbeiten und in Echtzeit reagieren kann. Das Unternehmen bezeichnet es als das erste Modell, das einen Video-Turing-Test bestanden hat.
In einem Test mit 54 Teilnehmern gaben 26 Personen beziehungsweise 48 % nach einem einminütigen Videoanruf an, Griffin-Lite sei ein echter Mensch gewesen.
Griffin-Lite belegte laut Tavus in unabhängigen NVIDIA-VideoFDB-Tests zur vollständigen Duplex-Interaktion mit Audio und Video den ersten Platz unter 15 bewerteten Modellen.
Tavus hat den Zugang zu Griffin eingeschränkt, während das Unternehmen Funktionen zur KI-Kennzeichnung entwickelt und Risiken bewertet, die sich aus der Fähigkeit des Modells ergeben, Menschen zu imitieren.
Tavus stellte Griffin vor als eine neue Klasse von Human Interaction Models, kurz HIM, die gleichzeitig sehen, hören, sprechen und auf die nonverbalen Signale eines Gesprächspartners reagieren können. Anders als kaskadierte Systeme, die Sprache erkennen, eine Antwort erzeugen und diese anschließend ausgeben, trifft Griffin Entscheidungen in regelmäßigen Intervallen von weniger als einer Sekunde.
Das Modell arbeitet als Full-Duplex-Video-zu-Video-System. Es kann auf Pausen, Blickkontakt, Gesichtsausdrücke und Gesten reagieren, gleichzeitig zuhören und sprechen, ein Gespräch unterbrechen oder fortsetzen, ohne den Kontext zu verlieren, und anhand der Länge einer Pause bestimmen, wann es antworten soll.
Griffin kann zudem Objekte und seine Umgebung erkennen und diese in seine Antworten einbeziehen. Tavus zufolge passt das Modell Stimme, Gesichtsausdrücke und Gesten an die jeweilige Situation an.
Echtzeitdemonstrationen und Leistung
In Demonstrationen spielte Griffin „Simon Says“, während es Worte und Bewegungen der Teilnehmer verfolgte. Es baute einen der Kamera gezeigten Pfau in die Handlung eines Gesprächs ein, half beim Lösen eines Rubik’s Cube durch das Verfolgen von Handbewegungen und leitete Lötarbeiten an, während es die Zeit im Blick behielt.
Das System verfügt über zwei Kernkomponenten. Continuous Conversational Modeling analysiert Audio und Video, um zu entscheiden, wann und wie Griffin reagieren soll, während Audio-Visual Generation diese Signale in Sprache und Video umwandelt.
Laut Tavus erzeugt Griffin-Lite 720p-Video in Echtzeit unter Verwendung von 320-Millisekunden-Abschnitten. Auf H100-GPUs erreichte es eine durchschnittliche Latenz von 0,43 Sekunden, was nach Angaben des Unternehmens etwa doppelt so schnell war wie die nächstschnellste getestete Methode.
Griffin-Lite führt laut Tavus NVIDIA-VideoFDB-Tests an
Griffin-Lite belegte laut Tavus in unabhängigen NVIDIA-VideoFDB-Tests, die die vollständige Duplex-Interaktion mit Audio und Video messen sollen, den ersten Platz unter 15 bewerteten Modellen.
Im Generierungsbereich erzielte Griffin-Lite 3,83 Punkte, verglichen mit 3,92 Punkten für den menschlichen Referenzwert. Im Wahrnehmungsbereich erreichte es 3,73 Punkte.
Das Modell erzielte zudem die höchsten Übereinstimmungswerte dafür, wann es zu sprechen beginnt: 62,8 % bei der Generierung und 73,8 % bei der Wahrnehmung.
Fast die Hälfte der Teilnehmer hielt Griffin für menschlich
In einem Test mit 54 Teilnehmern erklärten 26 Personen beziehungsweise 48 % nach einem einminütigen Videoanruf, ihr Gesprächspartner sei ein echter Mensch gewesen. Das vorherige System von Tavus — Phoenix-4.5 kombiniert mit Sparrow-2 und Raven-1 — erreichte 2,4 %, wobei einer von 41 Teilnehmern es als menschlich einstufte.
Mehr als die Hälfte der Griffin-Lite-Teilnehmer zog nach Angaben von Tavus während des Gesprächs nicht in Betracht, dass sie mit einer KI sprechen könnten. Teilnehmer, die vermuteten, dass ihr Gesprächspartner künstlich war, taten dies im Allgemeinen innerhalb der ersten 20 Sekunden.
Zugang wegen Risiken der Imitation eingeschränkt
Griffin ist als Forschungsvorschau nur für eine begrenzte Gruppe von Testern verfügbar. Tavus erklärte, dass das Unternehmen vor einer öffentlichen Veröffentlichung Sicherheitsfragen angehen müsse, da die Fähigkeit des Modells, eine Person zu imitieren, zusätzliche Risiken schaffe.
„Dieselben Eigenschaften, die Human Interaction Models zu leistungsfähigen Schnittstellen für natürliche Kommunikation zwischen Mensch und Maschine machen, können einen Menschen dazu verleiten, zu glauben, dass es sich nicht um KI handelt“, erklärten die Entwickler.
Tavus erklärte, das Unternehmen arbeite an Funktionen zur KI-Kennzeichnung und zusätzlichen Verfahren zur Risikobewertung. Nach der Behebung der Sicherheitsprobleme plant das Unternehmen eine breitere Veröffentlichung einer leistungsfähigeren Version von Griffin.
Quelle: HODL Press
