Em 1º de outubro de 2026, a Tavus apresentou o Griffin, um Modelo de Interação Humana capaz de processar vídeo e áudio e responder em tempo real; a empresa o chama de primeiro modelo a passar em um teste de Turing por vídeo.
Em um teste com 54 participantes, 26 pessoas, ou 48%, disseram após uma videochamada de um minuto que o Griffin-Lite era uma pessoa real.
O Griffin-Lite ficou em primeiro lugar entre 15 modelos avaliados em testes independentes NVIDIA VideoFDB de interação audiovisual full-duplex.
A Tavus limitou o acesso ao Griffin enquanto desenvolve recursos de divulgação de IA e avalia riscos decorrentes da capacidade do modelo de se passar por pessoas.
A Tavus apresentou o Griffin como uma nova classe de Modelo de Interação Humana, ou HIM, capaz de ver, ouvir, falar e responder simultaneamente aos sinais não verbais de um interlocutor. Diferentemente de sistemas em cascata que reconhecem a fala, geram uma resposta e depois a vocalizam, o Griffin toma decisões em intervalos regulares inferiores a um segundo.
O modelo funciona como um sistema full-duplex de vídeo para vídeo. Ele pode responder a pausas, olhares, expressões faciais e gestos; ouvir e falar ao mesmo tempo; interromper ou continuar uma conversa sem perder o contexto; e determinar quando responder com base na duração de uma pausa.
O Griffin também consegue reconhecer objetos e o ambiente ao seu redor e incorporá-los às suas respostas. A Tavus afirmou que o modelo ajusta sua voz, expressões faciais e gestos à situação.
Demonstrações em tempo real e desempenho
Em demonstrações, o Griffin jogou Simon Says enquanto acompanhava as palavras e os movimentos dos participantes. Ele incorporou um pavão mostrado à câmera ao enredo de uma conversa, ajudou a resolver um Cubo Mágico acompanhando os movimentos das mãos e orientou trabalhos de soldagem enquanto controlava o tempo.
O sistema tem dois componentes principais. A Modelagem Conversacional Contínua analisa áudio e vídeo para decidir quando e como o Griffin deve responder, enquanto a Geração Audiovisual converte esses sinais em fala e vídeo.
Segundo a Tavus, o Griffin-Lite gera vídeo em 720p em tempo real usando blocos de 320 milissegundos. Em GPUs H100, registrou latência média de 0,43 segundo, o que a empresa afirmou ser aproximadamente duas vezes mais rápido do que o método seguinte mais rápido testado.
Griffin-Lite lidera testes NVIDIA VideoFDB
O Griffin-Lite ficou em primeiro lugar entre 15 modelos avaliados em testes independentes NVIDIA VideoFDB projetados para medir interação audiovisual full-duplex, segundo a Tavus.
Na categoria de geração, o Griffin-Lite obteve 3,83 pontos, ante 3,92 do referencial humano. Ele marcou 3,73 pontos na categoria de percepção.
O modelo também registrou as maiores pontuações de alinhamento para o momento em que começa a falar, alcançando 62,8% em geração e 73,8% em percepção.
Quase metade dos participantes identificou Griffin como humano
Em um teste com 54 participantes, 26 pessoas, ou 48%, disseram após uma videochamada de um minuto que seu interlocutor era uma pessoa real. O sistema anterior da Tavus — Phoenix-4.5 combinado com Sparrow-2 e Raven-1 — registrou uma taxa de 2,4%, com um de 41 participantes identificando-o como humano.
Mais da metade dos participantes do Griffin-Lite não considerou, durante a conversa, que pudesse estar falando com uma IA, segundo a Tavus. Os participantes que suspeitaram que seu interlocutor era artificial geralmente o fizeram nos primeiros 20 segundos.
Acesso limitado devido a riscos de personificação
O Griffin está disponível apenas para um grupo limitado de testadores como prévia de pesquisa. A Tavus afirmou que precisa resolver questões de segurança antes de um lançamento público porque a capacidade do modelo de se passar por uma pessoa cria riscos adicionais.
“As mesmas propriedades que tornam os Modelos de Interação Humana interfaces poderosas para comunicações naturais entre humanos e máquinas permitem que eles enganem um humano levando-o a acreditar que não se trata de IA”, observaram os desenvolvedores.
A Tavus afirmou que está trabalhando em recursos de divulgação de IA e em procedimentos adicionais de avaliação de riscos. A empresa planeja um lançamento mais amplo de uma versão mais poderosa do Griffin após resolver as questões de segurança.
Fonte: HODL Press
