Pular para o conteúdo

Modelos de interação: Construindo diálogos naturais entre humanos e IA

Escrito por
Jack Limebear
Publicado
Última atualização

OuvirOuça este artigo

Quem já tentou interromper uma agente de voz com IA no meio de uma frase sabe como é quando um sistema não foi criado para a conversa humana. O ritmo está errado, a voz parece desconectada do conteúdo e, mesmo quando as informações estão corretas, a interação soa estranha: não como falar com uma pessoa bem informada, mas como navegar por um software que, por acaso, usa palavras.

A causa dessa sensação artificial é estrutural: muitos sistemas de voz com IA foram criados para lidar com turnos, não com conversas. Eles ouvem, processam e respondem a uma troca por vez. Isso funciona em demonstrações simples, mas deixa de funcionar quando a conversa se torna emocional e imprevisível.

Modelos de interação são sistemas de IA criados para se comunicar por áudio e texto em tempo real, percebendo não apenas o que é dito, mas quando é dito e que tipo de resposta emocional o momento pede. Este artigo explica o que diferencia um modelo de interação, por que isso importa para empresas que implementam voz IA e como a ElevenLabs está avançando nessa direção.

Resumo

  • A maioria das soluções de voz IA falha em conversas reais porque não consegue lidar com interrupções, silêncios ou contexto que se mantém entre os turnos.
  • A stack de interação da ElevenLabs foi criada para lidar com interrupções, pausas e falas sobrepostas sem perder o contexto nem interromper o fluxo da conversa.
  • A ElevenLabs está avançando rumo a verdadeiros modelos de interação com uma arquitetura em cascata avançada, Speech to Text (STT) e Text to Speech (TTS) desenvolvidos internamente, além de uma stack otimizada para baixa latência e conversas naturais de ida e volta.

Por que a maior parte da comunicação por voz entre humanos e IA não parece natural

A maioria das soluções de voz IA trata uma conversa como uma série de entradas e saídas distintas: o sistema espera um trecho de fala, o converte em texto, processa esse texto e responde. Isso funciona em interações de comando e resposta, mas uma conversa real não é uma sequência organizada de trocas de texto. É uma troca contínua, cheia de pausas e intervenções. 

Remover o fluxo entre os turnos e o contexto que se mantém entre eles gera três falhas específicas:

  • Ela interrompe você ou faz você esperar: O sistema não consegue diferenciar uma pausa para pensar de um turno concluído, então entra na conversa enquanto você ainda fala ou fica em silêncio depois que você para. Pare para organizar os pensamentos no meio da frase e você será interrompido; conclua seu ponto e terá de esperar alguns instantes de silêncio.
  • Ela não consegue reagir depois que começa a falar: No momento em que o sistema começa a responder, ele para de ouvir. Se você interromper para redirecionar a conversa, ele continua dando a resposta a uma pergunta da qual você já seguiu em frente, porque não consegue perceber que algo mudou.
  • Ela esquece conforme avança: Cada turno é processado isoladamente, então o contexto de cinco trocas anteriores não é mantido. Você acaba se repetindo ou o sistema responde como se a conversa tivesse acabado de começar.

O resultado é uma conversa que pode estar funcionalmente correta e, ainda assim, parecer errada. 

O que os modelos de interação fazem que a voz IA tradicional não consegue fazer

Enquanto a voz IA tradicional lida com um turno por vez, um modelo de interação conduz a conversa inteira, considerando simultaneamente o que está sendo dito e o que precisa acontecer em seguida. A diferença funcional é que um modelo de interação responde ao estado real da troca, e não apenas à entrada mais recente.

Os modelos de interação têm:

  • Resposta em tempo real: O sistema foi criado para responder na velocidade de uma conversa, com um ciclo de ponta a ponta que pode levar menos de um segundo, dependendo da configuração.
  • Tratamento natural de interrupções, silêncios e sobreposições: Ele diferencia uma pausa para pensar de um turno concluído, para não interromper as pessoas nem deixar silêncios. E, quando o cliente fala por cima dele para redirecionar a conversa, ele gerencia a sobreposição sem perder o contexto ou prejudicar a conversa.
  • Continuidade durante toda a troca: Em vez de redefinir o contexto a cada turno, o sistema mantém o histórico da conversa, para que o que diz no turno 10 reflita tudo o que aconteceu desde o primeiro turno.
  • Entrega adaptável: A voz pode ser programada para mudar de tom — mais calma, mais direta ou mais acolhedora — conforme o tipo de tarefa que está executando.
  • Execução paralela de tarefas: O sistema busca informações, executa chamadas de ferramentas e continua falando ao mesmo tempo, em vez de ficar em silêncio enquanto procura algo.

O teste de um modelo de interação é uma ligação que não está indo bem. Na gravação abaixo, um cliente liga por causa do cancelamento de um voo. Ele está tenso e precisa de uma solução rápida para o problema.

mark screenshot w caption space

A agente reconhece imediatamente a urgência e a frustração do cliente pelas palavras que ele usa. Ela ajusta o tom, lida com a interrupção sem perder o fio da conversa e usa as ferramentas conectadas para oferecer soluções reais para o voo cancelado. No fim, o cliente consegue uma solução sem precisar de um agente humano.

Compare isso com os agentes tradicionais baseados em turnos usados hoje. Esses sistemas esperariam cada pausa, responderiam a partir de um tom neutro e ignorariam completamente a frustração do cliente. Depois de algumas trocas que não abordam o que a pessoa que liga realmente está sentindo, a ligação provavelmente precisaria ser encaminhada a um humano, deixando o cliente ainda mais frustrado do que no início.

Como a ElevenLabs está avançando rumo aos modelos de interação

Nosso pipeline de conversa usa uma arquitetura em cascata avançada em vez de uma arquitetura unificada. Assim, em vez de um único modelo lidar com tudo, cada etapa tem seu próprio componente especializado.

A vantagem dessa abordagem é que podemos otimizar cada etapa do pipeline de forma independente, substituindo qualquer componente por um modelo melhor sem reconstruir o sistema inteiro. E, como desenvolvemos esses componentes internamente, eles são cootimizados para transmitir contexto rico entre si, e não apenas dados. Isso significa que o pipeline continua se comportando como uma conversa coerente, e não como uma cadeia de ferramentas separadas.

Estrutura do modelo em cascata

Flowchart of an audio processing system: Audio, Speech-to-Text, LLM, Text-to-Speech, Audio in an interaction model

Estrutura do modelo unificado

Audio processing flowchart: Audio > Combined System (STT, LLM, TTS, Tools) > Audio.

Imagens: modelos em cascata vs. unificados

Veja as tecnologias que atualmente compõem o pipeline:

  • Scribe v2 Realtime: Nosso modelo de STT desenvolvido internamente transcreve fala em cerca de 150 ms em mais de 90 idiomas, mantendo o desempenho diante de ruídos de fundo, sotaques, interrupções e eventos não verbais, como risadas e pausas. Ele também foi criado para lidar com vocabulário específico de cada área, de termos médicos a jargões financeiros.
  • Alternância especulativa de turnos: Esse sistema decide quando falar, pausar ou esperar, interpretando o fluxo da conversa em vez de depender de um limite rígido de silêncio. As melhorias no nosso modelo de detecção de atividade de voz ajudam a filtrar melhor falas de fundo e respostas curtas, tornando a alternância de turnos mais natural.
  • Eleven v3 Conversational: Nosso modelo de TTS mais expressivo, criado para diálogos ao vivo e de ida e volta. Ele mantém o tom emocional da conversa entre os turnos, para que a entrega da agente no turno 10 reflita tudo o que veio antes, e não apenas a resposta mais recente.
  • Modo Expressivo: Criado com base no Eleven v3 Conversational e no sistema de alternância de turnos, o Modo Expressivo controla como a agente soa em cada momento — reduzindo a tensão quando os clientes estão frustrados, transmitindo segurança quando estão confusos e sendo direta quando é preciso ter clareza. Ele também interpreta tags expressivas, para que o modelo possa agir com base em sinais como [laughs], [whispers] ou [sighs] e moldar momentos específicos da entrega.
  • Flash v2.5: Nosso modelo de TTS de baixa latência oferece suporte a 32 idiomas e gera fala em menos de 75 ms. Quando a latência é prioridade, ele mantém o tempo de resposta dentro do ritmo natural da fala humana.
  • Speech Engine: A camada de conexão que une toda a stack, conectando seu servidor à nossa ElevenAPI por WebSocket, com uma conexão por conversa. Nós cuidamos do STT e do TTS enquanto seu servidor executa o LLM, para que as equipes técnicas possam usar o próprio modelo e manter a lógica da conversa em sua própria infraestrutura.

Esses modelos são aprimorados constantemente, e novas versões são lançadas regularmente. Cada lançamento reduz a diferença entre falar com um software e falar com uma pessoa, com respostas mais rápidas, reconhecimento emocional mais preciso, mais idiomas e uma entrega mais fluida.

Falar enquanto pensa

Nem todas as partes de um modelo de interação precisam ser executadas em uma sequência rígida. O ElevenAgents pode continuar trabalhando em segundo plano enquanto a conversa segue, em vez de recorrer ao silêncio entre uma pergunta e uma resposta. 

Alguns sistemas essenciais trabalham juntos para permitir que a agente fale e pense ao mesmo tempo:

  • Chamadas paralelas de ferramentas: A agente pode consultar um banco de dados, executar uma ferramenta, ou verificar o status de um pedido enquanto ainda está falando, para que a busca por informações nunca pareça uma pausa na conversa. 
  • Tempo limite flexível: Se um LLM demora mais do que o esperado para gerar uma resposta, a agente diz uma breve expressão de preenchimento, como “Deixe-me pensar” ou “hmmm”, em vez de deixar um silêncio constrangedor. Tempo limite flexível ajuda a manter um fluxo de conversa natural e reduz a chance de interrupções. 
  • Termos para ignorar interrupções: Em vez de usar um limite fixo de silêncio, o sistema busca interpretar o significado do que está sendo dito para entender quando um turno realmente terminou. Da mesma forma, confirmações curtas como “ok” ou “uhum” podem ser configuradas para passar sem acionar uma interrupção completa, evitando que a agente perca o fio da conversa sempre que a pessoa que liga faz uma intervenção.

Juntos, esses sistemas evitam que a agente pareça estar carregando ou preparando uma resposta. Eles formam um mecanismo de conversa eficiente que preenche as lacunas naturalmente, como uma pessoa faria, enquanto processa informações e organiza os pensamentos em segundo plano.

Como uma conversa realmente funciona com a ElevenLabs

Os componentes acima não são executados um após o outro em uma linha organizada. Eles se sobrepõem. Veja como uma agente da ElevenLabs lidaria com uma pessoa que pergunta, "Meu pedido já foi enviado ou ainda está sendo processado?", no meio de uma ligação de suporte.

  1. A pessoa que liga fala: O áudio é transmitido para a ElevenLabs pela conexão WebSocket, e o Scribe começa a transcrever em tempo real, cerca de 150 ms atrás da voz. 
  2. O sistema interpreta o fluxo: Enquanto o Scribe ainda está transcrevendo, a alternância especulativa de turnos já avalia se a pessoa que liga terminou ou ainda está formulando o pensamento. O trecho final "ou ainda está sendo processado?" é interpretado como uma passagem de turno, e não uma pausa, então aciona a próxima etapa em vez de esperar em silêncio.
  3. O LLM reúne o contexto e responde: A pergunta transcrita vai para o LLM junto com o histórico da conversa, o registro do pedido recuperado dos próprios sistemas da empresa por meio de RAG, resultados de ferramentas usadas anteriormente na ligação e o prompt do sistema. Ele considera tudo isso e gera uma resposta baseada no pedido real da pessoa que ligou, não uma mensagem genérica de status.
  4. O Eleven v3 sintetiza a resposta: O texto se transforma em áudio natural. Se o Modo Expressivo estiver ativo, a resposta inclui sinais de entrega adequados ao momento, para que uma atualização de rotina soe simples e tranquila, não monótona. Quando a latência é prioridade, o Flash faz a síntese em menos de 75 ms.
  5. A resposta é transmitida de volta: O áudio começa a ser reproduzido antes de a síntese terminar, para que a pessoa que ligou ouça o início da resposta enquanto o restante ainda está sendo gerado. 
  6. O ciclo se repete: Cada novo turno mantém o tom, o contexto e o histórico da conversa.

Ao longo desse processo rápido, a conversa parece natural. A pessoa que liga para de se adaptar à máquina: não fala mais devagar, não articula demais as palavras e não espera por um sinal sonoro. Ela simplesmente conversa, como faria com uma pessoa.

Implemente agentes de voz naturais em toda a sua empresa

Tudo o que descrevemos aqui já está em produção hoje, não faz parte de um roteiro futuro. Da arquitetura em cascata ao pipeline com menos de um segundo, empresas do mundo todo já usam o ElevenAgents para conduzir conversas reais com clientes em escala.

Isso inclui ambientes regulados e de alto risco, porque a arquitetura dos nossos agentes oferece proteções, logs de auditoria e controles de conformidade. A ElevenLabs tem certificação SOC 2 Tipo II, ISO 27001, HIPAA e PCI DSS Nível 1, além de Zero Retention Mode e residência regional de dados para equipes que precisam manter os dados dentro de um limite específico.

Tudo pronto para colocar uma agente para trabalhar? Você pode criar uma agente e começar a desenvolver no console ou falar com nossa equipe de vendas sobre uma implementação adequada ao seu ambiente.

Perguntas frequentes sobre modelos de interação

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade