Design de IA conversacional: como criar experiências mais humanas para o usuário
- Escrito por
- Jack Limebear
- Publicado
- Última atualização
OuvirOuça este artigo
O design de IA conversacional costumava significar criar uma árvore de decisão. Os primeiros chatbots e menus de URA funcionavam com ramificações rígidas e pré-programadas: pressione 1 para cobrança, diga "sim" ou "não" e espere que a pergunta do cliente correspondesse a um dos caminhos previstos. Esse modelo só funcionava enquanto a conversa permanecia dentro do que já tinha sido criado.
Os agentes de IA eliminaram essa limitação. Agora, eles conseguem raciocinar sobre uma conversa em tempo real, consultar uma base de conhecimento, chamar ferramentas e lembrar o que já foi dito, sem ficar limitados a um script fixo.
No entanto, essa mudança não eliminou a necessidade de design de IA conversacional. Pelo contrário, elevou o nível. Sem um script rígido para recorrer, a persona, o workflow e os pontos de decisão de um agente precisam estar bem definidos para funcionar em uma conversa aberta e em tempo real, em vez de uma conversa predeterminada.
Este guia explica o que o design de IA conversacional realmente significa para chat e agentes de voz, por que ele importa para as métricas pelas quais você já é avaliado e o que precisa otimizar para tornar a experiência mais natural. Faça isso bem, e você poderá implementar agentes de IA que se conectam com os clientes e oferecem um atendimento melhor e mais rápido.
Resumo
- O design de IA conversacional define como a comunicação de um agente de IA é estruturada e otimizada para que uma conversa pareça natural.
- A IA de voz é menos tolerante que o texto, pois problemas de voz, latência e timing que passam despercebidos em uma interface de chat podem fazer uma conversa por voz parecer robótica.
- O ElevenAgents foi criado para viabilizar agentes de IA de voz e chat mais humanos, com recursos que permitem controlar a voz, a persona e o fluxo da conversa, além de otimizar a latência em todos os canais.
O que é design de IA conversacional?
O design de IA conversacional é a prática de UX de configurar como um agente de IA se comporta. Isso inclui tudo, da sua persona às proteções, workflows e bases de conhecimento que ele utiliza, trabalhando em conjunto para que a conversa seja tão bem elaborada quanto qualquer outra parte da experiência do produto.
Essa configuração não é igual em todos os lugares. Os agentes podem operar em vários canais, como chat, voz ou SMS, a partir de uma única configuração. Cada um tem suas próprias limitações, mas é na voz que elas são mais rigorosas. Quando a voz é um dos canais de um agente, ele precisa escolher e produzir uma voz, gerenciar o ritmo e a alternância de fala em tempo real e responder antes que uma pausa pareça uma ligação caída. Nada disso é opcional como pode ser no chat, em que uma resposta um pouco lenta ou imperfeita raramente interrompe a interação.
Veja o que considerar ao implementar o design de IA conversacional para um agente de chat e o que a voz acrescenta a isso.
Os clientes não avaliam conscientemente cada um desses fatores. Eles apenas percebem quando algo parece estranho, e essa sensação é suficiente para enfraquecer a confiança no agente como um todo, colocando em risco os objetivos para os quais você o implementou.
Por que o design de IA conversacional importa para uma boa experiência do usuário
Todos os fatores abordados acima, da alternância de fala à latência e à persona, afetam como o cliente percebe sua marca em um momento decisivo, que pode transformá-lo em defensor ou detrator. Essa percepção aparece diretamente nas métricas pelas quais as equipes são avaliadas.
- Maior satisfação e taxas de resolução: Os clientes avaliam melhor uma interação quando o agente responde rapidamente e não interrompe de forma constrangedora.
- Menor abandono: Os clientes abandonam uma conversa por mais motivos do que apenas longas esperas. Uma entrega que não corresponde às expectativas, seja uma pausa estranha em uma ligação ou uma resposta rígida e desalinhada à marca no chat, pode despertar o mesmo impulso de encerrar a conversa.
- Resolução mais rápida: Configurações claras do fluxo da conversa e workflows bem mapeados significam menos becos sem saída, perguntas repetidas e momentos de "vou transferir você".
- Menos escalonamentos para agentes humanos: Quando um agente conduz o fluxo da conversa naturalmente e segue um workflow definido, ele resolve mais casos na primeira tentativa, em vez de confundir o cliente a ponto de pedir para falar com uma pessoa.
Por exemplo, considere eDreams ODIGEO, uma das maiores plataformas de viagens online do mundo. A empresa implementou agentes de IA com o ElevenAgents em cinco idiomas principais e observou uma melhoria de dois dígitos na velocidade de resolução e uma redução de dois dígitos nas taxas de transferência de chamadas, impulsionadas em parte pela síntese de voz de baixa latência e por um reconhecimento de intenção mais preciso no início de cada chamada. Resultados como esses dependem de muitas variáveis além do design da conversa, mas mostram o que um bom design de IA conversacional torna possível.
Como o design de IA conversacional funciona no ElevenAgents
No ElevenAgents, você pode otimizar aspectos como persona, voz, alternância de fala, transferências e latência — os mesmos fatores que determinam se um agente parece humano. Veja como configurar e otimizar cada um deles para que seu agente cumpra seu papel em uma conversa real.
Persona e seleção de voz
A persona define a primeira impressão do cliente, e uma incompatibilidade prejudica a confiança antes mesmo de a conversa começar. Uma persona formal demais para uma marca varejista amigável faz os clientes questionarem o agente antes que ele diga algo útil. Comece a defini-la no prompt do sistema, onde você define o papel, a personalidade e as proteções do agente antes de qualquer outra coisa.
Para agentes de voz, essa persona também precisa se expressar na voz. Uma voz casual demais para uma ligação financeira transmite o mesmo sinal que uma persona incompatível transmitiria no texto, então a seleção de voz passa a fazer parte do mesmo trabalho. Veja por onde começar:
- Seleção de voz: Combine a voz com sua marca, público e tema. Sotaque, gênero e tom ajudam a criar confiança com cada pessoa que liga e a definir o tom da conversa.
- Suporte multilíngue: Selecione uma voz para cada idioma que você oferece, em vez de usar uma única voz em todos os mercados. Uma única voz forçada em vários idiomas tende a soar estrangeira em pelo menos um deles, prejudicando a confiança que você quer criar.
O ElevenAgents dá acesso a mais de 11.000 vozes na Voice Library, pesquisáveis por sotaque, personagem e caso de uso, para que você raramente comece do zero. Se nenhuma for adequada, há mais duas opções: clonar uma voz existente a partir de uma pequena amostra de áudio ou criar uma do zero com um prompt de texto que descreva a idade, o sotaque, o tom e o ritmo desejados.
Configurações do fluxo da conversa
É na voz que a conversa segue o ritmo mais rigoroso. Diferentemente do chat, em que uma pausa é apenas um espaço em branco, uma quebra de ritmo em uma ligação é percebida imediatamente como silêncio ou conexão caída. Acertar esse ritmo é o principal fator para fazer um agente de voz parecer um participante natural da conversa, e isso começa pelo próprio modelo de alternância de fala.
O modelo de alternância de fala da ElevenLabs é um sistema baseado em pesquisa, criado para detectar quando uma pessoa realmente terminou de falar, em vez de apenas fazer uma pausa. Isso permite determinar quando o agente deve responder, em vez de estimar com base em um atraso fixo.
Além disso, estas são algumas configurações que você pode ajustar para acertar o fluxo da conversa:
- Tempo limite do turno: Quanto tempo o agente espera em silêncio antes de responder, para não interromper enquanto o cliente ainda está pensando nem deixá-lo esperando depois que terminar.
- Tempo limite suave: Uma breve frase de preenchimento que o agente usa durante uma pausa de processamento, como "Um momento" ou "Vou verificar", para que os clientes não pensem que a ligação caiu. Evite frases que prometam um prazo específico, como "um segundo", pois os tempos de resposta reais variam.
- Interrupções: Define se o agente para de falar quando o cliente começa a falar por cima dele. Ative isso para uma conversa natural. Desative quando a mensagem completa for importante, como em avisos legais, instruções de segurança e qualquer conteúdo que precise ser ouvido até o fim.
- Prontidão do turno: A rapidez com que o agente responde depois que o cliente para de falar. "Eager" é adequado para atendimento ao cliente, em que respostas rápidas são mais importantes. "Patient" funciona melhor ao coletar informações do cliente, como número de telefone ou endereço de e-mail, para que o agente não o interrompa no meio de um dígito. "Normal" é uma boa opção padrão para conversas gerais.
Pequenos ajustes aqui fazem uma grande diferença. Até uma pequena mudança no tempo limite pode diferenciar um agente que parece atencioso de outro que parece interromper as pessoas.
Workflow, design de transferências e scripts
Workflows são onde grande parte do design de IA conversacional é aplicada no ElevenAgents. Eles definem o que acontece e quando: os pontos de decisão, os caminhos de escalonamento, as transferências e tudo o que, de outra forma, ficaria para o agente improvisar.
Os workflows trabalham com outros dois sistemas para aprimorar seu agente. O prompt do sistema define o comportamento central do agente, como seu papel, tom e o que ele dirá ou não dirá, em momentos importantes como saudações ou transferências. Procedimentos são uma opção mais prescritiva para uma tarefa única e bem definida, como verificar a identidade de um cliente ou conduzir uma devolução. Em vez de criar ramificações com base no que o cliente diz, eles seguem uma sequência fixa do início ao fim, passo a passo, independentemente de como a conversa aconteça.
A maneira mais fácil de começar a criar seu agente é usar modelos de agentes pré-criados, que oferecem um ponto de partida tanto para workflows quanto para prompts do sistema, para que você ajuste em vez de criar do zero. Estas são algumas mudanças que você pode fazer para adaptá-los:
- Mapeamento de decisões: Mapeie exatamente o que o agente faz em cada ponto de decisão, para que toda a conversa seja definida, da abertura à resolução. Nós de subagentes permitem ajustar o prompt do sistema, o modelo ou até a voz em pontos específicos do fluxo, para que uma etapa de verificação sensível possa operar com proteções mais rigorosas do que uma conversa informal no início da ligação.
- Gatilhos de escalonamento: Defina gatilhos claros para transferir a conversa a uma pessoa, integrados ao workflow em vez de deixar o agente decidir no momento. Por exemplo, escale quando um problema continuar sem solução após duas tentativas, quando o cliente pedir um supervisor ou quando a transação for sensível ou valiosa o bastante para precisar de uma pessoa.
- Contexto da transferência: No prompt do sistema, defina o que o agente deve coletar antes de transferir, como um ID de pedido ou número da conta, e as condições que disparam uma transferência. Depois, mapeie esses detalhes salvos para a configuração da ferramenta de transferência, para que sejam transferidos automaticamente, sem que o cliente precise repeti-los a um atendente humano.
- Frases roteirizadas: Defina a redação exata para momentos críticos no prompt do sistema. Saudações iniciais, mensagens de erro, avisos legais e transferências de escalonamento nunca devem ficar para o agente improvisar na hora. Uma frase exata como "Estou tendo dificuldade para acessar essas informações agora" é mais confiável do que deixar o agente tentar adivinhar como formular isso quando algo dá errado.
O próprio workflow é criado como um gráfico visual no ElevenAgents, com cada ponto de decisão e gatilho de escalonamento mapeado como um nó que você pode ver e editar diretamente.

Depois de entrar em operação, a análise sobrepõe dados reais de conversas a esse mesmo gráfico, para que você veja exatamente onde os clientes estão travando ou abandonando e corrija isso sem precisar adivinhar.
Latência e desempenho
A latência é um dos principais fatores que determinam se uma interação parece humana ou não. Uma resposta lenta é uma das formas mais rápidas de lembrar o cliente de que está falando com uma máquina, mesmo que todo o restante da conversa esteja indo bem.
Cada parte do pipeline acrescenta sua própria latência, seja o agente usado em chat ou voz. Algumas se aplicam nos dois casos. Outras só se aplicam quando a voz faz parte da equação.
- LLM: Cada escolha de modelo envolve um equilíbrio entre custo, qualidade de raciocínio e velocidade, e o equilíbrio ideal depende da conversa. Interações simples e frequentes, como FAQs ou confirmações de agendamento, podem usar um modelo mais rápido e leve sem prejudicar a experiência. Para tarefas mais complexas, como consultoria financeira ou solução de problemas em várias etapas, geralmente vale a pena pagar por um modelo com raciocínio mais robusto, mesmo que responda um pouco mais devagar.
- Base de conhecimento e RAG: Cada consulta à base de conhecimento adiciona uma ida e volta antes de o agente poder responder, então uma base de conhecimento enxuta e focada responde mais rápido do que uma que o agente precisa pesquisar amplamente.
- Integrações e chamadas de ferramentas: Cada chamada de ferramenta externa, como consultar um pedido no Salesforce ou verificar disponibilidade em um calendário, adiciona sua própria ida e volta. Escreva descrições claras das ferramentas para que o agente não hesite sobre qual chamar e use apenas as ferramentas de que a conversa realmente precisa.
- Geografia e hospedagem de dados: Combine a região do seu ElevenAgents com o local onde seus dados estão hospedados e, em implementações por telefone, também com a região do seu provedor de telefonia, seja Twilio, SIP ou outro. Se a região do seu agente e a região do gateway de chamadas estiverem em lados opostos do mundo, essa distância acrescentará latência antes mesmo de a conversa começar.
- Speech to Text (somente voz): O Scribe transcreve o que o cliente diz antes que o agente possa raciocinar sobre qualquer coisa. Use a versão em tempo real, Scribe v2 Realtime, em conversas ao vivo, em vez da versão em lote, criada para priorizar precisão em vez de velocidade.
- Alternância de fala (somente voz): Determina quando o agente decide responder, conforme explicado em detalhes acima. Vale lembrar que ela é um fator de latência por si só, pois um modelo que hesita em detectar o fim de um turno adiciona atraso antes mesmo de o restante do pipeline começar.
- Text to Speech e seleção de voz (somente voz): Vozes padrão e sintéticas, assim como Instant Voice Clones, respondem mais rápido do que Professional Voice Clones. Use Professional Voice Clones apenas quando a fidelidade adicional justificar a troca por mais latência.
Para entender melhor a latência, veja as práticas recomendadas para otimização de latência e como a latência é medida e informada em todo o pipeline.
Crie seu primeiro agente com o ElevenAgents
Os recursos abordados aqui mostram o que o design de IA conversacional significa, na prática, para um agente de IA. Tudo isso é nativo do ElevenAgents e configurável em um console sem código, para que você crie um agente capaz de manter uma conversa real, em vez de apenas responder perguntas corretamente.
Para equipes que querem ajuda prática para chegar lá, os Forward Deployed Engineers da ElevenLabs trabalham diretamente com sua equipe para definir o escopo, criar e lançar um agente pronto para produção, e continuam ajudando a ajustar o desempenho depois que ele entra em operação.
Quer você esteja criando por conta própria ou buscando suporte, a maneira mais rápida de perceber a diferença é experimentar. Comece hoje criando um agente ou falando com nossa equipe de vendas.


