Pular para o conteúdo

Recursos dos agentes de voz: memória, escalonamento e muito mais

Escrito por
Jack Limebear
Publicado

OuvirOuça este artigo

Os sistemas telefônicos tradicionais dependiam de respostas guiadas por menus. Isso limitava sua capacidade de se adaptar à fala natural ou lidar com solicitações complexas de workflow. Os recursos dos agentes de voz atuais foram muito além disso, unindo reconhecimento de fala em tempo real, raciocínio e contexto em sistemas de voz mais responsivos.


Os agentes de voz modernos podem autenticar um cliente, buscar suas informações no sistema, fornecer respostas adequadas com dados em tempo real, reconhecer quando a situação precisa ser transferida e muito mais. Tudo isso acontece durante uma chamada ao vivo, sem colocar o usuário em uma fila telefônica para esperar por um atendente humano.

Este guia responde a seis perguntas sobre os recursos dos agentes de voz com IA: como eles se lembram de quem liga, como lidam com a frustração, quais dados os treinam, como personalizam, como protegem dados sensíveis e o que fazem pela satisfação do cliente (CSAT). Cada resposta descreve como o ElevenAgents faz isso na prática.

Six voice agent capabilities: memory, training, data, difficult calls, personalization, and outcomes.

Resumo:

  • Os agentes de voz combinam reconhecimento de fala em tempo real com raciocínio sobre dados ao vivo, o que permite autenticar quem liga, responder com informações atuais e concluir tarefas durante uma chamada, sem encaminhar ninguém para uma fila telefônica.
  • A memória do agente funciona em uma única chamada e entre interações recorrentes, buscando o histórico do cliente em um CRM no início por meio de variáveis dinâmicas e registrando os resultados por webhooks pós-chamada.
  • Quem liga frustrado é atendido com detecção de sentimento e desescalonamento em tempo real, com uma opção de transferência para uma pessoa ou um agente especializado quando a frustração ultrapassa um limite ou a pessoa pede para falar com alguém.
  • Os agentes desenvolvem conhecimento a partir de conteúdo enviado em formatos como PDF, Word, texto, Markdown, HTML e EPUB, usando RAG para recuperar trechos relevantes, enquanto documentos menores permanecem em contexto completo.
  • Recomendações personalizadas combinam dados do CRM, a solicitação ao vivo e consultas de produtos durante a chamada por meio de tool calling, para que o agente compare a disponibilidade real com o histórico de quem liga.
  • Configurações de privacidade personalizáveis controlam a retenção de dados, o armazenamento de áudio, a redação de transcrições e o modo de retenção zero, com elegibilidade para HIPAA em implementações empresariais na área da saúde.

Quais são os recursos dos agentes de voz?

Um agente de voz é um sistema de inteligência artificial (IA) capaz de conduzir conversas faladas em tempo real com clientes. Isso vai além dos recursos de voz tradicionais ao entender a intenção, o contexto da situação e concluir tarefas em nome do cliente. Esses agentes funcionam ouvindo o cliente, raciocinando sobre o que ouvem, consultando os sistemas necessários para concluir a solicitação e, então, falando com o cliente em um tom natural, semelhante ao de um atendente humano. 

Ao definir os recursos de um agente de voz, consideramos as funções específicas que tornam úteis as conversas entre o agente e o cliente. Essas funções podem ser divididas em várias categorias para determinar seu desempenho nessa função:

  • Memória e contexto: A capacidade de reter informações sobre um cliente em uma única chamada ou em várias interações com o mesmo cliente.
  • Lidar com cenários e conversas difíceis: Os agentes mantêm o foco e seguem políticas quando quem liga está frustrado, confuso ou não aceita o resultado. 
  • Capacidade de treinamento com seu conteúdo: Os agentes usam documentação interna e políticas existentes da empresa para obter respostas para a interação, em vez de usar um roteiro genérico.
  • Personalização para o cliente: Os agentes ajustam o tom, o ritmo ou as recomendações conforme a pessoa que liga, em vez de apresentar um menu genérico de opções. 
  • Tratamento de dados: As informações compartilhadas com os agentes são gerenciadas de acordo com os dados armazenados, o período de retenção pela empresa e quem pode acessá-los. 
  • Resultados mensuráveis de sucesso: Definir um sistema que ofereça acompanhamento interno para avaliar melhor se um agente de voz resolve problemas e se faz isso com precisão em comparação a um atendente humano. 

Esses recursos dos agentes de voz podem, em última análise, ajudar as empresas a adaptar melhor seus agentes às necessidades dos clientes. 

Como os agentes de voz se lembram de conversas anteriores com clientes?

Agentes de voz não têm memória integrada entre chamadas. A memória entre chamadas é formada por três partes: variáveis dinâmicas que inserem dados do CRM no início da chamada, um webhook de início de conversa que busca esses dados e um webhook pós-chamada que registra os resultados. Em uma única chamada, o agente mantém automaticamente todo o contexto da conversa.

Dependendo da sua arquitetura específica, os agentes de voz podem lidar com a memória do cliente em dois níveis:

  • Em uma única chamada: O agente mantém o contexto da conversa e acompanha tudo o que é dito na sessão, minimizando a necessidade de o cliente se repetir durante a chamada.
  • Entre várias interações: Essa memória é obtida por meio da integração multicanal. O agente consulta o histórico do cliente no CRM ou banco de dados da empresa no início da chamada e, depois, documenta os resultados da interação para que a próxima conversa comece com conhecimento desse histórico.

O contexto é inserido no início da conversa por meio de variáveis dinâmicas com o ElevenAgents. Essas variáveis inserem valores de tempo de execução nos prompts, nas mensagens e nas ferramentas do agente. Isso permite que o agente personalize cada conversa com informações específicas do usuário, sem criar um agente separado para cada cliente. O nome de quem liga, o status da conta, informações identificáveis e o histórico de interações anteriores podem ser enviados ao agente de voz no início da conversa. 

Para chamadas telefônicas recebidas, o ElevenAgents pode buscar dados iniciais nos servidores da empresa por meio de um webhook de início de conversa, aplicando o JSON retornado pelo endpoint enquanto o agente carrega o contexto. Em uma situação ao vivo, a plataforma busca os dados necessários durante o período inicial de conexão com o cliente. Esse processo geralmente pode aparecer como um toque normal ou música de espera enquanto o agente analisa o contexto em paralelo. 

Depois que a chamada termina, o fluxo funciona de modo inverso. O agente faz isso enviando os resultados da chamada de volta ao CRM ou sistema de suporte por meio de webhooks pós-chamada ou outras ferramentas de chamada. Ele registra o que aconteceu durante a chamada e o que ainda pode precisar de acompanhamento com o cliente. A documentação da interação com o cliente é o que mantém a memória do agente de voz persistente. Assim, o próximo agente ou atendente humano com quem o cliente interagir terá todo o contexto antes do início da conversa. 

Voice agents use CRM variables and webhooks to remember callers across calls.

Como os agentes de voz lidam com clientes frustrados ou irritados?

Clientes frustrados ou irritados podem surgir em qualquer nível e ambiente de atendimento. Os agentes de voz sabem lidar com essas situações ao detectar, se adaptar e escalar quando necessário. 

Veja como os agentes de voz conseguem lidar com situações difíceis com clientes:

  • Detecção de frustração: A detecção das respostas dos clientes funciona melhor por meio da análise de sentimento. Essa análise classifica as conversas como positivas, negativas ou neutras. Em conversas individuais, a análise de sentimento posiciona cada resposta do usuário em uma trajetória pontuada do negativo ao positivo, para que você veja em que momento a conversa saiu do rumo. Quando a detecção é agregada entre tópicos, ela pode revelar quais assuntos mais frustram quem liga e indicar onde melhorar. Com modelos líderes de agentes de voz, como os disponíveis na ElevenLabs, os agentes conseguem até entender o tom por transcrições ao vivo e se adaptar de acordo.
  • Adaptação em tempo real: O comportamento de desescalonamento pode ser definido diretamente no prompt de sistema de um agente, permitindo que ele reconheça a frustração de quem liga, evite discutir, mantenha as respostas calmas e alinhadas à conversa e priorize um caminho para a resolução. 
  • Escalonamento para uma pessoa: A ferramenta de transferência para número transfere a chamada para uma pessoa quando determinadas condições são atendidas, geralmente quando quem liga pede para falar com uma pessoa, repete a mesma reclamação duas vezes ou o sentimento permanece negativo por várias interações consecutivas. Escreva essas condições no prompt de sistema. O agente pode reproduzir uma mensagem para quem liga enquanto aguarda e passar um resumo separado ao operador que recebe a chamada, para que a pessoa atenda com contexto em vez de começar do zero. O ElevenAgents também oferece transferência entre agentes, que direciona a conversa para um agente especializado quando quem liga precisa de uma expertise diferente, em vez de uma pessoa.

O aspecto mais importante dos recursos de agentes de voz para lidar com clientes frustrados é o caminho de transferência. 

Voice agents detect frustration, adapt responses, and escalate persistent complaints to humans.

Quais formatos de arquivo podem ser usados para treinar um agente de voz?

Os agentes de voz modernos não são treinados no sentido tradicional de IA/LLM. Eles recebem uma base de conhecimento para usar. Esses agentes recebem documentação, páginas da web ou recursos de texto simples que fazem referência a uma base de conhecimento, da qual recuperam trechos relevantes durante as chamadas. Essa abordagem é chamada de geração aumentada por recuperação (RAG). Esse processo permite que o agente use muito mais informações do que um único prompt poderia fornecer.

Há várias maneiras de adicionar informações a uma base de conhecimento. Você pode enviar um arquivo, direcionar o agente para uma URL ou colar o texto diretamente. No ElevenAgents, os arquivos enviados podem ter até 20 MB cada e estão nos seguintes formatos: 

  • .pdf 
  • .docx 
  • .txt 
  • .md 
  • .html 
  • .epub

O formato afeta a qualidade da recuperação. Markdown, texto simples e DOCX são extraídos de forma limpa e segmentados de maneira previsível para RAG. PDFs com layouts de várias colunas, tabelas ou páginas digitalizadas são extraídos de forma inadequada e devem ser convertidos antes do envio. 

Depois que o documento é anexado, o agente o usa de uma das duas formas. Documentos pequenos podem permanecer em contexto completo, em que todo o texto do documento fica no prompt a cada interação. A segunda forma é indexar documentos maiores para RAG. 

Nesse processo, apenas os trechos mais relevantes para cada pergunta são recuperados no momento da conversa. Por exemplo, um documento só pode ser usado em contexto completo se o texto extraído couber em 250.000 caracteres. Tudo que for maior passa por RAG. Isso permite que o sistema escolha automaticamente o caminho certo quando RAG está ativado.

Voice agent knowledge base supports uploads, full context, RAG, and format-aware retrieval.

Como os agentes de voz oferecem recomendações personalizadas de produtos?

As recomendações personalizadas de produtos vêm da combinação de várias informações sobre quem liga no momento da interação com o agente de voz. Essas informações incluem quem é a pessoa, o que ela está pedindo e o que está disponível. O agente conhece informações sobre quem liga a partir dos dados do CRM enviados pelas variáveis dinâmicas. 

Ele também entende a solicitação pela conversa ao vivo e sabe o que está disponível ao consultar dados de produtos por chamadas de ferramentas. Então, o agente raciocina com base em tudo isso para recomendar opções personalizadas a quem liga, da mesma forma que faria um representante humano bem informado. 

Para entender melhor como isso funciona em um contexto realista de agente de voz, veja como seria em uma chamada real. 

Um cliente recorrente liga para a linha de suporte técnico de uma varejista porque não consegue acessar sua conta de usuário e quer fazer uma compra. Veja como o agente de voz transforma essa chamada em uma recomendação personalizada:

  • Busca o contexto no início: O agente já conhece o histórico de compras de quem liga e outras informações relacionadas porque isso foi recuperado no início da chamada.
  • Incorpora a solicitação à recomendação: Quem liga descreve o que precisa, e o agente incorpora essa descrição à recomendação em vez de começar do zero.
  • Consulta dados de produtos ao vivo durante a chamada: O agente chama a API de produtos durante a conversa para verificar os níveis atuais de estoque e os preços, em vez de depender de informações do treinamento.
  • Compara a disponibilidade com o perfil de quem liga: Ele compara o que há em estoque com a descrição e o histórico de compras da pessoa.
  • Recomenda e conclui o pedido: O agente sugere um produto e finaliza o pedido quando solicitado, sem precisar transferir a pessoa para outro lugar.


Toda essa conversa é viabilizada por tool calling. É assim que um bot de voz pode acessar sistemas externos, como um catálogo de produtos ou uma API de pedidos, e incorporar essas informações às respostas. A documentação da ElevenLabs sobre ferramentas explica como essa conexão é configurada.

Five-step call flow uses history and live stock data to recommend and complete an order.

Os agentes de voz podem lidar com dados confidenciais de clientes?

Os agentes de voz oferecem controles configuráveis para períodos de retenção, a opção de não armazenar o áudio das chamadas, redação do histórico de conversas e políticas rigorosas de retenção para setores altamente regulamentados, como a área da saúde. 

Com o ElevenAgents, cada um desses controles é configurado nas definições de privacidade. Veja como funciona:

  • Retenção: Transcrições de conversas e gravações de áudio são armazenadas apenas por um período específico. Por padrão, o ElevenAgents mantém transcrições e gravações por dois anos, período que pode ser personalizado de zero dias a ilimitado; para conformidade com HIPAA, recomenda-se uma retenção mínima de seis anos. Para garantir total alinhamento com a HIPAA, lembre-se de que o processamento de Informações de Saúde Protegidas em nossa plataforma exige que o Modo de Retenção Zero esteja ativado, o que significa que você armazenará com segurança esses seis anos de registros em sua própria infraestrutura por meio de webhooks.
  • Retenção de áudio: As gravações de áudio das chamadas podem ser mantidas para fins de retenção de clientes ou totalmente desativadas para garantir que o áudio do cliente não seja retido. Desativar o salvamento de gravações de áudio e definir uma política de retenção de zero dias significa que os dados são excluídos imediatamente após a chamada.
  • Redação do histórico de conversas: Após o fim da conversa, uma etapa de pós-processamento que analisa a transcrição e o áudio depois de cada chamada ajuda a proteger dados confidenciais de clientes por meio de redação. Essa etapa analisa o áudio e a transcrição para detectar informações confidenciais, exibindo um marcador de posição nas transcrições e um sinal sonoro nos trechos de áudio. Assim, o histórico da conversa permanece disponível para revisão, reduzindo a exposição a informações confidenciais. 
  • Modo de Retenção Zero: Essa configuração é mais adequada para exigências rigorosas de retenção. A maioria dos dados em solicitações e respostas é excluída imediatamente após a conclusão da solicitação. Essa configuração se aplica ao tráfego de API e está disponível para clientes empresariais.

Para implementações relacionadas à saúde, o ElevenAgents é elegível para HIPAA quando associado a Acordos de Associado Comercial (BAA) disponíveis para clientes empresariais. Quando combinado a um BAA assinado, nosso Modo de Retenção Zero foi desenvolvido para dar suporte à conformidade com HIPAA, desde que o cliente configure e use a plataforma de acordo com seus requisitos de conformidade. Os detalhes completos de configuração desses controles estão disponíveis na documentação de privacidade da ElevenLabs.

Four ElevenAgents privacy controls: retention, audio, redaction, and zero retention mode.

Quais melhorias na satisfação do cliente os agentes de voz oferecem?

Fatores que frequentemente levam a uma maior satisfação do cliente incluem eliminar ou reduzir o tempo de espera, manter a consistência e resolver solicitações mais rapidamente. Como os agentes de voz podem atender chamadas sem demora, quem liga geralmente recebe uma qualidade de resposta consistente, independentemente do horário. Isso reduz o tempo de resolução de solicitações rotineiras que antes ficavam em uma fila aguardando um atendente humano. 

A ressalva é que, quando uma interação com o cliente dá errado, prender uma pessoa frustrada em um loop de agentes prejudica a experiência do cliente mais rápido do que a música de espera jamais prejudicou. Muitas organizações não acompanham a satisfação do cliente de forma isolada. As métricas relatadas junto com ela incluem a taxa de contenção (a taxa em que o agente resolve uma solicitação sem envolvimento humano), o tempo médio de atendimento e a resolução na primeira chamada. 

Quando combinadas em um relatório para análise, essas métricas costumam contar uma história diferente daquela apresentada por uma métrica isolada. Por exemplo, uma alta taxa de contenção somada a uma queda na satisfação do cliente costuma indicar que as chamadas estão sendo resolvidas rapidamente sem a necessidade de envolvimento humano. 

A Admiral é um bom exemplo de empresa que prioriza a resolução no primeiro contato em vez da contenção. Como abordado neste webinar, ela buscava uma taxa de resolução de 90%, além de oferecer disponibilidade 24 horas por dia, 7 dias por semana, e uma melhoria real no NPS. Uma transferência para uma pessoa nunca era considerada algo negativo para o agente, pois resolver o problema era mais importante do que manter a chamada contida. 

Saiba mais sobre como esse recurso do agente de voz se integra ao CRM e à estrutura de voz da empresa.

Conheça todos os recursos dos agentes de voz no ElevenAgents

Os recursos dos agentes de voz abordados neste guia não são produtos separados ou independentes. Esses recursos devem ser incorporados ao mesmo agente e configuração, com as variáveis dinâmicas, ferramentas e configurações de privacidade adequadas às necessidades de negócio da organização.

Começar pode ser tão simples quanto iniciar com um tipo de chamada, conectando-o apenas aos sistemas de que precisará. A partir daí, o agente pode ser ampliado quando as métricas mostrarem que está funcionando. 

Saiba mais sobre o ElevenAgents ou fale com vendas para começar hoje.

Implemente IA empresarial hoje com o ElevenAgents

Precisa de outra coisa? Acesse nossa Central de ajuda

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade