Apresentamos o Eleven v4Conheça o Eleven v4, nosso modelo mais expressivo até agora. Com 3x mais créditos incluídos no Creator+ até 12 de outubro

Pular para o conteúdo

Resumo do webinar: como uma das maiores seguradoras da Europa colocou agentes de IA em produção

Escrito por
Anna Neely
Publicado

OuvirOuça este artigo

Clientes de seguros raramente ligam quando tudo vai bem. Eles ligam depois de um acidente, para abrir um sinistro ou em meio a uma crise real. Essa conversa molda tudo o que vem depois e, muitas vezes, é a única interação de fato que um cliente tem com sua seguradora.

A Admiral atende milhões dessas conversas todos os anos no Reino Unido, na Itália, na França e na Espanha. Agora, usa agentes de IA para ajudar a atendê-las sem deixar de cumprir as normas. 

Neste webinar, a equipe da Admiral nos mostrou como fez isso: escolhendo um primeiro caso de uso, envolvendo as equipes jurídica e de compliance desde o dia zero e passando de um protótipo funcional para mudanças em produção que agora são implementadas em horas, não semanas.

Principais conclusões

  • Comece com algo restrito, mas real. O primeiro caso de uso da Admiral em produção, cotações de quitação em sua operação de crédito no Reino Unido, tinha um escopo limitado o bastante para ser implementado em um prazo realista, mas ainda envolvia integrações de telefonia e back-end — o suficiente para comprovar a arquitetura sem resolver tudo de uma vez.
  • Eleve o padrão antes de escalar, não o reduza. A Admiral desenvolveu para produção desde o primeiro dia, reformulou seu ritmo de governança para acompanhar a velocidade da tecnologia e envolveu as equipes jurídica e de compliance desde o dia zero com um piloto de escopo bem definido.
  • A regulação é a base, não todo o projeto. A Admiral adiciona suas próprias regras internas às exigências regulatórias, usa lógica determinística para tudo que precisa ser comprovável e encaminha clientes vulneráveis ou em situação de sofrimento para atendentes humanos.
  • É em produção que o trabalho de verdade começa. Cada mudança em um agente passa por uma suíte completa de testes de simulação e é lançada de 1% para 100% do tráfego — um ciclo que passou de semanas para horas.

Comece com algo restrito, mas não restrito demais

O primeiro caso de uso da Admiral em produção foram as cotações de quitação em sua operação de crédito no Reino Unido: um ponto de partida deliberadamente controlado, em vez do problema mais difícil da lista. Kampa descreveu a abordagem como escolher um país e uma linha de negócios para experimentar antes de expandir.

Neely disse que esse é o padrão que separa implementações que chegam à produção das que ficam estagnadas: o caso de uso precisa ser restrito o bastante para ser resolvido em um prazo realista, mas complexo o suficiente para realmente testar os sistemas ao redor. As cotações de quitação funcionaram porque a conversa tem um número limitado de caminhos, mas ainda envolve integrações de telefonia e back-end — o suficiente para comprovar a arquitetura sem tentar resolver tudo de uma vez.

Alguns fatores foram importantes nessa escolha:

  • Escopo limitado, complexidade real. O caso de uso precisa ter variação suficiente para testar a telefonia e a integração de back-end, não apenas um cenário ideal roteirizado.
  • Rapidez para chegar à produção. Quanto mais tempo uma solução fica em desenvolvimento, mais demora para que conversas reais gerem o feedback que de fato melhora o agente. Neely chamou isso de "os últimos 20%", a parte que só aparece quando clientes reais começam a conversar com o sistema.
  • Volume e impacto juntos. A Admiral começou com interações simples e de alto volume, em que tempos de espera menores e resoluções mais rápidas fariam uma diferença visível na experiência do cliente.

Eleve o padrão, não o reduza, antes de escalar

A liderança da Admiral deixou claro que os agentes de IA deveriam elevar o padrão de compliance e testes, não reduzi-lo. Kampa foi direta: o padrão de validação precisa ser mais rigoroso do que antes, porque o risco de um agente sair do roteiro ou infringir uma regra é diferente do risco de um atendente humano tomar uma decisão de julgamento.

Esse padrão se refletiu em três compromissos que a equipe assumiu desde cedo:

  • Desenvolva para produção, não para uma prova de conceito. Kampa orientou suas equipes a projetar desde o primeiro dia pensando em entrar em operação, em vez de conduzir um pequeno experimento que nunca escala.
  • Uma governança que acompanha o ritmo da tecnologia. Kampa observou que um processo de governança que leva seis meses para aprovar algo corre o risco de aprovar uma tecnologia já desatualizada quando for implementada. A Admiral reformulou seu ritmo de revisão para acompanhar a velocidade com que os modelos e as ferramentas evoluíam.
  • Jurídico e compliance desde o dia zero. Quando perguntadas sobre quando as equipes jurídica e de compliance entraram no projeto, Kampa e Clark responderam imediatamente: no dia zero, com um piloto de escopo bem definido (um número determinado de ligações), em vez de um pedido aberto de aprovação.

Deixe que a regulação defina a base, não todo o projeto

Clark deixou claro que os requisitos regulatórios — como informar ao cliente que ele está falando com uma IA e, em algumas jurisdições, oferecer o encaminhamento para um humano — variam entre Reino Unido, Itália, França e Espanha. A Admiral criou seus agentes para lidar com essas diferenças sem permitir que um cliente use o "encaminhamento" para sair de uma conversa que pode ser resolvida.

Algumas conversas são totalmente mantidas fora do agente: a Admiral encaminha clientes vulneráveis ou em sofrimento para atendentes humanos, e a IA é treinada para detectar os sinais que acionam esse encaminhamento.

Kampa apresentou a abordagem mais ampla como uma estrutura em camadas: "A regulação é apenas a base", sobre a qual se somam as próprias regras internas e os padrões culturais da Admiral, que às vezes vão além do que a regulação exige.

Essa estrutura em camadas também definiu onde a Admiral usava lógica determinística ou não determinística. Clark explicou que o raciocínio não determinístico é adequado para entender a intenção de quem liga ou detectar sofrimento, enquanto tudo que a empresa precisa poder comprovar — uma declaração regulatória obrigatória ou um caminho que o cliente precisa seguir — deve operar de forma determinística, sem nenhuma tolerância para o agente improvisar.

Neely descreveu como a estrutura de workflow da ElevenLabs dá suporte a isso na prática: os agentes são criados como um conjunto de subagentes especializados, com barreiras determinísticas, como a autenticação, que liberam ou restringem funcionalidades conforme uma condição seja atendida, em vez de deixar o modelo inferir o que tem permissão para fazer.

Desenvolva em conjunto com quem conhece o processo

Em vez de uma transferência tradicional entre requisitos de negócio e desenvolvimento de engenharia, a Admiral e a ElevenLabs realizaram workshops presenciais que reuniram, em uma mesma sala, as pessoas que conheciam o caso de uso, a equipe de engenharia e a equipe de telefonia. Neely disse que o primeiro workshop gerou uma v0 funcional do agente, conectada ao back-end e à telefonia, em quatro ou cinco horas. Kampa e Clark puderam então demonstrá-la internamente para obter aprovação e seguir com o desenvolvimento.

Clark afirmou que essa proximidade foi importante além do primeiro protótipo: os responsáveis pelo negócio agora estão próximos o suficiente da tecnologia para fazer algumas mudanças por conta própria, porque o workshop tratou a plataforma como uma forma de transferir um processo de negócio existente, em vez de introduzir algo novo e desconhecido. Kampa relacionou isso à gestão de mudanças de modo mais amplo, envolvendo líderes, gerentes intermediários e equipes da linha de frente desde cedo para que a tecnologia se torne parte de como o negócio realmente opera, e não um projeto paralelo.

É em produção que o trabalho de verdade começa

Depois de entrar em operação, a Admiral trata toda mudança em um agente, grande ou pequena, da mesma forma: como uma ramificação que passa por uma suíte completa de testes de simulação antes de chegar aos clientes. Clark descreveu como começam uma implementação com 1% do tráfego, acompanham em tempo real as métricas de satisfação e resolução dos clientes e expandem para 100% quando os resultados se mantêm — um ciclo que passou de semanas para horas.

Duas lições se destacaram nesse processo de iteração:

  • Localize o idioma, não apenas as palavras. Inicialmente, a Admiral escreveu todos os prompts e workflows em inglês e constatou que o desempenho na França, Espanha e Itália não correspondia ao do Reino Unido. Reescrever os prompts originalmente no idioma de cada mercado, em vez de traduzi-los do inglês, gerou respostas alinhadas às expectativas e à cultura dos clientes locais.
  • Os testes de simulação precisam ser levados a sério, não tratados como formalidade. Neely disse que escrever um prompt que passa em alguns testes simulados parece fácil, mas criar suítes de teste que realmente coloquem o agente à prova e definir critérios claros de sucesso desde o início é o trabalho mais difícil e mais importante. Agora, a Admiral executa de centenas a milhares de conversas simuladas para cada mudança antes de implementá-la.

Quanto aos resultados, Kampa destacou o tempo de atendimento como a principal métrica: conversas conduzidas por IA geralmente chegam à mesma resolução mais rápido do que as conduzidas por humanos, em parte porque não há silêncio enquanto um sistema carrega. Ela também descreveu o aumento gradual de CSAT e das taxas de resolução, mercado a mercado, por meio de rodadas repetidas de testes e ajustes, em vez de um único grande salto.

O que tirar disso se você está começando

O conselho de Neely para equipes que estão começando esse trabalho: escolha um caso de uso com escopo bem definido, coloque-o em produção rapidamente e deixe que conversas reais com clientes — e não mais testes antes do lançamento — revelem os casos extremos. Clark acrescentou que, depois que as integrações nas duas pontas (telefonia e sistemas internos) são comprovadas, escalar para outros casos de uso se torna cada vez mais rápido, porque a equipe já sabe quais avaliações e métricas importam.

O ponto final de Kampa foi mais além: a ambição vai além de automatizar conversas e inclui usar a mesma camada de IA para apoiar diretamente os atendentes humanos, com transcrições em tempo real, sugestões da próxima melhor ação e simulações de treinamento.

Como resumiu nossa apresentadora, a mensagem central desta conversa é que a regulação e a IA não estão em conflito. Desenvolver pensando em auditabilidade, consistência e encaminhamento para humanos desde o primeiro dia tornou os agentes da Admiral mais disciplinados, não menos.

Assista à sessão completa

Assista à sessão completa aqui, incluindo o desenvolvimento ao vivo e as perguntas e respostas do público.

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade