Pular para o conteúdo

Como Criar Prompts para um Sistema de Conversational AI

Escrito por
Cindy Liu
Publicado
Última atualização

OuvirOuça este artigo

Hoje, os LLMs se tornaram o coração dos sistemas de IA conversacional. Em especial, os LLMs permitem que a IA conversacional — originalmente construída com base em extensas árvores de atendimento telefônico — ofereça funcionalidades dinâmicas e experiências semelhantes às humanas. No entanto, os LLMs não são uma solução milagrosa; eles exigem prompts especializados, pois não são ajustados para a fala humana por padrão.

Os desenvolvedores cometem um erro comum ao criar prompts para LLMs em IA conversacional: reutilizar o mesmo manual usado para treinar funcionários humanos. Embora pareça uma estratégia simples, ela raramente dá resultado. Os LLMs fazem suposições diferentes das pessoas em geral, e seu tom e escopo padrão não são adequados para interações verbais.

Hoje, vamos explorar o que sabemos sobre como criar prompts para LLMs e construir sistemas de IA conversacional eficazes. Você também pode ler um guia mais completo e técnico sobre este tema na documentação para desenvolvedores da ElevenLabs.

O sistema antigo

Antes dos LLMs, os sistemas de IA conversacional usavam grandes árvores de lógica, pelas quais as solicitações eram encaminhadas com base em entradas verbais. Essa configuração era comum em números de atendimento ao cliente (como centrais de companhias aéreas) e sistemas de pagamento (como serviços telefônicos de cartão de crédito).

Esses sistemas antigos eram lentos, pareciam robóticos e só aceitavam interações humanas muito limitadas. É bem provável que você já tenha passado por isso, gritando um seco “SIM” ao telefone para responder a uma solicitação. Essa experiência ruim levava a maioria dos usuários a tentar “vencer o sistema” para conseguir falar com um atendente humano.

Porém, essas árvores de atendimento tinham uma vantagem — eram limitadas. Havia apenas alguns caminhos possíveis para uma conversa, e os desenvolvedores podiam implementar facilmente proteções para ignorar entradas não permitidas. Essa limitação sustenta os prós e os contras dos LLMs: eles vão muito além da natureza limitada das árvores de atendimento, mas também são imprevisíveis, abrindo uma caixa de Pandora de problemas — como fazer promessas impossíveis, se irritar com clientes ou expor dados sensíveis.

Lacunas padrão

Se os LLMs forem treinados apenas com um manual originalmente criado para humanos, terão resultados medíocres devido a algumas lacunas fundamentais. Entender essas lacunas ajudará você a criar prompts para resolvê-las:

Desalinhamento de tom

Os LLMs são treinados por aprendizado por reforço, em que o feedback humano incentiva os LLMs a fornecer respostas estruturadas. Em especial, as respostas dos LLMs tendem a ser longas e repletas de listas, blocos de destaque e títulos.

No entanto, no contexto da IA conversacional, os LLMs precisam reproduzir a natureza concisa e direta das interações verbais.

Lacunas de suposição

Os LLMs tendem a preencher lacunas de informação com conhecimentos inferidos, em vez de fazer perguntas. Isso pode levá-los a fazer suposições incorretas que confundem os usuários — ou resultam em erros caros, como prometer reembolsos. Mais adiante, veremos como usar uma base de conhecimento e proteções para fundamentar melhor os LLMs, evitando promessas incorretas e a execução de ações não permitidas.

Latência

Os LLMs podem invocar chamadas de função de forma programática, coletando e registrando dados em nome das pessoas. Embora essa seja, em geral, uma das maiores vantagens dos LLMs, isso também significa que as instruções de treinamento antigas, que permitiam que atendentes “ganhassem tempo” enquanto realizavam tarefas, já não são necessárias. No entanto, as chamadas de função também não são instantâneas, o que significa que os LLMs precisam avisar com precisão o usuário sempre que houver uma espera prevista, por exemplo: “dê-me um momento para analisar seu caso”.

Configurações

Personalidade

Os LLMs conseguem adaptar bem o tom a um determinado estilo. Um LLM pode ser configurado para soar amigável, bem-humorado, conciso, formal ou combinar diferentes estilos. Essa é uma informação importante ao criar um prompt para um LLM.

Por exemplo, desenvolvedores de uma aplicação de IA conversacional de atendimento ao cliente, criada para ajudar clientes insatisfeitos de companhias aéreas, podem usar um prompt como:

You are a friendly customer service agent who speaks in concise, clear, empathetic sentences.
American
Whispering
Mysterious
Gaming
Lively
Irish
Soothing
Audiobook

Nicole

Formato

Os LLMs precisam receber instruções explícitas sobre como responder. Para garantir que não incluam texto adicional de preenchimento, eles devem receber uma estrutura que delimite a resposta enviada ao usuário.

Por exemplo, os LLMs podem receber o seguinte prompt:

Respond exclusively with the string that should be read aloud to the user

Essa estrutura incentiva o LLM a fornecer uma resposta feita para ser falada em voz alta.

No entanto, os LLMs às vezes podem ter dificuldade com elementos que não parecem intuitivamente diferentes do conteúdo escrito. Um exemplo comum são os números — um LLM pode escrever um CEP como 10023, o que fará com que o modelo de Text to Speech diga “dez mil e vinte e três”. Em vez disso, o LLM deve receber instruções explícitas para dizer os números individualmente, indicando o que eles representam, por exemplo: “O CEP é um zero zero dois três.”

Temperatura

A temperatura é um parâmetro essencial ao configurar LLMs para IA conversacional. Uma temperatura mais baixa produz respostas mais focadas e determinísticas, ideais para conversas orientadas a tarefas, enquanto temperaturas mais altas criam respostas mais criativas e variadas.

Uma temperatura baixa é ideal para sistemas de IA conversacional que podem preferir respostas consistentes, como uma linha de atendimento para reembolsos. Já para sistemas que querem proporcionar aos clientes uma experiência mais envolvente e realista — como um coach digital —, uma temperatura alta é melhor:

Low Temperature: Thank you for calling ElevenLabs support. How can I help you?
High Temperature: Hey hey! You've landed at ElevenLabs support—ready to tackle your tech troubles! What's on your mind?

Bases de conhecimento

Para sistemas de IA conversacional que acessam grandes volumes de conhecimento, uma base de conhecimento deve ser usada para reduzir o tamanho do prompt. Em produção, isso normalmente é feito por meio de um banco de dados vetorial, como Pinecone ou Elasticsearch, ou do armazenamento de conhecimento direto do provedor de LLM.

De modo geral, as bases de conhecimento são essenciais para fundamentar as respostas dos LLMs em informações factuais e aprovadas. Ao criar um sistema de IA conversacional, você deve fornecer ao LLM uma base de conhecimento abrangente, com informações precisas e atualizadas sobre produtos, serviços, políticas e procedimentos. Isso evita que o LLM alucine ou invente informações, além de incentivar respostas consistentes e confiáveis em todas as conversas.

Processo

Como os LLMs costumam invocar funções em nome do usuário, eles também precisam saber quais informações são explicitamente necessárias. Por exemplo, se a função de um LLM for ajudar um usuário a agendar um corte de cabelo, ele precisará garantir que tenha:

  1. O nome do usuário
  2. A data e o horário desejados
  3. O endereço do usuário
  4. A preferência de serviço do usuário

Uma implementação ingênua pode fazer com que o LLM peça todas as informações em uma única vez na conversa. Isso funciona perfeitamente em texto, mas, em uma conversa, pode ser excessivo:

Support Agent: Could you please provide me with your name, your address, when you'd like your service to be, and what service you'd like?
Customer: My name is Mathew and anytime Wednesday afternoon works. What else did you ask for?

Como as informações geralmente são coletadas aos poucos durante a conversa, os LLMs devem ser incentivados a obtê-las gradualmente. O resultado é uma experiência muito mais conversacional:

Support Agent: Could you please provide me with your name?
Customer: My name is Mathew Pregasen.
Support Agent: Thanks Mathew. When would you like to make an appointment?
Customer: Anytime on Wednesday afternoon works fine.
Support Agent: Great. Now can I get your address to find the nearest location?
Customer: 555 West Main Street
Support Agent: Perfect. Now what service are you look for?
Customer: I'm looking for a haircut and if you could also do my beard that would be great!

Proteções

Permissões

Ao criar sistemas distribuídos, você assume que seu servidor apresentará falhas em algum momento. Da mesma forma, ao criar sistemas de IA, deve assumir que seu LLM cometerá um erro em algum momento. Para minimizar o impacto desse erro, dê a esses sistemas apenas as permissões mínimas necessárias para a tarefa. Veja algumas formas de fazer isso:

  • Defina corretamente as permissões de leitura e gravação: se o LLM só precisa ler informações de uma fonte de dados, garanta que ele receba um endpoint somente de leitura.
  • Limite o acesso a endpoints da API: se o LLM só precisa acessar determinados endpoints, garanta que ele não possa acessar nenhum outro.
  • Escalonamentos com supervisão humana: se for necessário executar uma ação de alto risco, considere um workflow human-in-the-loop que exija “aprovação do gerente” antes de executar a ação.

Validação e verificação

Ao criar sistemas de agente de voz com IA conversacionais que executam ações por meio do uso de ferramentas, é útil incorporar um processo de validação e verificação para garantir que você esteja coletando as informações corretas dos usuários. Hoje, ao falar com um atendente humano, ele repete qualquer informação crítica que você fornece para confirmar que a ouviu corretamente e que o cliente não se expressou mal. Os LLMs também podem se beneficiar de um nível semelhante de verificação de erros:

Support Agent: Great. Now can I get your address to find the nearest location?
Customer: 555 West Main Street
Support Agent: I got five five five west main street. Did I miss anything?

Para validar, toda informação recebida do cliente deve ser comparada à estrutura típica daquele tipo de informação. O número de telefone tem a quantidade correta de dígitos? A idade informada pelo cliente está dentro de uma faixa razoável? O cliente forneceu um endereço válido?

Support Agent: What would a good callback number be for you?
Customer: 317-798-97289
Support Agent: I think I might have misheard you. I heard 11 numbers. Would you mind repeating that again?

Dependendo do seu caso de uso, você pode verificar todas as informações recebidas ou apenas as que não passaram na verificação. Além disso, pode decidir verificar cada informação à medida que ela chega ou verificar tudo ao final.

Consideração final

Criar prompts para um sistema de agente de IA conversacional com sucesso envolve equilibrar as configurações e proteções certas para gerar uma experiência que simule uma conversa com uma pessoa, com mais eficiência. O processo não é tão simples quanto usar materiais de treinamento antigos para criar um prompt para um LLM; em vez disso, os LLMs são ferramentas que precisam de estrutura e estratégia especializadas para gerar resultados previsíveis e eficazes.

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade