Presentamos Eleven v4Conoce Eleven v4, nuestro modelo más expresivo hasta la fecha. Con 3 veces más créditos incluidos en Creator+ hasta el 12 de octubre

Ir al contenido

Cómo Crear Prompts para un Sistema de IA Conversacional

Escrito por
Cindy Liu
Publicado
Última actualización

EscucharEscucha este artículo

Hoy, los LLM se han convertido en el corazón de los sistemas de IA conversacional. En concreto, los LLM permiten que la IA conversacional —construida originalmente en torno a extensos árboles telefónicos— incorpore funcionalidades dinámicas y ofrezca experiencias más humanas. Sin embargo, los LLM no son una solución milagrosa: requieren prompting especializado, ya que no están ajustados para el habla humana de forma predeterminada.

Desarrolladores cometen un error habitual al crear prompts para LLM destinados a IA conversacional: reutilizar el mismo manual que se empleaba para formar a empleados. Aunque parece una estrategia sencilla, rara vez da buenos resultados. Los LLM hacen suposiciones distintas a las de las personas y su tono y alcance predeterminados no se adaptan bien a las interacciones verbales.

Hoy veremos lo que sabemos sobre cómo crear prompts para LLM con los que desarrollar sistemas de IA conversacional eficaces. También puedes consultar una guía más completa y técnica sobre este tema en la documentación para desarrolladores de ElevenLabs.

El sistema antiguo

Antes de los LLM, los sistemas de IA conversacional utilizaban extensos árboles lógicos por los que se clasificaban las solicitudes según las respuestas verbales. Esta configuración era habitual en los números de atención al cliente (por ejemplo, líneas aéreas) y en los sistemas de pago (por ejemplo, servicios telefónicos de tarjetas de crédito).

Estos sistemas antiguos eran lentos, parecían robóticos y solo admitían intervenciones humanas muy limitadas. Es muy probable que lo hayas vivido: gritar un rotundo «SÍ» al teléfono para responder a una indicación. Esta mala experiencia llevaba a la mayoría de usuarios a intentar «vencer al sistema» para conseguir hablar con un agente humano.

Sin embargo, estos árboles telefónicos tenían una ventaja: eran limitados. Una conversación solo podía seguir un número concreto de caminos, y desarrolladores podían implementar fácilmente medidas de seguridad para ignorar entradas no permitidas. Esta limitación sustenta las ventajas e inconvenientes de los LLM: amplían enormemente las posibilidades restringidas de los árboles telefónicos, pero también son impredecibles y abren la caja de Pandora de posibles problemas, como hacer promesas imposibles, enfadarse con clientes o vulnerar datos sensibles.

Las carencias predeterminadas

Si los LLM se entrenan simplemente con un manual diseñado originalmente para personas, tendrán un éxito limitado debido a varias carencias fundamentales. Comprenderlas te ayudará a diseñar prompts que las aborden:

Desajuste de tono

Los LLM se entrenan mediante aprendizaje por refuerzo, en el que los comentarios humanos incentivan a los LLM a ofrecer respuestas estructuradas. En concreto, las respuestas de los LLM suelen ser extensas y estar llenas de listas, bloques destacados y títulos.

Sin embargo, en el contexto de la IA conversacional, los LLM deben imitar la naturaleza concisa y directa de las interacciones verbales.

Carencias en las suposiciones

Los LLM tienden a rellenar lo desconocido con conocimiento inferido en lugar de hacer preguntas. Esto puede llevarlos a hacer suposiciones incorrectas que confundan a usuarios o provoquen errores costosos, como prometer reembolsos. Más adelante veremos cómo usar una base de conocimientos y medidas de seguridad para fundamentar mejor las respuestas de los LLM, evitar que hagan promesas incorrectas y que ejecuten acciones no permitidas.

Latencia

Los LLM pueden invocar llamadas a funciones mediante programación, recopilando y registrando datos en nombre de personas. Aunque esta suele ser una de sus mayores ventajas, también implica que ya no hacen falta las instrucciones de formación anteriores que permitían a agentes telefónicos «ganar tiempo» mientras realizaban tareas. Sin embargo, las llamadas a funciones tampoco son instantáneas, por lo que los LLM deben avisar con precisión al usuario cuando se espere una demora, por ejemplo: «Dame un momento para revisar tu caso».

Configuraciones

Personalidad

Los LLM logran bastante bien adaptar el tono a un estilo determinado. Un LLM puede configurarse para sonar amable, humorístico, conciso, formal o combinar varios estilos. Es un aspecto importante al crear un prompt para un LLM.

Por ejemplo, desarrolladores de una aplicación de IA conversacional de atención al cliente diseñada para atender a clientes de una aerolínea descontentos podrían usar un prompt como este:

You are a friendly customer service agent who speaks in concise, clear, empathetic sentences.
American
Whispering
Mysterious
Gaming
Lively
Irish
Soothing
Audiobook

Nicole

Formato

Los LLM deben recibir instrucciones explícitas sobre cómo responder. Para asegurarte de que no incluyan texto de relleno adicional, debes proporcionarles una estructura que englobe la respuesta que se transmitirá al usuario.

Por ejemplo, se podría indicar a los LLM lo siguiente:

Respond exclusively with the string that should be read aloud to the user

Esta estructura anima al LLM a ofrecer una respuesta pensada para leerse en voz alta.

Sin embargo, los LLM pueden tener dificultades con elementos que quizá no parecen diferir intuitivamente del contenido escrito. Un ejemplo habitual son los números: un LLM podría escribir un código postal como 10023, lo que haría que el modelo de Texto a Voz dijera «diez mil veintitrés». En su lugar, se debe indicar explícitamente al LLM que diga los números por separado y que aclare qué representan, por ejemplo: «El código postal es uno cero cero dos tres».

Temperatura

La temperatura es un parámetro fundamental al configurar LLM para IA conversacional. Una temperatura más baja produce respuestas más enfocadas y deterministas, ideales para conversaciones orientadas a tareas, mientras que las temperaturas más altas generan respuestas más creativas y variadas.

Una temperatura baja es ideal para sistemas de IA conversacional que prefieren respuestas coherentes, como una línea de atención al cliente para reembolsos. En cambio, para sistemas que quieran ofrecer a clientes una experiencia más atractiva y realista —como un entrenador digital—, es mejor una temperatura alta:

Low Temperature: Thank you for calling ElevenLabs support. How can I help you?
High Temperature: Hey hey! You've landed at ElevenLabs support—ready to tackle your tech troubles! What's on your mind?

Bases de conocimientos

Para sistemas de IA conversacional que acceden a grandes repositorios de conocimiento, conviene usar una base de conocimientos para reducir la longitud del prompt. En producción, esto suele lograrse mediante una base de datos vectorial, como Pinecone o Elasticsearch, o el repositorio de conocimiento directo del proveedor del LLM.

En general, las bases de conocimientos son esenciales para fundamentar las respuestas de los LLM en información factual y aprobada. Al crear un sistema de IA conversacional, debes proporcionar al LLM una base de conocimientos completa que contenga información precisa y actualizada sobre productos, servicios, políticas y procedimientos. Esto evita que el LLM alucine o invente información y favorece respuestas coherentes y fiables en todas las conversaciones.

Proceso

Como los LLM suelen invocar funciones en nombre del usuario, también deben saber qué datos se necesitan explícitamente. Por ejemplo, si la tarea de un LLM es ayudar a un usuario a pedir cita para cortarse el pelo, deberá asegurarse de disponer de:

  1. El nombre del usuario
  2. La fecha y hora deseadas
  3. La dirección del usuario
  4. La preferencia de servicio del usuario

Una implementación ingenua podría hacer que el LLM pidiera toda la información en un único turno de la conversación. Esto está perfectamente bien en texto, pero en una conversación puede resultar abrumador:

Support Agent: Could you please provide me with your name, your address, when you'd like your service to be, and what service you'd like?
Customer: My name is Mathew and anytime Wednesday afternoon works. What else did you ask for?

Como la información suele recopilarse gradualmente durante una conversación, se debe animar a los LLM a obtenerla poco a poco. El resultado es una experiencia mucho más conversacional:

Support Agent: Could you please provide me with your name?
Customer: My name is Mathew Pregasen.
Support Agent: Thanks Mathew. When would you like to make an appointment?
Customer: Anytime on Wednesday afternoon works fine.
Support Agent: Great. Now can I get your address to find the nearest location?
Customer: 555 West Main Street
Support Agent: Perfect. Now what service are you look for?
Customer: I'm looking for a haircut and if you could also do my beard that would be great!

Medidas de seguridad

Permisos

Al crear sistemas distribuidos, asumes que tu servidor fallará en algún momento. Del mismo modo, al crear sistemas de IA, debes asumir que tu LLM cometerá un error en algún momento. Para minimizar el alcance de ese error, debes otorgar a estos sistemas los permisos mínimos necesarios para realizar la tarea. Estas son algunas formas de hacerlo:

  • Configura correctamente los permisos de lectura y escritura: si el LLM solo necesita leer información de una fuente de datos, asegúrate de proporcionarle una ruta de API de solo lectura.
  • Limita el acceso a rutas de API: si el LLM solo necesita acceder a determinadas rutas, asegúrate de que no pueda acceder a ninguna otra.
  • Escalaciones con intervención humana: si es necesario realizar una acción de alto riesgo, considera un workflow de intervención humana que requiera la «aprobación de un responsable» antes de ejecutar la acción.

Validación y verificación

Al crear sistemas de agentes de voz IA conversacionales que realizan acciones mediante herramientas, es útil incorporar un proceso de validación y verificación para asegurarte de recopilar la información correcta de usuarios. Hoy, cuando hablas con un agente humano, este repite cualquier información importante que le proporciones para comprobar que la ha entendido correctamente y que el cliente no se ha equivocado al hablar. Los LLM podrían beneficiarse de un nivel similar de comprobación de errores:

Support Agent: Great. Now can I get your address to find the nearest location?
Customer: 555 West Main Street
Support Agent: I got five five five west main street. Did I miss anything?

Para validar, se debe comprobar que toda la información recibida del cliente se ajuste a la estructura habitual de ese tipo de datos. ¿El número de teléfono tiene el número correcto de dígitos? ¿La edad indicada por el cliente está dentro de un rango razonable? ¿El cliente ha proporcionado una dirección válida?

Support Agent: What would a good callback number be for you?
Customer: 317-798-97289
Support Agent: I think I might have misheard you. I heard 11 numbers. Would you mind repeating that again?

Según tu caso de uso, puedes verificar toda la información recibida o solo la que no haya superado la verificación. Además, puedes decidir verificar cada dato a medida que llega o comprobarlo todo al final.

Una reflexión final

Crear correctamente un prompt para un sistema de agente de IA conversacional implica equilibrar las configuraciones y medidas de seguridad adecuadas para generar una experiencia que imite hablar con una persona, pero con mayor eficiencia. El proceso no es tan sencillo como usar antiguos materiales de formación para crear un prompt para un LLM; los LLM son herramientas que necesitan una estructura y una estrategia especializadas para lograr resultados predecibles y eficaces.

Artículos relacionados

Crea con el audio IA de la más alta calidad