Diseño de IA conversacional: cómo crear experiencias de usuario más humanas
- Escrito por
- Jack Limebear
- Publicado
- Última actualización
EscucharEscucha este artículo
El diseño de IA conversacional antes consistía en crear un árbol de decisiones. Los primeros chatbots y menús de respuesta de voz interactiva funcionaban con ramificaciones rígidas y predefinidas: pulsa 1 para facturación, di «sí» o «no» y espera que la pregunta del cliente coincida con una de las rutas que habías previsto. Ese modelo solo funcionaba mientras la conversación se mantuviera dentro de lo que ya habías creado.
Los agentes de IA eliminaron esa limitación. Ahora pueden razonar sobre una conversación en tiempo real, consultar una base de conocimiento, llamar a herramientas y recordar lo que ya se ha dicho, por lo que ya no están limitados a un guion fijo.
Sin embargo, este cambio no eliminó la necesidad de diseñar la IA conversacional. Al contrario, elevó el nivel de exigencia. Sin un guion rígido al que recurrir, la persona, el workflow y los puntos de decisión de un agente deben estar lo bastante bien definidos como para funcionar en una conversación abierta y en tiempo real, en lugar de una predeterminada.
Esta guía explica qué significa realmente el diseño de IA conversacional para el chat y los agentes de voz, por qué es importante para las métricas por las que ya se evalúa a tu equipo y qué debes optimizar para que resulte más natural. Si lo haces bien, podrás implementar agentes de IA que conecten con clientes y ofrezcan un servicio mejor y más rápido.
Resumen
- El diseño de IA conversacional se refiere a cómo se estructura y optimiza la comunicación de un agente de IA para que una conversación resulte natural.
- La IA de voz admite menos fallos que el texto, ya que los problemas de voz, latencia y sincronización que pasan desapercibidos en una interfaz de chat pueden hacer que una conversación de voz parezca robótica.
- ElevenAgents está diseñado para crear agentes de voz y chat con IA que resulten humanos, gracias a una combinación de funciones que te permiten controlar la voz, la persona y el flujo de conversación, y optimizar la latencia en todos los canales.
¿Qué es el diseño de IA conversacional?
El diseño de IA conversacional es la práctica de UX de configurar cómo se comporta un agente de IA. Incluye desde su persona hasta las medidas de seguridad, workflows y bases de conocimiento que utiliza; todo funciona en conjunto para que la conversación sea tan cuidada como cualquier otra parte de la experiencia de producto.
Sin embargo, esa configuración no es igual en todas partes. Los agentes pueden operar en varios canales, como chat, voz o SMS, a partir de una única configuración. Cada uno tiene sus propias limitaciones, pero en voz son más estrictas. Cuando la voz es uno de los canales de un agente, este debe elegir y generar una voz, gestionar el ritmo y los turnos en tiempo real, y responder antes de que una pausa empiece a parecer una llamada caída. Nada de esto es opcional como puede serlo en el chat, donde una respuesta un poco lenta o imperfecta rara vez rompe la interacción.
Esto es lo que debes tener en cuenta al implementar el diseño de IA conversacional para un agente de chat y lo que añade la voz.
Los clientes no evalúan conscientemente cada uno de estos factores. Simplemente perciben cuando algo no encaja, y esa sensación basta para debilitar la confianza en el agente en su conjunto y poner en riesgo los objetivos para los que lo implementaste.
Por qué el diseño de IA conversacional es importante para una buena experiencia de usuario
Todos los factores tratados anteriormente, desde la gestión de turnos hasta la latencia y la persona, influyen en cómo un cliente percibe tu marca en un momento clave que puede convertirlo en defensor o detractor. Esa percepción se refleja directamente en las métricas por las que se evalúa a los equipos.
- Mayor satisfacción y tasas de resolución: Los clientes valoran más una interacción cuando el agente responde con rapidez y no interrumpe de forma incómoda.
- Menos abandonos: Los clientes abandonan una conversación por más motivos que las esperas largas. Una Entonación que no cumple las expectativas, ya sea una pausa incómoda en una llamada o una respuesta rígida y ajena a la marca en el chat, puede provocar el mismo impulso de terminar la conversación.
- Resolución más rápida: Una configuración clara del flujo de conversación y workflows bien definidos implican menos callejones sin salida, preguntas repetidas y momentos de «voy a transferirte».
- Menos escalaciones a agentes humanos: Cuando un agente gestiona el flujo de conversación de forma natural y sigue un workflow definido, resuelve más casos al primer intento en lugar de confundir al cliente hasta que pide hablar con una persona.
Por ejemplo, piensa en eDreams ODIGEO, una de las mayores plataformas de viajes online del mundo. Implementó agentes de IA con ElevenAgents en cinco idiomas principales y logró una mejora de dos dígitos en la velocidad de resolución y una reducción de dos dígitos en las tasas de transferencia de llamadas, impulsadas en parte por la síntesis de voz de baja latencia y un reconocimiento de intenciones más preciso al inicio de cada llamada. Resultados como estos dependen de muchas variables, más allá del diseño de la conversación, pero muestran lo que puede hacer posible un buen diseño de IA conversacional.
Cómo funciona el diseño de IA conversacional en ElevenAgents
En ElevenAgents puedes optimizar aspectos como la persona, la voz, la gestión de turnos, las transferencias y la latencia: los mismos factores que determinan si un agente parece humano. Así puedes configurar y optimizar cada uno para que tu agente cumpla su parte en una conversación real.
Selección de persona y voz
La persona determina la primera impresión del cliente, y una falta de coherencia debilita la confianza incluso antes de que empiece la conversación. Una persona demasiado rígida para una marca de retail cercana hace que clientes duden del agente antes de que haya dicho nada útil. Empieza a definirla en el prompt de sistema, donde defines el rol, la personalidad y las medidas de seguridad del agente antes que nada.
En los agentes de voz, esa persona también debe reflejarse en la voz. Una voz demasiado informal para una llamada financiera transmite la misma señal que una persona poco coherente en texto, por lo que seleccionar la voz forma parte de la misma tarea. Puedes empezar por aquí:
- Selección de voz: Adapta la voz a tu marca, audiencia y temática. El acento, el género y el tono ayudan a generar confianza en cada interlocutor y a marcar el tono de la conversación.
- Compatibilidad multilingüe: Selecciona una voz para cada idioma que admitas, en lugar de usar una misma voz en todos los mercados. Una única voz forzada a través de distintos idiomas suele sonar extranjera en al menos uno de ellos, lo que debilita la confianza que intentas generar.
ElevenAgents te da acceso a más de 11.000 voces en la Biblioteca de voces, donde puedes buscar por acento, personaje y caso de uso, así que rara vez partes de cero. Si ninguna encaja, tienes dos opciones más: clonar una voz existente a partir de una muestra de audio corta o diseñar una desde cero con un prompt de texto que describa la edad, el acento, el tono y el ritmo que buscas.
Configuración del flujo de conversación
En voz, la conversación sigue el ritmo más estricto. A diferencia del chat, donde una pausa es solo espacio en blanco, una ruptura de ritmo en una llamada se percibe de inmediato como silencio incómodo o una conexión caída. Conseguir el ritmo adecuado es el factor más importante para que un agente de voz parezca un participante natural en la conversación, y comienza con el propio modelo de gestión de turnos.
El modelo de gestión de turnos de ElevenLabs es un sistema respaldado por investigación, diseñado para detectar cuándo una persona ha terminado realmente de hablar y no solo ha hecho una pausa. Esto le permite determinar cuándo debe responder un agente, en lugar de basarse en una espera fija.
Además, estos son algunos ajustes que puedes modificar para conseguir el flujo de conversación adecuado:
- Tiempo de espera de turno: El tiempo que el agente espera en silencio antes de responder, para no intervenir mientras el cliente aún está pensando ni dejarlo esperando tras terminar.
- Tiempo de espera suave: Una breve frase de relleno que el agente usa para cubrir una pausa de procesamiento, como «Un momento» o «Déjame comprobarlo», para que clientes no piensen que la llamada se ha cortado. Evita frases de relleno que prometan un plazo concreto, como «un segundo», ya que los tiempos de respuesta reales varían.
- Interrupciones: Determina si el agente deja de hablar cuando el cliente empieza a hablar al mismo tiempo. Actívalo para un intercambio natural. Desactívalo cuando sea importante transmitir el contenido completo, como en avisos legales, instrucciones de seguridad o cualquier información que deba oírse íntegramente.
- Rapidez al tomar el turno: La rapidez con la que el agente interviene para responder cuando el cliente deja de hablar. «Impaciente» resulta adecuado para atención al cliente, donde las respuestas rápidas son prioritarias. «Paciente» funciona mejor al recopilar información del cliente, como un número de teléfono o una dirección de correo electrónico, para que el agente no lo interrumpa a mitad de un dígito. «Normal» es una buena opción predeterminada para conversaciones generales.
Aquí, los pequeños ajustes marcan una gran diferencia. Incluso un cambio mínimo en el tiempo de espera puede separar a un agente que parece atento de otro que parece interrumpir a la gente.
Diseño de workflows, transferencias y guiones
Los workflows son donde gran parte del diseño de IA conversacional se lleva a la práctica en ElevenAgents. Definen qué ocurre y cuándo: los puntos de decisión, las rutas de escalación, las transferencias y todo aquello que, de otro modo, el agente tendría que improvisar.
Los workflows funcionan junto con otros dos sistemas para perfeccionar tu agente. El prompt de sistema define el comportamiento principal del agente, como su rol, tono y lo que dirá o no dirá, en momentos clave como saludos o transferencias. Los procedimientos son una opción más prescriptiva para una tarea única y bien definida, como verificar la identidad de un cliente o gestionar una devolución. En lugar de ramificarse según lo que diga el cliente, siguen una secuencia fija de principio a fin, paso a paso, independientemente de cómo transcurra la conversación.
La forma más sencilla de empezar a crear tu agente es usar plantillas de agentes prediseñadas, que incluyen un punto de partida tanto para workflows como para prompts de sistema, por lo que puedes ajustarlos en vez de crearlos desde cero. Estos son algunos cambios con los que puedes empezar para adaptarlas a tus necesidades:
- Mapa de decisiones: Define exactamente qué hace el agente en cada punto de decisión, para que toda la conversación quede definida desde el inicio hasta la resolución. Nodos de subagentes te permiten ajustar el prompt de sistema, el modelo o incluso la voz en puntos específicos del flujo, de modo que un paso de verificación delicado pueda ejecutarse con medidas de seguridad más estrictas que una charla informal al inicio de la llamada.
- Activadores de escalación: Define activadores claros para transferir el caso a una persona, integrados en el workflow en lugar de dejar que el agente decida en el momento. Por ejemplo, escala el caso cuando un problema siga sin resolverse después de dos intentos, cuando el cliente pida hablar con un supervisor o cuando la transacción sea lo bastante delicada o valiosa como para requerir una persona.
- Contexto de transferencia: En el prompt de sistema, define qué debe recopilar el agente antes de transferir, como un ID de pedido o un número de cuenta, y las condiciones que activan una transferencia. Después, asigna esos datos guardados a la configuración de la herramienta de transferencia, para que se transfieran automáticamente en lugar de que el cliente tenga que repetirse ante un representante humano.
- Frases predefinidas: Define la redacción exacta para los momentos críticos en el prompt de sistema. Los saludos iniciales, los mensajes de error, los avisos legales y las transferencias por escalación nunca deben dejarse a la improvisación del agente. Una frase exacta como «Ahora mismo tengo problemas para acceder a esa información» es más fiable que dejar que el agente adivine cómo expresarlo cuando algo falla.
El propio workflow se crea como un gráfico visual en ElevenAgents, con cada punto de decisión y activador de escalación representado como un nodo que puedes ver y editar directamente.

Una vez en funcionamiento, las analíticas superponen datos de conversaciones reales sobre ese mismo gráfico, para que veas exactamente dónde se bloquean o abandonan clientes y lo soluciones sin tener que adivinar.
Latencia y rendimiento
La latencia es uno de los factores más importantes para que una interacción parezca humana o no. Una respuesta lenta es una de las formas más rápidas de recordar a un cliente que está hablando con una máquina, incluso si todo lo demás en la conversación va bien.
Cada parte del proceso añade su propia latencia, tanto si el agente funciona por chat como por voz. Algunos de estos factores se aplican en ambos casos. Otros solo se aplican cuando interviene la voz.
- LLM: Cada elección de modelo implica un equilibrio entre coste, calidad de razonamiento y velocidad, y el equilibrio adecuado depende de la conversación. Las interacciones sencillas y frecuentes, como las preguntas frecuentes o las confirmaciones de citas, pueden ejecutarse con un modelo más rápido y ligero sin perjudicar la experiencia. Para tareas más complejas, como el asesoramiento financiero o la resolución de problemas en varios pasos, suele merecer la pena pagar por un modelo con mayor capacidad de razonamiento, aunque responda un poco más despacio.
- Base de conocimiento y RAG: Cada consulta a la base de conocimiento añade una ida y vuelta antes de que el agente pueda responder, por lo que una base de conocimiento concisa y centrada responde más rápido que otra en la que el agente debe buscar de forma amplia.
- Integraciones y llamadas a herramientas: Cada llamada a una herramienta externa, como buscar un pedido en Salesforce o comprobar la disponibilidad en un calendario, añade su propia ida y vuelta. Escribe descripciones claras de las herramientas para que el agente no dude cuál debe llamar, y llama solo a las que la conversación realmente necesite.
- Geografía y alojamiento de datos: Haz coincidir la región de ElevenAgents con aquella donde se alojan tus datos y, en implementaciones telefónicas, también con la región de tu proveedor de telefonía (Twilio, SIP u otro). Si la región de tu agente y la región de la pasarela de llamadas están en lados opuestos del mundo, esa distancia añade latencia antes incluso de que empiece la conversación.
- Voz a Texto (solo voz): Scribe transcribe lo que dice el cliente antes de que el agente pueda razonar sobre nada. Usa la versión en tiempo real (Scribe v2 Realtime) para conversaciones en directo en lugar de la versión por lotes, diseñada para priorizar la precisión sobre la velocidad.
- Gestión de turnos (solo voz): Determina cuándo decide responder el agente, como se explica en detalle más arriba. Conviene recordarlo como un factor de latencia por sí mismo, ya que un modelo que tarda en detectar el final de un turno añade demora antes de que empiece el resto del proceso.
- Texto a Voz y selección de voz (solo voz): Las voces predeterminadas y sintéticas, junto con los clones de voz instantáneos, responden más rápido que los clones de voz profesionales. Usa clones de voz profesionales solo cuando la fidelidad adicional justifique el compromiso en latencia.
Para profundizar en la latencia, consulta las prácticas recomendadas para optimizar la latencia y cómo se mide e informa la latencia en todo el proceso.
Diseña tu primer agente con ElevenAgents
Los factores tratados aquí son lo que el diseño de IA conversacional significa en la práctica para un agente de IA. Todo está integrado de forma nativa en ElevenAgents y se puede configurar desde una consola sin código, para que crees un agente capaz de mantener una conversación real, en lugar de limitarse a responder correctamente a las preguntas.
Para equipos que quieran ayuda práctica para conseguirlo, los ingenieros integrados de ElevenLabs trabajan directamente con tu equipo para definir el alcance, crear y lanzar un agente listo para producción, y después siguen colaborando para ajustar el rendimiento una vez está en funcionamiento.
Tanto si lo creas por tu cuenta como si cuentas con ayuda, la forma más rápida de comprobar la diferencia es probarlo. Empieza hoy creando un agente o hablando con nuestro equipo de ventas.



