Texto a Diálogo

Descubre cómo crear diálogos inmersivos y naturales con ElevenLabs.

Resumen

La API de Texto a Diálogo de ElevenLabs crea diálogos expresivos y naturales a partir de texto con Eleven v4 y Eleven v3. Recomendamos Eleven v4. Algunos casos de uso habituales son:

  • Generar conversaciones perfectas para videojuegos
  • Crear diálogos inmersivos para podcasts y otros contenidos de audio
  • Dar vida a audiolibros con narraciones expresivas

Puede que necesites varias generaciones para conseguir los resultados deseados. Al integrar Texto a Diálogo en tu aplicación, valora generar varias opciones y permitir que el usuario elija la mejor.

Escucha un ejemplo:

Opciones de voz

ElevenLabs ofrece miles de voces mediante distintos métodos de creación. Eleven v4 admite más de 90 idiomas y Eleven v3 admite más de 70 idiomas.

Más información sobre nuestras opciones de voz.

Prompting

Los modelos interpretan el contexto emocional directamente a partir del texto de entrada. Por ejemplo, añadir texto descriptivo como «dijo emocionada» o usar signos de exclamación influirá en la emoción de la voz. Los ajustes de voz, como Estabilidad y Similitud, ayudan a controlar la consistencia, mientras que la emoción subyacente procede de las señales textuales.

Consulta la guía de prompting para más detalles.

Entonaciones emocionales con audio tags

Esta función sigue en desarrollo activo; los resultados reales pueden variar.

Eleven v4 y Eleven v3 permiten usar eventos de audio no vocales para influir en la entonación del diálogo. Para ello, inserta los eventos de audio en el texto de entrada entre corchetes.

En Texto a Diálogo, cada turno tiene su propio texto y voz. Añade audio tags dentro del texto del turno al que deban afectar. El voice_id sigue seleccionando la voz del hablante para ese turno, mientras que los tags guían la entonación.

Por ejemplo, un hablante puede usar una voz mientras el texto comienza con [giggling], y el siguiente hablante puede usar otra voz mientras el texto comienza con [whispering]. Para consultar un ejemplo de API que combina tags con voice_id, consulta la guía rápida de Texto a Diálogo.

Los audio tags son instrucciones en lenguaje natural, no un parámetro enum. Escribe la instrucción entre corchetes y colócala en el texto donde deba cambiar la entonación. Los ejemplos siguientes no son exhaustivos; consulta la guía de prompting para obtener más indicaciones sobre tags eficaces.

Los audio tags tienen varias formas:

Emociones y entonación

Por ejemplo, [sad], [laughing] y [whispering]

Eventos de audio

Por ejemplo, [leaves rustling], [gentle footsteps] y [applause].

Dirección general

Por ejemplo, [football], [wrestling match] y [auctioneer].

Algunos ejemplos:

"[giggling] That's really funny!"
"[groaning] That was awful."
"Well, [sigh] I'm not sure what to say."

También puedes usar puntuación para indicar el flujo del diálogo, como las interrupciones:

"[cautiously] Hello, is this seat-"
"[jumping in] Free? [cheerfully] Yes it is."

Puedes usar puntos suspensivos para indicar frases inacabadas:

"[indecisive] Hi, can I get uhhh..."
"[quizzically] The usual?"
"[elated] Yes! [laughs] I'm so glad you knew!"

El formato de respuesta predeterminado es mp3, pero también hay disponibles otros formatos, como pcm y ulaw.

  • MP3
    • Frecuencias de muestreo: 22.05kHz - 44.1kHz
    • Tasas de bits: 32kbps - 192kbps
    • 22.05kHz @ 32kbps
    • 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
  • PCM (S16LE)
    • Frecuencias de muestreo: 16kHz - 44.1kHz
    • Tasas de bits: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
    • Profundidad de 16 bits
  • μ-law
    • Frecuencia de muestreo de 8kHz
    • Optimizado para aplicaciones de telefonía
  • A-law
    • Frecuencia de muestreo de 8kHz
    • Optimizado para aplicaciones de telefonía
  • Opus
    • Frecuencia de muestreo: 48kHz
    • Tasas de bits: 32kbps - 192kbps

Las opciones de audio de mayor calidad solo están disponibles en los planes de pago; consulta nuestra página de precios para más información.

Idiomas compatibles

Eleven v4 admite más de 90 idiomas. Eleven v3 admite más de 70 idiomas. Consulta Eleven v4 y Eleven v3 para ver las listas completas.

Preguntas frecuentes

Texto a Diálogo está disponible en los modelos Eleven v4 y Eleven v3.

Sí. Mantienes la propiedad de cualquier audio que generes. Sin embargo, los derechos de uso comercial solo están disponibles con planes de pago. Con una suscripción de pago, puedes usar el audio generado con fines comerciales y monetizar los resultados si posees los derechos de propiedad intelectual del contenido de entrada.

Una regeneración gratuita te permite volver a generar el mismo contenido de texto a voz sin coste adicional, siempre que se cumplan estas condiciones:

  • Solo está disponible en el panel de control de ElevenLabs.
  • Puedes regenerar cada contenido hasta 2 veces gratis.
  • El contenido debe ser exactamente igual que en la generación anterior. Cualquier cambio en el texto, los ajustes de voz u otros parámetros requerirá una nueva generación de pago.

Las regeneraciones gratuitas son útiles si hay una ligera distorsión en el audio generado. Según los benchmarks internos de ElevenLabs, las regeneraciones resolverán aproximadamente la mitad de los problemas de calidad; los problemas restantes suelen deberse a datos de entrenamiento deficientes.

Los modelos no son deterministas. Para lograr consistencia, usa el parámetro seed opcional, aunque aún pueden producirse diferencias sutiles.

Para una generación fiable, mantén la longitud total de todos los valores inputs[].text en 2000 caracteres o menos por solicitud. Divide los textos más largos en fragmentos y concatena el audio resultante en tu aplicación.

Datos clave

  • Modelos: Disponible con Eleven v4 y Eleven v3
  • Hablantes: Sin límite de hablantes por diálogo
  • Tamaño de solicitud: Mantén la longitud total de todos los valores inputs[].text en 2000 caracteres o menos por solicitud
  • Determinismo: El resultado no es determinista; usa el parámetro seed para obtener resultados más consistentes
  • Regeneraciones gratuitas: Hasta 2 regeneraciones gratuitas por generación (mismo contenido, mismos parámetros, solo en el panel de control)
  • Propiedad: Mantienes la propiedad del audio generado; el uso comercial requiere un plan de pago