Diseñar una voz.
Diseñar una voz.
Diseña una voz mediante un prompt. Este método devuelve una lista de previsualizaciones de voz. Cada previsualización tiene un generated_voice_id y una muestra de la voz como audio mp3 codificado en base64. Para crear una voz, utiliza el generated_voice_id de la previsualización que prefieras con la ruta de API /v1/text-to-voice.
Encabezados
Parámetros de consulta
Solicitud
Descripción que se utilizará para la voz creada.
Modelo que se utilizará para la generación de voz. Valores posibles: eleven_multilingual_ttv_v2, eleven_ttv_v3.
Texto que se generará; su longitud debe estar entre 100 y 1000 caracteres.
Indica si se debe generar automáticamente un texto adecuado para la descripción de la voz.
Controla el nivel de volumen de la voz generada. -1 es el nivel más bajo, 1 el más alto y 0 corresponde aproximadamente a -24 LUFS.
Número aleatorio que controla la generación de voz. La misma semilla con las mismas entradas produce la misma voz.
Controla hasta qué punto la IA sigue el prompt. Los valores más bajos dan a la IA más libertad creativa, mientras que los más altos la obligan a ceñirse más al prompt. Los valores altos pueden hacer que la voz suene artificial o robótica. Recomendamos utilizar prompts más largos y detallados con una escala de orientación más baja.
Determina si las previsualizaciones de Texto a Voz deben incluirse en la respuesta. Si es true, solo se devolverán los ID generados, que después podrán transmitirse mediante la ruta de API /v1/text-to-voice/:generated_voice_id/stream.
Indica si se debe mejorar la descripción de la voz mediante IA para añadir más detalle y mejorar la calidad de generación de voz. Cuando está activado, el sistema ampliará automáticamente los prompts sencillos para convertirlos en descripciones de voz más detalladas. El valor predeterminado es False.
El ID de la sesión de remezcla.
El ID de la iteración de la sesión de remix a la que se deben adjuntar estas generaciones. Si no se proporciona, se creará una nueva iteración.
Una calidad más alta produce una mejor voz, pero con menos variedad.
Audio de referencia que se utilizará para la generación de voz. El audio debe estar codificado en base64. Solo compatible con el modelo eleven_ttv_v3.
Controla el equilibrio entre el prompt y el audio de referencia al generar muestras de voz. 0 significa que el prompt apenas influye y 1 que el audio de referencia apenas influye. Solo es compatible con el modelo eleven_ttv_v3.