Diseñar una voz.

Diseña una voz mediante un prompt. Este método devuelve una lista de previsualizaciones de voz. Cada previsualización tiene un generated_voice_id y una muestra de la voz como audio mp3 codificado en base64. Para crear una voz, utiliza el generated_voice_id de la previsualización que prefieras con la ruta de API /v1/text-to-voice.

Encabezados

xi-api-keystringOpcional

Parámetros de consulta

output_formatenumOpcional
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Solicitud

This endpoint expects an object.
voice_descriptionstringRequerido20-1000 characters

Descripción que se utilizará para la voz creada.

model_idenumOpcionalValor predeterminado: eleven_multilingual_ttv_v2

Modelo que se utilizará para la generación de voz. Valores posibles: eleven_multilingual_ttv_v2, eleven_ttv_v3.

Valores permitidos:
textstring or nullOpcional100-1000 characters

Texto que se generará; su longitud debe estar entre 100 y 1000 caracteres.

auto_generate_textbooleanOpcionalValor predeterminado: false

Indica si se debe generar automáticamente un texto adecuado para la descripción de la voz.

loudnessdoubleOpcional-1-1Valor predeterminado: 0.5

Controla el nivel de volumen de la voz generada. -1 es el nivel más bajo, 1 el más alto y 0 corresponde aproximadamente a -24 LUFS.

seedinteger or nullOpcional0-2147483647

Número aleatorio que controla la generación de voz. La misma semilla con las mismas entradas produce la misma voz.

guidance_scaledoubleOpcional0-100Valor predeterminado: 5

Controla hasta qué punto la IA sigue el prompt. Los valores más bajos dan a la IA más libertad creativa, mientras que los más altos la obligan a ceñirse más al prompt. Los valores altos pueden hacer que la voz suene artificial o robótica. Recomendamos utilizar prompts más largos y detallados con una escala de orientación más baja.

stream_previewsbooleanOpcionalValor predeterminado: false

Determina si las previsualizaciones de Texto a Voz deben incluirse en la respuesta. Si es true, solo se devolverán los ID generados, que después podrán transmitirse mediante la ruta de API /v1/text-to-voice/:generated_voice_id/stream.

should_enhancebooleanOpcionalValor predeterminado: false

Indica si se debe mejorar la descripción de la voz mediante IA para añadir más detalle y mejorar la calidad de generación de voz. Cuando está activado, el sistema ampliará automáticamente los prompts sencillos para convertirlos en descripciones de voz más detalladas. El valor predeterminado es False.

remixing_session_idstring or nullOpcional

El ID de la sesión de remezcla.

remixing_session_iteration_idstring or nullOpcional

El ID de la iteración de la sesión de remix a la que se deben adjuntar estas generaciones. Si no se proporciona, se creará una nueva iteración.

qualitydouble or nullOpcional-1-1

Una calidad más alta produce una mejor voz, pero con menos variedad.

reference_audio_base64string or nullOpcional

Audio de referencia que se utilizará para la generación de voz. El audio debe estar codificado en base64. Solo compatible con el modelo eleven_ttv_v3.

prompt_strengthdouble or nullOpcional0-1

Controla el equilibrio entre el prompt y el audio de referencia al generar muestras de voz. 0 significa que el prompt apenas influye y 1 que el audio de referencia apenas influye. Solo es compatible con el modelo eleven_ttv_v3.

Respuesta

Respuesta correcta.
previewslist of objects
Las vistas previas de las voces generadas.
textstring
El texto utilizado para previsualizar las voces.

Errores

409
Conflict Error
422
Unprocessable Entity Error