Mezclar una voz.

Remezcla una voz existente mediante un prompt. Este método devuelve una lista de previsualizaciones de voz. Cada previsualización tiene un generated_voice_id y una muestra de la voz como audio MP3 codificado en base64. Para crear una voz, utiliza el generated_voice_id de la previsualización elegida con la ruta de API /v1/text-to-voice.

Parámetros de ruta

voice_idstringRequerido
ID de voz que se debe usar; puedes utilizar https://api.elevenlabs.io/v1/voices para enumerar todas las voces disponibles.

Encabezados

xi-api-keystringOpcional

Parámetros de consulta

output_formatenumOpcional
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Solicitud

This endpoint expects an object.
voice_descriptionstringRequerido5-1000 characters

Descripción de los cambios que se deben realizar en la voz.

textstring or nullOpcional100-1000 characters

Texto que se generará; su longitud debe estar entre 100 y 1000 caracteres.

auto_generate_textbooleanOpcionalValor predeterminado: false

Indica si se debe generar automáticamente un texto adecuado para la descripción de la voz.

loudnessdoubleOpcional-1-1Valor predeterminado: 0.5

Controla el nivel de volumen de la voz generada. -1 es el nivel más bajo, 1 el más alto y 0 corresponde aproximadamente a -24 LUFS.

seedinteger or nullOpcional0-2147483647

Número aleatorio que controla la generación de voz. La misma semilla con las mismas entradas produce la misma voz.

guidance_scaledoubleOpcional0-100Valor predeterminado: 2

Controla hasta qué punto la IA sigue el prompt. Los valores más bajos dan a la IA más libertad creativa, mientras que los más altos la obligan a ceñirse más al prompt. Los valores altos pueden hacer que la voz suene artificial o robótica. Recomendamos utilizar prompts más largos y detallados con una escala de orientación más baja.

stream_previewsbooleanOpcionalValor predeterminado: false

Determina si las previsualizaciones de Texto a Voz deben incluirse en la respuesta. Si es true, solo se devolverán los ID generados, que después podrán transmitirse mediante la ruta de API /v1/text-to-voice/:generated_voice_id/stream.

remixing_session_idstring or nullOpcional

El ID de la sesión de remezcla.

remixing_session_iteration_idstring or nullOpcional

El ID de la iteración de la sesión de remix a la que se deben adjuntar estas generaciones. Si no se proporciona, se creará una nueva iteración.

prompt_strengthdouble or nullOpcional0-1

Controla el equilibrio entre el prompt y el audio de referencia al generar muestras de voz. 0 significa que el prompt apenas influye y 1 que el audio de referencia apenas influye. Solo es compatible con el modelo eleven_ttv_v3.

Respuesta

Respuesta correcta.
previewslist of objects
Las vistas previas de las voces generadas.
textstring
El texto utilizado para previsualizar las voces.

Errores

409
Conflict Error
422
Unprocessable Entity Error