Cambiador de Voz en streaming

Transmite audio de una voz a otra. Mantén el control total sobre la emoción, el ritmo y la entonación.

Parámetros de ruta

voice_idstringRequerido

ID de la voz que se utilizará. Usa la ruta de API Obtener voces para mostrar todas las voces disponibles.

Encabezados

xi-api-keystringOpcional

Parámetros de consulta

enable_loggingbooleanOpcionalValor predeterminado: true

When enable_logging is set to false zero retention mode will be used for the request. This will mean history features are unavailable for this request, including request stitching. Zero retention mode may only be used by enterprise customers.

optimize_streaming_latencyinteger or nullOpcionalDeprecated
Puedes activar optimizaciones de latencia a costa de cierta calidad. La mejor latencia final posible varía según el modelo. Valores posibles: 0 - modo predeterminado (sin optimizaciones de latencia) 1 - optimizaciones de latencia normales (aproximadamente el 50 % de la mejora de latencia posible con la opción 3) 2 - optimizaciones de latencia intensas (aproximadamente el 75 % de la mejora de latencia posible con la opción 3) 3 - optimizaciones de latencia máximas 4 - optimizaciones de latencia máximas, pero también con el normalizador de texto desactivado para reducir aún más la latencia (mejor latencia, pero puede pronunciar incorrectamente, por ejemplo, números y fechas). El valor predeterminado es None.
output_formatenumOpcionalValor predeterminado: mp3_44100_128
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Solicitud

This endpoint expects a multipart form containing a file.
audiofileRequerido

El archivo de audio que contiene el contenido y la emoción que controlarán la voz generada.

model_idstringOpcionalValor predeterminado: eleven_english_sts_v2

Identificador del modelo que se utilizará; puedes consultarlos mediante GET /v1/models. El modelo debe admitir voz a voz; puedes comprobarlo mediante la propiedad can_do_voice_conversion.

voice_settingsstring or nullOpcional
Ajustes de voz que anulan los ajustes almacenados para la voz indicada. Solo se aplican a la solicitud indicada. Deben enviarse como una cadena codificada en JSON.
seedinteger or nullOpcional

Si se especifica, nuestro sistema hará todo lo posible para realizar el muestreo de forma determinista, de modo que las solicitudes repetidas con la misma semilla y parámetros deberían devolver el mismo resultado. No se garantiza el determinismo. Debe ser un número entero entre 0 y 4294967295.

remove_background_noisebooleanOpcionalValor predeterminado: false

Si se establece, eliminará el ruido de fondo de tu entrada de audio mediante nuestro modelo de aislamiento de audio. Solo se aplica al Cambiador de Voz.

file_formatenum or nullOpcionalValor predeterminado: other

The format of input audio. Options are ‘pcm_s16le_16’ or ‘other’ For pcm_s16le_16, the input audio must be 16-bit PCM at a 16kHz sample rate, single channel (mono), and little-endian byte order. Latency will be lower than with passing an encoded waveform.

Valores permitidos:

Respuesta

Datos de audio en streaming.

Errores

422
Unprocessable Entity Error