Transmitir voz

Convierte texto en voz con la voz que elijas y devuelve el audio como un flujo de audio.

Parámetros de ruta

voice_idstringRequerido

ID de la voz que se utilizará. Usa la ruta de API Obtener voces para mostrar todas las voces disponibles.

Encabezados

xi-api-keystringOpcional

Parámetros de consulta

enable_loggingbooleanOpcionalValor predeterminado: true

When enable_logging is set to false zero retention mode will be used for the request. This will mean history features are unavailable for this request, including request stitching. Zero retention mode may only be used by enterprise customers.

optimize_streaming_latencyinteger or nullOpcionalDeprecated
Puedes activar optimizaciones de latencia a costa de cierta calidad. La mejor latencia final posible varía según el modelo. Valores posibles: 0 - modo predeterminado (sin optimizaciones de latencia) 1 - optimizaciones de latencia normales (aproximadamente el 50 % de la mejora de latencia posible con la opción 3) 2 - optimizaciones de latencia intensas (aproximadamente el 75 % de la mejora de latencia posible con la opción 3) 3 - optimizaciones de latencia máximas 4 - optimizaciones de latencia máximas, pero también con el normalizador de texto desactivado para reducir aún más la latencia (mejor latencia, pero puede pronunciar incorrectamente, por ejemplo, números y fechas). El valor predeterminado es None.
output_formatenumOpcionalValor predeterminado: mp3_44100_128
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Solicitud

This endpoint expects an object.
textstringRequerido

El texto que se convertirá en voz.

model_idstringOpcionalValor predeterminado: eleven_multilingual_v2

Identificador del modelo que se utilizará; puedes consultarlos mediante GET /v1/models. El modelo debe admitir Texto a Voz; puedes comprobarlo mediante la propiedad can_do_text_to_speech.

language_codestring or nullOpcional

Código de idioma (ISO 639-1) usado para aplicar un idioma al modelo y a la normalización del texto. Si el modelo no admite el código de idioma proporcionado, se ignorará. Este parámetro no es compatible con los modelos multilingual_v2.

voice_settingsobject or nullOpcional
Ajustes de voz que anulan los ajustes almacenados para la voz indicada. Solo se aplican a la solicitud indicada.
pronunciation_dictionary_locatorslist of objects or nullOpcional

Una lista de localizadores de diccionarios de pronunciación (id, version_id) que se aplicarán al texto. Se aplicarán en orden. Puedes incluir hasta 3 localizadores por solicitud

seedinteger or nullOpcional

Si se especifica, nuestro sistema hará todo lo posible para realizar el muestreo de forma determinista, de modo que las solicitudes repetidas con la misma semilla y parámetros deberían devolver el mismo resultado. No se garantiza el determinismo. Debe ser un número entero entre 0 y 4294967295.

previous_textstring or nullOpcional

El texto anterior al de la solicitud actual. Puede utilizarse para mejorar la continuidad de la voz al concatenar varias generaciones o para influir en la continuidad de la voz en la generación actual.

next_textstring or nullOpcional

El texto posterior al de la solicitud actual. Puede utilizarse para mejorar la continuidad de la voz al concatenar varias generaciones o para influir en la continuidad de la voz en la generación actual.

previous_request_idslist of strings or nullOpcional

Una lista de request_id de las muestras generadas antes de esta generación. Puede utilizarse para mejorar la continuidad de la voz al dividir una tarea grande en varias solicitudes. Los resultados serán mejores si se usa el mismo modelo en todas las generaciones. Si se envían tanto previous_text como previous_request_ids, se ignorará previous_text. Se pueden enviar un máximo de 3 request_ids.

next_request_idslist of strings or nullOpcional

Una lista de request_id de las muestras posteriores a esta generación. next_request_ids es especialmente útil para mantener la continuidad de la voz al regenerar una muestra que haya tenido problemas de calidad de audio. Por ejemplo, si has generado 3 clips de voz y quieres mejorar el clip 2, indicar el ID de solicitud del clip 3 como next_request_id (y el del clip 1 como previous_request_id) ayudará a mantener un flujo natural en la voz combinada. Los resultados serán mejores si se usa el mismo modelo en todas las generaciones. Si se envían tanto next_text como next_request_ids, se ignorará next_text. Se pueden enviar un máximo de 3 request_ids.

use_pvc_as_ivcbooleanOpcionalValor predeterminado: false

Si se usa la versión IVC de una voz profesional. Esto puede mejorar la expresividad y reducir la latencia.

apply_text_normalizationenumOpcionalValor predeterminado: auto

Este parámetro controla la normalización de texto con tres modos: ‘auto’, ‘on’ y ‘off’. Cuando se configura como ‘auto’, el sistema decidirá automáticamente si aplica la normalización de texto (por ejemplo, escribir los números con letras). Con ‘on’, la normalización de texto siempre se aplicará, mientras que con ‘off’ se omitirá.

Valores permitidos:
apply_language_text_normalizationbooleanOpcionalValor predeterminado: false

Este parámetro controla la normalización de texto del idioma. Ayuda a pronunciar correctamente el texto en algunos idiomas compatibles. ADVERTENCIA: este parámetro puede aumentar considerablemente la latencia de la solicitud. Actualmente solo es compatible con japonés.

Respuesta

Datos de audio en streaming.

Errores

422
Unprocessable Entity Error