Texto a Diálogo en streaming con marcas de tiempo

Convierte una lista de pares de texto e ID de voz en voz (diálogo) y devuelve un flujo de objetos JSON que contienen el audio como una cadena codificada en base64 y marcas de tiempo.

Encabezados

xi-api-keystringOpcional

Parámetros de consulta

output_formatenumOpcional
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.
enable_loggingbooleanOpcionalValor predeterminado: true

When enable_logging is set to false zero retention mode will be used for the request. This will mean history features are unavailable for this request, including request stitching. Zero retention mode may only be used by enterprise customers.

Solicitud

This endpoint expects an object.
inputslist of objectsRequerido

Una lista de entradas de diálogo, cada una con texto y un ID de voz que se convertirá en voz. El número máximo de ID de voz únicos es 10. Para una generación fiable, mantén el número total de caracteres de todos los valores inputs[].text en 2000 caracteres o menos por solicitud. Las solicitudes más largas pueden finalizar antes de tiempo en las respuestas de streaming o devolver un error de validación.

model_idstringOpcionalValor predeterminado: eleven_v3

Identificador del modelo que se utilizará; puedes consultarlos mediante GET /v1/models. El modelo debe admitir Texto a Voz; puedes comprobarlo mediante la propiedad can_do_text_to_speech.

language_codestring or nullOpcional

Código de idioma (ISO 639-1) usado para aplicar un idioma al modelo y a la normalización del texto. Si el modelo no admite el código de idioma proporcionado, se ignorará. Este parámetro no es compatible con los modelos multilingual_v2.

settingsobject or nullOpcional

Configuración que controla la generación de diálogos.

pronunciation_dictionary_locatorslist of objects or nullOpcional

Una lista de localizadores de diccionarios de pronunciación (id, version_id) que se aplicarán al texto. Se aplicarán en orden. Puedes incluir hasta 3 localizadores por solicitud

seedinteger or nullOpcional

Si se especifica, nuestro sistema hará todo lo posible para realizar el muestreo de forma determinista, de modo que las solicitudes repetidas con la misma semilla y parámetros deberían devolver el mismo resultado. No se garantiza el determinismo. Debe ser un número entero entre 0 y 4294967295.

apply_text_normalizationenumOpcionalValor predeterminado: auto

Este parámetro controla la normalización de texto con tres modos: ‘auto’, ‘on’ y ‘off’. Cuando se configura como ‘auto’, el sistema decidirá automáticamente si aplica la normalización de texto (por ejemplo, escribir los números con letras). Con ‘on’, la normalización de texto siempre se aplicará, mientras que con ‘off’ se omitirá.

Valores permitidos:
use_pvc_as_ivcbooleanOpcionalValor predeterminado: false

Si se usa la versión IVC de una voz profesional. Esto puede mejorar la expresividad y reducir la latencia.

previous_request_idslist of strings or nullOpcional

Una lista de request_ids de generaciones de diálogo anteriores a esta. Se utiliza para condicionar el modelo y mantener la continuidad al dividir una tarea grande en varias solicitudes. Se pueden enviar un máximo de 3 request_ids. El último request_id corresponde al audio más próximo a la solicitud actual. No todos los modelos lo admiten.

next_request_idslist of strings or nullOpcional

Una lista de request_ids de generaciones de diálogo posteriores a esta. Resulta útil para mantener la continuidad al regenerar un clip en mitad de una secuencia. Se pueden enviar un máximo de 3 request_ids. El primer request_id corresponde al audio más próximo a la solicitud actual. No todos los modelos lo admiten.

previous_textstring or nullOpcional<=100 characters

El texto que aparece inmediatamente antes de esta generación, utilizado para condicionar el modelo y mantener la continuidad prosódica. Se pueden enviar hasta 100 caracteres. No todos los modelos lo admiten.

future_textstring or nullOpcional<=100 characters

El texto que aparece inmediatamente después de esta generación, utilizado para condicionar el modelo y mantener la continuidad prosódica. Se puede enviar un máximo de 100 caracteres. No es compatible con todos los modelos.

Respuesta

Flujo de fragmentos de transcripción.

audio_base64string
Datos de audio codificados en Base64
voice_segmentslist of objects
Segmentos de voz del audio
alignmentobject or nullOpcional

Información de marcas de tiempo para cada carácter del texto original

normalized_alignmentobject or nullOpcional

Información de marcas de tiempo para cada carácter del texto normalizado

Errores

422
Unprocessable Entity Error