Texto a Diálogo en streaming con marcas de tiempo
Texto a Diálogo en streaming con marcas de tiempo
Convierte una lista de pares de texto e ID de voz en voz (diálogo) y devuelve un flujo de objetos JSON que contienen el audio como una cadena codificada en base64 y marcas de tiempo.
Encabezados
Parámetros de consulta
When enable_logging is set to false zero retention mode will be used for the request. This will mean history features are unavailable for this request, including request stitching. Zero retention mode may only be used by enterprise customers.
Solicitud
Una lista de entradas de diálogo, cada una con texto y un ID de voz que se convertirá en voz. El número máximo de ID de voz únicos es 10. Para una generación fiable, mantén el número total de caracteres de todos los valores inputs[].text en 2000 caracteres o menos por solicitud. Las solicitudes más largas pueden finalizar antes de tiempo en las respuestas de streaming o devolver un error de validación.
Identificador del modelo que se utilizará; puedes consultarlos mediante GET /v1/models. El modelo debe admitir Texto a Voz; puedes comprobarlo mediante la propiedad can_do_text_to_speech.
Código de idioma (ISO 639-1) usado para aplicar un idioma al modelo y a la normalización del texto. Si el modelo no admite el código de idioma proporcionado, se ignorará. Este parámetro no es compatible con los modelos multilingual_v2.
Configuración que controla la generación de diálogos.
Una lista de localizadores de diccionarios de pronunciación (id, version_id) que se aplicarán al texto. Se aplicarán en orden. Puedes incluir hasta 3 localizadores por solicitud
Si se especifica, nuestro sistema hará todo lo posible para realizar el muestreo de forma determinista, de modo que las solicitudes repetidas con la misma semilla y parámetros deberían devolver el mismo resultado. No se garantiza el determinismo. Debe ser un número entero entre 0 y 4294967295.
Este parámetro controla la normalización de texto con tres modos: ‘auto’, ‘on’ y ‘off’. Cuando se configura como ‘auto’, el sistema decidirá automáticamente si aplica la normalización de texto (por ejemplo, escribir los números con letras). Con ‘on’, la normalización de texto siempre se aplicará, mientras que con ‘off’ se omitirá.
Si se usa la versión IVC de una voz profesional. Esto puede mejorar la expresividad y reducir la latencia.
Una lista de request_ids de generaciones de diálogo anteriores a esta. Se utiliza para condicionar el modelo y mantener la continuidad al dividir una tarea grande en varias solicitudes. Se pueden enviar un máximo de 3 request_ids. El último request_id corresponde al audio más próximo a la solicitud actual. No todos los modelos lo admiten.
Una lista de request_ids de generaciones de diálogo posteriores a esta. Resulta útil para mantener la continuidad al regenerar un clip en mitad de una secuencia. Se pueden enviar un máximo de 3 request_ids. El primer request_id corresponde al audio más próximo a la solicitud actual. No todos los modelos lo admiten.
El texto que aparece inmediatamente antes de esta generación, utilizado para condicionar el modelo y mantener la continuidad prosódica. Se pueden enviar hasta 100 caracteres. No todos los modelos lo admiten.
El texto que aparece inmediatamente después de esta generación, utilizado para condicionar el modelo y mantener la continuidad prosódica. Se puede enviar un máximo de 100 caracteres. No es compatible con todos los modelos.
Respuesta
Flujo de fragmentos de transcripción.
Información de marcas de tiempo para cada carácter del texto original
Información de marcas de tiempo para cada carácter del texto normalizado