Transmitir voz
Parámetros de ruta
ID de la voz que se utilizará. Usa la ruta de API Obtener voces para mostrar todas las voces disponibles.
Encabezados
Parámetros de consulta
When enable_logging is set to false zero retention mode will be used for the request. This will mean history features are unavailable for this request, including request stitching. Zero retention mode may only be used by enterprise customers.
Solicitud
El texto que se convertirá en voz.
Identificador del modelo que se utilizará; puedes consultarlos mediante GET /v1/models. El modelo debe admitir Texto a Voz; puedes comprobarlo mediante la propiedad can_do_text_to_speech.
Código de idioma (ISO 639-1) usado para aplicar un idioma al modelo y a la normalización del texto. Si el modelo no admite el código de idioma proporcionado, se ignorará. Este parámetro no es compatible con los modelos multilingual_v2.
Una lista de localizadores de diccionarios de pronunciación (id, version_id) que se aplicarán al texto. Se aplicarán en orden. Puedes incluir hasta 3 localizadores por solicitud
Si se especifica, nuestro sistema hará todo lo posible para realizar el muestreo de forma determinista, de modo que las solicitudes repetidas con la misma semilla y parámetros deberían devolver el mismo resultado. No se garantiza el determinismo. Debe ser un número entero entre 0 y 4294967295.
El texto anterior al de la solicitud actual. Puede utilizarse para mejorar la continuidad de la voz al concatenar varias generaciones o para influir en la continuidad de la voz en la generación actual.
El texto posterior al de la solicitud actual. Puede utilizarse para mejorar la continuidad de la voz al concatenar varias generaciones o para influir en la continuidad de la voz en la generación actual.
Una lista de request_id de las muestras generadas antes de esta generación. Puede utilizarse para mejorar la continuidad de la voz al dividir una tarea grande en varias solicitudes. Los resultados serán mejores si se usa el mismo modelo en todas las generaciones. Si se envían tanto previous_text como previous_request_ids, se ignorará previous_text. Se pueden enviar un máximo de 3 request_ids.
Una lista de request_id de las muestras posteriores a esta generación. next_request_ids es especialmente útil para mantener la continuidad de la voz al regenerar una muestra que haya tenido problemas de calidad de audio. Por ejemplo, si has generado 3 clips de voz y quieres mejorar el clip 2, indicar el ID de solicitud del clip 3 como next_request_id (y el del clip 1 como previous_request_id) ayudará a mantener un flujo natural en la voz combinada. Los resultados serán mejores si se usa el mismo modelo en todas las generaciones. Si se envían tanto next_text como next_request_ids, se ignorará next_text. Se pueden enviar un máximo de 3 request_ids.
Si se usa la versión IVC de una voz profesional. Esto puede mejorar la expresividad y reducir la latencia.
Este parámetro controla la normalización de texto con tres modos: ‘auto’, ‘on’ y ‘off’. Cuando se configura como ‘auto’, el sistema decidirá automáticamente si aplica la normalización de texto (por ejemplo, escribir los números con letras). Con ‘on’, la normalización de texto siempre se aplicará, mientras que con ‘off’ se omitirá.
Este parámetro controla la normalización de texto del idioma. Ayuda a pronunciar correctamente el texto en algunos idiomas compatibles. ADVERTENCIA: este parámetro puede aumentar considerablemente la latencia de la solicitud. Actualmente solo es compatible con japonés.