Transmitir diálogo

Converte uma lista de pares de texto e ID de voz em fala (diálogo) e retorna um fluxo de áudio.

Cabeçalhos

xi-api-keystringOpcional

Parâmetros de consulta

output_formatenumOpcional
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.
enable_loggingbooleanOpcionalPadrão é true
Quando enable_logging for definido como false, o modo de retenção zero será usado para a solicitação. Isso significa que os recursos de histórico não estarão disponíveis para esta solicitação, incluindo a união de solicitações. O modo de retenção zero só pode ser usado por clientes empresariais.

Solicitação

This endpoint expects an object.
inputslist of objectsObrigatório

Uma lista de entradas de diálogo, cada uma contendo texto e um ID de voz que será convertido em fala. O número máximo de IDs de voz únicos é 10. Para uma geração confiável, mantenha o total de caracteres em todos os valores de inputs[].text em até 2.000 caracteres por solicitação. Solicitações mais longas podem ser encerradas antecipadamente em respostas de streaming ou retornar um erro de validação.

model_idstringOpcionalPadrão é eleven_v3

Identificador do modelo que será usado. Você pode consultá-lo usando GET /v1/models. O modelo precisa oferecer suporte a texto para voz, o que pode ser verificado pela propriedade can_do_text_to_speech.

language_codestring or nullOpcional

Código de idioma (ISO 639-1) usado para aplicar um idioma ao modelo e à normalização de texto. Se o modelo não oferecer suporte ao código de idioma fornecido, ele será ignorado. Este parâmetro não é compatível com modelos multilingual_v2.

settingsobject or nullOpcional

Configurações que controlam a geração de diálogos.

previous_textstring or nullOpcional<=100 characters

O texto imediatamente anterior a esta geração, usado para condicionar o modelo quanto à continuidade prosódica. É possível enviar no máximo 100 caracteres. Não é compatível com todos os modelos.

future_textstring or nullOpcional<=100 characters

O texto que vem imediatamente após esta geração, usado para condicionar o modelo à continuidade prosódica. É possível enviar no máximo 100 caracteres. Nem todos os modelos oferecem suporte.

pronunciation_dictionary_locatorslist of objects or nullOpcional

Uma lista de localizadores de dicionários de pronúncia (id, version_id) a serem aplicados ao texto. Eles serão aplicados em ordem. Você pode ter até 3 localizadores por solicitação

seedinteger or nullOpcional

Se especificado, nosso sistema fará o possível para realizar a amostragem de forma determinística, de modo que solicitações repetidas com a mesma semente e os mesmos parâmetros retornem o mesmo resultado. O determinismo não é garantido. Deve ser um número inteiro entre 0 e 4294967295.

apply_text_normalizationenumOpcionalPadrão é auto

Este parâmetro controla a normalização de texto com três modos: ‘auto’, ‘on’ e ‘off’. Quando definido como ‘auto’, o sistema decidirá automaticamente se aplicará a normalização de texto, por exemplo, escrever números por extenso. Com ‘on’, a normalização de texto será sempre aplicada; com ‘off’, ela será ignorada.

Valores permitidos:
use_pvc_as_ivcbooleanOpcionalPadrão é false

Se deve usar a versão IVC de uma voz profissional. Isso pode melhorar a expressividade e reduzir a latência.

previous_request_idslist of strings or nullOpcional

Uma lista de request_ids de gerações de diálogo anteriores a esta. Usada para condicionar o modelo para manter a continuidade ao dividir uma tarefa grande em várias solicitações. É possível enviar no máximo 3 request_ids. O último request_id corresponde ao áudio mais próximo da solicitação atual. Não é compatível com todos os modelos.

next_request_idslist of strings or nullOpcional

Uma lista de request_ids de gerações de diálogo posteriores a esta. Útil para manter a continuidade ao regenerar um clipe no meio de uma sequência. É possível enviar no máximo 3 request_ids. O primeiro request_id corresponde ao áudio mais próximo da solicitação atual. Não é compatível com todos os modelos.

Resposta

Dados de áudio em streaming

Erros

422
Unprocessable Entity Error