Transmitir fala com marcação de tempo

Converte texto em fala usando uma voz à sua escolha e retorna um fluxo de JSONs contendo áudio como uma string codificada em base64, junto com informações sobre quando cada caractere foi falado.

Parâmetros de caminho

voice_idstringObrigatório

ID da voz a ser usada. Use o endpoint Get voices para listar todas as vozes disponíveis.

Cabeçalhos

xi-api-keystringOpcional

Parâmetros de consulta

enable_loggingbooleanOpcionalPadrão é true
Quando enable_logging for definido como false, o modo de retenção zero será usado para a solicitação. Isso significa que os recursos de histórico não estarão disponíveis para esta solicitação, incluindo a união de solicitações. O modo de retenção zero só pode ser usado por clientes empresariais.
optimize_streaming_latencyinteger or nullOpcionalDeprecated
Você pode ativar otimizações de latência com alguma perda de qualidade. A melhor latência final possível varia conforme o modelo. Valores possíveis: 0 - modo padrão (sem otimizações de latência) 1 - otimizações normais de latência (cerca de 50% da possível melhoria de latência da opção 3) 2 - otimizações fortes de latência (cerca de 75% da possível melhoria de latência da opção 3) 3 - otimizações máximas de latência 4 - otimizações máximas de latência, mas também com o normalizador de texto desativado para reduzir ainda mais a latência (melhor latência, mas pode pronunciar incorretamente, por exemplo, números e datas). O padrão é None.
output_formatenumOpcionalPadrão é mp3_44100_128
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Solicitação

This endpoint expects an object.
textstringObrigatório

O texto que será convertido em fala.

model_idstringOpcionalPadrão é eleven_multilingual_v2

Identificador do modelo que será usado. Você pode consultá-lo usando GET /v1/models. O modelo precisa oferecer suporte a texto para voz, o que pode ser verificado pela propriedade can_do_text_to_speech.

language_codestring or nullOpcional

Código de idioma (ISO 639-1) usado para aplicar um idioma ao modelo e à normalização de texto. Se o modelo não oferecer suporte ao código de idioma fornecido, ele será ignorado. Este parâmetro não é compatível com modelos multilingual_v2.

voice_settingsobject or nullOpcional

Configurações de voz que substituem as configurações armazenadas para a voz fornecida. Elas são aplicadas somente à solicitação fornecida.

pronunciation_dictionary_locatorslist of objects or nullOpcional

Uma lista de localizadores de dicionários de pronúncia (id, version_id) a serem aplicados ao texto. Eles serão aplicados em ordem. Você pode ter até 3 localizadores por solicitação

seedinteger or nullOpcional

Se especificado, nosso sistema fará o possível para realizar a amostragem de forma determinística, de modo que solicitações repetidas com a mesma semente e os mesmos parâmetros retornem o mesmo resultado. O determinismo não é garantido. Deve ser um número inteiro entre 0 e 4294967295.

previous_textstring or nullOpcional

O texto que veio antes do texto da solicitação atual. Pode ser usado para melhorar a continuidade da fala ao concatenar várias gerações ou para influenciar a continuidade da fala na geração atual.

next_textstring or nullOpcional

O texto que vem depois do texto da solicitação atual. Pode ser usado para melhorar a continuidade da fala ao concatenar várias gerações ou para influenciar a continuidade da fala na geração atual.

previous_request_idslist of strings or nullOpcional

Uma lista de request_id das amostras geradas antes desta geração. Pode ser usada para melhorar a continuidade da fala ao dividir uma tarefa grande em várias solicitações. Os resultados serão melhores quando o mesmo modelo for usado em todas as gerações. Caso previous_text e previous_request_ids sejam enviados, previous_text será ignorado. É possível enviar no máximo 3 request_ids.

next_request_idslist of strings or nullOpcional

Uma lista de request_id das amostras geradas após esta geração. next_request_ids é especialmente útil para manter a continuidade da fala ao regenerar uma amostra que apresentou problemas de qualidade de áudio. Por exemplo, se você gerou 3 clipes de fala e quer melhorar o clipe 2, passar o ID da solicitação do clipe 3 como next_request_id, e o do clipe 1 como previous_request_id, ajudará a manter um fluxo natural na fala combinada. Os resultados serão melhores quando o mesmo modelo for usado em todas as gerações. Caso next_text e next_request_ids sejam enviados, next_text será ignorado. É possível enviar no máximo 3 request_ids.

use_pvc_as_ivcbooleanOpcionalPadrão é false

Se deve usar a versão IVC de uma voz profissional. Isso pode melhorar a expressividade e reduzir a latência.

apply_text_normalizationenumOpcionalPadrão é auto

Este parâmetro controla a normalização de texto com três modos: ‘auto’, ‘on’ e ‘off’. Quando definido como ‘auto’, o sistema decidirá automaticamente se aplicará a normalização de texto, por exemplo, escrever números por extenso. Com ‘on’, a normalização de texto será sempre aplicada; com ‘off’, ela será ignorada.

Valores permitidos:
apply_language_text_normalizationbooleanOpcionalPadrão é false

Este parâmetro controla a normalização de texto do idioma. Isso ajuda na pronúncia correta do texto em alguns idiomas compatíveis. AVISO: este parâmetro pode aumentar significativamente a latência da solicitação. No momento, é compatível apenas com japonês.

Resposta

Fluxo de trechos de transcrição

audio_base64string

Dados de áudio codificados em Base64

alignmentobject or nullOpcional

Informações de timestamp para cada caractere do texto original

normalized_alignmentobject or nullOpcional

Informações de timestamp para cada caractere do texto normalizado

Erros

422
Unprocessable Entity Error