Transmitir fala com marcação de tempo
Transmitir fala com marcação de tempo
Converte texto em fala usando uma voz à sua escolha e retorna um fluxo de JSONs contendo áudio como uma string codificada em base64, junto com informações sobre quando cada caractere foi falado.
Parâmetros de caminho
ID da voz a ser usada. Use o endpoint Get voices para listar todas as vozes disponíveis.
Cabeçalhos
Parâmetros de consulta
Solicitação
O texto que será convertido em fala.
Identificador do modelo que será usado. Você pode consultá-lo usando GET /v1/models. O modelo precisa oferecer suporte a texto para voz, o que pode ser verificado pela propriedade can_do_text_to_speech.
Código de idioma (ISO 639-1) usado para aplicar um idioma ao modelo e à normalização de texto. Se o modelo não oferecer suporte ao código de idioma fornecido, ele será ignorado. Este parâmetro não é compatível com modelos multilingual_v2.
Configurações de voz que substituem as configurações armazenadas para a voz fornecida. Elas são aplicadas somente à solicitação fornecida.
Uma lista de localizadores de dicionários de pronúncia (id, version_id) a serem aplicados ao texto. Eles serão aplicados em ordem. Você pode ter até 3 localizadores por solicitação
Se especificado, nosso sistema fará o possível para realizar a amostragem de forma determinística, de modo que solicitações repetidas com a mesma semente e os mesmos parâmetros retornem o mesmo resultado. O determinismo não é garantido. Deve ser um número inteiro entre 0 e 4294967295.
O texto que veio antes do texto da solicitação atual. Pode ser usado para melhorar a continuidade da fala ao concatenar várias gerações ou para influenciar a continuidade da fala na geração atual.
O texto que vem depois do texto da solicitação atual. Pode ser usado para melhorar a continuidade da fala ao concatenar várias gerações ou para influenciar a continuidade da fala na geração atual.
Uma lista de request_id das amostras geradas antes desta geração. Pode ser usada para melhorar a continuidade da fala ao dividir uma tarefa grande em várias solicitações. Os resultados serão melhores quando o mesmo modelo for usado em todas as gerações. Caso previous_text e previous_request_ids sejam enviados, previous_text será ignorado. É possível enviar no máximo 3 request_ids.
Uma lista de request_id das amostras geradas após esta geração. next_request_ids é especialmente útil para manter a continuidade da fala ao regenerar uma amostra que apresentou problemas de qualidade de áudio. Por exemplo, se você gerou 3 clipes de fala e quer melhorar o clipe 2, passar o ID da solicitação do clipe 3 como next_request_id, e o do clipe 1 como previous_request_id, ajudará a manter um fluxo natural na fala combinada. Os resultados serão melhores quando o mesmo modelo for usado em todas as gerações. Caso next_text e next_request_ids sejam enviados, next_text será ignorado. É possível enviar no máximo 3 request_ids.
Se deve usar a versão IVC de uma voz profissional. Isso pode melhorar a expressividade e reduzir a latência.
Este parâmetro controla a normalização de texto com três modos: ‘auto’, ‘on’ e ‘off’. Quando definido como ‘auto’, o sistema decidirá automaticamente se aplicará a normalização de texto, por exemplo, escrever números por extenso. Com ‘on’, a normalização de texto será sempre aplicada; com ‘off’, ela será ignorada.
Este parâmetro controla a normalização de texto do idioma. Isso ajuda na pronúncia correta do texto em alguns idiomas compatíveis. AVISO: este parâmetro pode aumentar significativamente a latência da solicitação. No momento, é compatível apenas com japonês.
Resposta
Fluxo de trechos de transcrição
Dados de áudio codificados em Base64
Informações de timestamp para cada caractere do texto original
Informações de timestamp para cada caractere do texto normalizado