Criar fala
Converte texto em fala usando uma voz à sua escolha e retorna áudio.
Parâmetros de caminho
ID da voz a ser usada. Use o endpoint Get voices para listar todas as vozes disponíveis.
Cabeçalhos
Parâmetros de consulta
Solicitação
O texto que será convertido em fala.
Identificador do modelo que será usado. Você pode consultá-lo usando GET /v1/models. O modelo precisa oferecer suporte a texto para voz, o que pode ser verificado pela propriedade can_do_text_to_speech.
Código de idioma (ISO 639-1) usado para aplicar um idioma ao modelo e à normalização de texto. Se o modelo não oferecer suporte ao código de idioma fornecido, ele será ignorado. Este parâmetro não é compatível com modelos multilingual_v2.
Configurações de voz que substituem as configurações armazenadas para a voz fornecida. Elas são aplicadas somente à solicitação fornecida.
Uma lista de localizadores de dicionários de pronúncia (id, version_id) a serem aplicados ao texto. Eles serão aplicados em ordem. Você pode ter até 3 localizadores por solicitação
Se especificado, nosso sistema fará o possível para realizar a amostragem de forma determinística, de modo que solicitações repetidas com a mesma semente e os mesmos parâmetros retornem o mesmo resultado. O determinismo não é garantido. Deve ser um número inteiro entre 0 e 4294967295.
O texto que veio antes do texto da solicitação atual. Pode ser usado para melhorar a continuidade da fala ao concatenar várias gerações ou para influenciar a continuidade da fala na geração atual.
O texto que vem depois do texto da solicitação atual. Pode ser usado para melhorar a continuidade da fala ao concatenar várias gerações ou para influenciar a continuidade da fala na geração atual.
Uma lista de request_id das amostras geradas antes desta geração. Pode ser usada para melhorar a continuidade da fala ao dividir uma tarefa grande em várias solicitações. Os resultados serão melhores quando o mesmo modelo for usado em todas as gerações. Caso previous_text e previous_request_ids sejam enviados, previous_text será ignorado. É possível enviar no máximo 3 request_ids.
Uma lista de request_id das amostras geradas após esta geração. next_request_ids é especialmente útil para manter a continuidade da fala ao regenerar uma amostra que apresentou problemas de qualidade de áudio. Por exemplo, se você gerou 3 clipes de fala e quer melhorar o clipe 2, passar o ID da solicitação do clipe 3 como next_request_id, e o do clipe 1 como previous_request_id, ajudará a manter um fluxo natural na fala combinada. Os resultados serão melhores quando o mesmo modelo for usado em todas as gerações. Caso next_text e next_request_ids sejam enviados, next_text será ignorado. É possível enviar no máximo 3 request_ids.
Se deve usar a versão IVC de uma voz profissional. Isso pode melhorar a expressividade e reduzir a latência.
Este parâmetro controla a normalização de texto com três modos: ‘auto’, ‘on’ e ‘off’. Quando definido como ‘auto’, o sistema decidirá automaticamente se aplicará a normalização de texto, por exemplo, escrever números por extenso. Com ‘on’, a normalização de texto será sempre aplicada; com ‘off’, ela será ignorada.
Este parâmetro controla a normalização de texto do idioma. Isso ajuda na pronúncia correta do texto em alguns idiomas compatíveis. AVISO: este parâmetro pode aumentar significativamente a latência da solicitação. No momento, é compatível apenas com japonês.
Resposta
O arquivo de áudio gerado