Criar diálogo
Criar diálogo
Converte uma lista de pares de texto e ID de voz em fala (diálogo) e retorna áudio.
Cabeçalhos
Parâmetros de consulta
Solicitação
Uma lista de entradas de diálogo, cada uma contendo texto e um ID de voz que será convertido em fala. O número máximo de IDs de voz únicos é 10. Para uma geração confiável, mantenha o total de caracteres em todos os valores de inputs[].text em até 2.000 caracteres por solicitação. Solicitações mais longas podem ser encerradas antecipadamente em respostas de streaming ou retornar um erro de validação.
Identificador do modelo que será usado. Você pode consultá-lo usando GET /v1/models. O modelo precisa oferecer suporte a texto para voz, o que pode ser verificado pela propriedade can_do_text_to_speech.
Código de idioma (ISO 639-1) usado para aplicar um idioma ao modelo e à normalização de texto. Se o modelo não oferecer suporte ao código de idioma fornecido, ele será ignorado. Este parâmetro não é compatível com modelos multilingual_v2.
Configurações que controlam a geração de diálogos.
O texto imediatamente anterior a esta geração, usado para condicionar o modelo quanto à continuidade prosódica. É possível enviar no máximo 100 caracteres. Não é compatível com todos os modelos.
O texto que vem imediatamente após esta geração, usado para condicionar o modelo à continuidade prosódica. É possível enviar no máximo 100 caracteres. Nem todos os modelos oferecem suporte.
Uma lista de localizadores de dicionários de pronúncia (id, version_id) a serem aplicados ao texto. Eles serão aplicados em ordem. Você pode ter até 3 localizadores por solicitação
Se especificado, nosso sistema fará o possível para realizar a amostragem de forma determinística, de modo que solicitações repetidas com a mesma semente e os mesmos parâmetros retornem o mesmo resultado. O determinismo não é garantido. Deve ser um número inteiro entre 0 e 4294967295.
Este parâmetro controla a normalização de texto com três modos: ‘auto’, ‘on’ e ‘off’. Quando definido como ‘auto’, o sistema decidirá automaticamente se aplicará a normalização de texto, por exemplo, escrever números por extenso. Com ‘on’, a normalização de texto será sempre aplicada; com ‘off’, ela será ignorada.
Se deve usar a versão IVC de uma voz profissional. Isso pode melhorar a expressividade e reduzir a latência.
Uma lista de request_ids de gerações de diálogo anteriores a esta. Usada para condicionar o modelo para manter a continuidade ao dividir uma tarefa grande em várias solicitações. É possível enviar no máximo 3 request_ids. O último request_id corresponde ao áudio mais próximo da solicitação atual. Não é compatível com todos os modelos.
Uma lista de request_ids de gerações de diálogo posteriores a esta. Útil para manter a continuidade ao regenerar um clipe no meio de uma sequência. É possível enviar no máximo 3 request_ids. O primeiro request_id corresponde ao áudio mais próximo da solicitação atual. Não é compatível com todos os modelos.
Resposta
O arquivo de áudio gerado