Guia de início rápido da Clonagem de Voz Profissional
Guia de início rápido da Clonagem de Voz Profissional
Este guia mostra como criar um Clone de Voz Profissional (PVC) usando a API de PVC. Para criar um PVC pelo painel, consulte o guia do produto Clone de Voz Profissional.
Para criar um PVC, você precisa estar no plano Creator ou superior.
Para uma explicação detalhada de como IVC e PVC funcionam internamente e quando escolher cada um, consulte Clonagem de voz: como funciona.
Se você não tiver certeza sobre o que é permitido do ponto de vista legal, consulte os Termos de Serviço e nossas informações sobre segurança de IA para saber mais.
Criar um PVC pela API envolve consideravelmente mais etapas do que criar um Clone de Voz Instantâneo. Isso acontece porque os PVCs são mais complexos e exigem mais dados e ajustes para criar um clone de alta qualidade.
Como usar a API de Clone de Voz Profissional
Este guia pressupõe que você já configurou sua chave de API e o SDK. Conclua o guia de início rápido primeiro, caso ainda não tenha feito isso.
Criar uma voz PVC
Crie um novo arquivo chamado example.py ou example.mts, dependendo da linguagem escolhida, e adicione o código a seguir para criar uma voz PVC:
Enviar arquivos de áudio
Em seguida, envie os arquivos de amostra de áudio que serão usados para treinar o PVC. Consulte a seção Dicas e sugestões do guia do produto PVC para saber mais sobre como obter os melhores resultados com seus arquivos de áudio.
Iniciar a separação de locutores
Esta etapa tentará separar os arquivos de áudio em locutores individuais. Isso é necessário se você estiver enviando áudio com vários locutores.
Recuperar o áudio dos locutores
Como a etapa anterior levará algum tempo para ser concluída, a próxima etapa deve ser executada em um processo separado após a conclusão da etapa anterior.
Quando a separação de locutores estiver concluída, você terá uma lista de locutores para cada amostra. No caso de amostras com vários locutores, será preciso escolher o locutor que deseja usar para o PVC. Para identificar o locutor, você pode recuperar o áudio de cada um e ouvi-los.
Atualizar amostras com IDs de locutores
Quando a separação de locutores estiver concluída, você poderá atualizar as amostras para selecionar qual locutor deseja usar para o PVC.
Verificar o PVC
Antes que o treinamento possa começar, é necessária uma etapa de verificação para garantir que você tem permissão para usar a voz. Primeiro, solicite o CAPTCHA de verificação.
A imagem contém várias linhas de texto que o proprietário da voz precisará ler em voz alta e gravar. Depois disso, envie a gravação para verificar a identidade do proprietário da voz.
(Opcional) Solicitar verificação manual
Se não for possível verificar o CAPTCHA, você poderá solicitar uma verificação manual. Observe que o processamento será mais demorado.
Use este recurso somente se as etapas de verificação anteriores falharam ou não são possíveis, por exemplo, se o proprietário da voz tiver deficiência visual.
Para obter uma lista dos arquivos necessários para a verificação manual, entre em contato com o suporte, pois cada caso pode ser único.
Treinar o PVC
Em seguida, inicie o processo de treinamento. Isso levará algum tempo para ser concluído, dependendo da duração e do número de amostras fornecidas.
Usar a voz recém-criada
Depois que o PVC for verificado, você poderá usá-lo da mesma forma que qualquer outra voz. Consulte o guia de início rápido de Text to Speech para saber mais sobre como usar uma voz.