Clonar Voz com IA

Aprenda a clonar sua voz usando nossos modelos de ponta.

Visão geral

Ao clonar uma voz, há duas opções principais: Clonagem de Voz Instantânea e Clonagem de Voz Profissional. A Clonagem de Voz Instantânea é uma maneira rápida e fácil de clonar sua voz, enquanto a Clonagem de Voz Profissional é uma opção mais precisa e personalizável.

Clonagem de Voz Instantânea

Clonagem de voz
instantânea

A Clonagem de Voz Instantânea permite criar clones de voz a partir de amostras mais curtas quase instantaneamente. Criar um Clone de Voz Instantâneo (IVC) não treina nem cria um modelo de IA personalizado. Em vez disso, usa conhecimentos prévios dos dados de treinamento para fazer uma estimativa fundamentada, em vez de treinar com a voz exata.

Isso funciona extremamente bem para muitas vozes. No entanto, a maior limitação dos IVCs aparece quando você tenta clonar uma voz muito única ou uma voz com um sotaque que a IA talvez não tenha encontrado extensivamente durante o treinamento. Nesses casos, usar a Clonagem de Voz Profissional para criar um modelo personalizado com treinamento explícito pode ser a melhor opção.

Clonagem de Voz Profissional

Clonagem de voz
profissional

A Clonagem de Voz Profissional é um recurso disponível no plano Creator ou superior. A Clonagem de Voz Profissional permite treinar um modelo mais realista da sua voz, treinando um modelo dedicado com um conjunto maior de dados de voz e gerando um modelo praticamente indistinguível da voz original.

Como os modelos personalizados exigem ajuste fino e treinamento, os PVCs levam mais tempo para serem treinados do que os IVCs. Em geral, o ajuste fino leva de 3 a 6 horas para ser concluído, mas às vezes pode demorar um pouco mais, dependendo da quantidade de outros PVCs na fila para ajuste fino.

Guia para iniciantes em gravação de áudio

Se você não tem experiência com gravação de áudio, aqui estão algumas dicas para ajudar você a começar.

Local de gravação

Ao gravar áudio, escolha um local adequado e prepare-o para minimizar o eco e a reverberação do ambiente. Queremos reduzir a reverberação do ambiente o máximo possível. É exatamente para isso que serve uma cabine vocal com tratamento acústico e, se você não tiver uma cabine vocal disponível, pode experimentar algumas ideias de cabine vocal feita por você, uma “fortaleza de cobertores” ou um closet.

Aqui estão alguns exemplos no YouTube de ideias de acústica feitas por você:

Microfone, filtro antipop e interface de áudio

Um bom microfone é essencial. Os microfones podem custar de $100 a $10.000, mas um microfone XLR profissional entre $150 e $300 é suficiente para a maioria dos trabalhos de locução.

Para uma configuração acessível e de alta qualidade para trabalhos de locução, considere uma interface Focusrite com um microfone Audio-Technica AT2020 ou Rode NT1. Essa configuração, que custa entre $300 e $500, oferece gravação de alta qualidade adequada para uso profissional, com ruído próprio mínimo para resultados limpos.

Certifique-se de usar um filtro antipop adequado em frente ao microfone durante a gravação para evitar sons plosivos, além de respirações e ar atingindo diretamente o diafragma/microfone, pois isso soará mal e também causará problemas no processo de clonagem.

Estação de Trabalho de Áudio Digital (DAW)

Existem muitas soluções de gravação diferentes que fazem a mesma coisa: gravar áudio. No entanto, elas não são todas iguais. Desde que consigam gravar arquivos WAV a 44,1 kHz ou 48 kHz com uma taxa de bits de pelo menos 24 bits, estarão adequadas. Você não precisa de pós-processamento sofisticado, plugins, redutores de ruído ou qualquer outra coisa, porque queremos manter a gravação de áudio simples.

Se quiser uma recomendação, sugerimos algo como o REAPER, uma excelente DAW com enorme flexibilidade. Ele é o padrão do setor para muitos trabalhos de áudio. Outra boa opção gratuita é o Audacity.

Mantenha níveis de gravação ideais — nem muito altos nem muito baixos — para evitar distorção digital e ruído excessivo. Para trabalhos de locução, busque picos de -6 dB a -3 dB e uma intensidade média de -18 dB, garantindo clareza enquanto minimiza o ruído de fundo. Monitore de perto e ajuste os níveis conforme necessário para obter os melhores resultados de acordo com o projeto e o ambiente de gravação.

Posicionamento

Uma orientação útil é manter uma distância de cerca de dois punhos do microfone, aproximadamente 20 cm (7 a 8 pol.), com um filtro antipop entre você e o microfone. Algumas pessoas preferem posicionar o filtro antipop mais atrás para poder encostá-lo diretamente no microfone. Isso ajuda a manter uma distância consistente do microfone com mais facilidade.

Outra técnica comum para evitar respirar diretamente no microfone ou causar sons plosivos é falar em um ângulo. Falar em um ângulo reduz a chance de o ar expirado atingir o microfone diretamente e faz com que ele passe ao lado.

Interpretação

A interpretação que você faz é um dos aspectos mais importantes de toda esta sessão de gravação. A IA tentará clonar tudo sobre sua voz da melhor forma possível, e essa capacidade é muito alta. Isso significa que ela tentará reproduzir sua cadência, tonalidade, estilo de interpretação, a duração das pausas, se você gagueja, respira fundo, soa ofegante ou usa muitos “hums” e “ahs” — ela pode até reproduzir isso. Portanto, o que queremos no arquivo de áudio é exatamente a interpretação e a voz que queremos clonar, nada menos e nada mais. Por isso também é muito importante encontrar um texto que você possa ler e que corresponda à tonalidade que buscamos.

Ao gravar para IA, é muito importante manter a consistência. Se você estiver gravando uma voz, mantenha-a muito expressiva do início ao fim ou muito contida do início ao fim; não misture os dois estilos, pois a IA pode ficar instável por não saber qual parte da voz clonar. O mesmo vale para sotaques: mantenha o mesmo sotaque durante toda a gravação. Consistência é fundamental para um clone adequado!

Perguntas frequentes

A Clonagem de Voz Profissional, diferente da Clonagem de Voz Instantânea, que permite clonar vozes rapidamente com menos de 2 minutos de áudio, permite treinar um modelo mais realista da sua voz. Isso é feito treinando um modelo dedicado com um grande conjunto de dados de voz para criar um modelo praticamente indistinguível da sua voz original.

Como as Clonagens de Voz Profissionais exigem ajuste fino e treinamento, levará algum tempo até que você possa usar seu clone de voz. É difícil fornecer uma estimativa, pois isso depende do número de pessoas na fila antes de você e de outros fatores, mas o ajuste fino geralmente leva de 3 a 6 horas.

Você receberá uma notificação por e-mail quando sua Clonagem de Voz Profissional estiver pronta.

Para Clonagem de Voz Instantânea e Clonagem de Voz Profissional, aceitamos diversos tipos de arquivo. Recomendamos fortemente MP3 a 192 kbps ou mais.

Formato recomendado

  • MP3, 192 kbps ou mais

Duração recomendada

  • Clonagem de Voz Instantânea: 1 a 2 minutos de áudio de boa qualidade
  • Clonagem de Voz Profissional: 30 a 180 minutos de áudio de boa qualidade

Formatos não compactados, como WAV, geralmente não melhoram a qualidade do clone e podem causar problemas no processo de envio. Em vez disso, foque na qualidade da gravação: use uma gravação limpa, sem ruído de fundo, reverberação do ambiente ou vários falantes, com volume e tom consistentes e sem longos períodos de silêncio.

Para mais informações, consulte Clonagem de Voz Instantânea (IVC) e Clonagem de Voz Profissional (PVC).

A ElevenLabs oferece duas opções de clonagem:

  • Clonagem de Voz Instantânea: resultados rápidos com cerca de 1 a 3 minutos de áudio. Funciona bem para a maioria das vozes, mas pode ter dificuldades com sotaques incomuns ou vozes únicas.
  • Clonagem de Voz Profissional: maior fidelidade, usando de 30 minutos a cerca de 3 horas de áudio. O ajuste fino geralmente leva de 3 a 6 horas e pode demorar mais se houver muitas vozes na fila.

Se a Clonagem de Voz Instantânea não capturar bem sua voz ou sotaque, experimente a Clonagem de Voz Profissional.

Não é possível alterar o sotaque ou o tom de um clone depois que ele é criado. Para melhorar o resultado, altere as amostras de áudio que você usa. Pequenas mudanças nas amostras podem fazer uma grande diferença.

Na ElevenLabs, temos total compromisso tanto com o respeito aos direitos de propriedade intelectual quanto com a implementação de medidas de segurança contra o possível uso indevido da nossa tecnologia:

  • Trabalhamos apenas com clientes que seguem nossos Termos de Serviço e nossa Política de Uso Proibido, que proíbem o uso malicioso da nossa tecnologia para qualquer finalidade que possa ser considerada ilegal ou prejudicial;
  • Buscamos apoiar proprietários de vozes e seus licenciadores na reivindicação de seus direitos, e todas as violações conhecidas serão analisadas e tratadas;
  • Todo áudio gerado por nossos modelos pode ser imediatamente rastreado até o usuário responsável pela geração.

A tecnologia que estamos desenvolvendo é nova, e regulamentações claras ainda não foram introduzidas. Parte do nosso objetivo como laboratório de pesquisa em IA é conscientizar sobre a existência dessa tecnologia, seu potencial e suas limitações.

Você não pode baixar nem exportar seus clones de voz como arquivos independentes. Os clones de voz permanecem na sua conta ElevenLabs.

Ainda é possível usar suas vozes da ElevenLabs fora do site da ElevenLabs. Com sua chave de API, serviços de terceiros podem chamar a API da ElevenLabs e gerar fala com as vozes da sua conta.

Se quiser recriar um clone mais tarde, guarde as amostras de áudio originais usadas para criá-lo. Cada clone terá um som um pouco diferente, mesmo quando você usar o mesmo áudio.

Para um guia completo, recomendamos muito que você leia nossa documentação sobre Clonagem Instantânea de Voz e Clonagem Profissional de Voz.

Em resumo: boa entrada consistente = boa saída consistente.

Duração

  • Clonagem Instantânea de Voz: 1 a 2 minutos de áudio de boa qualidade
  • Clonagem Profissional de Voz: 30 a 180 minutos de áudio de boa qualidade

Use os melhores e mais nítidos clipes de áudio que conseguir encontrar. Deve haver apenas um falante, sem ruído de fundo ou interferência, e a voz deve estar alta e clara.

Em vez de usar muitos clipes com qualidades diferentes apenas para aumentar a duração, priorize clipes em que a qualidade do microfone seja claramente muito alta e em que a qualidade e o tom sejam consistentes do início ao fim, em vez de focar em aumentar a duração total.

Garanta que a maior parte do diálogo nos seus clipes esteja alinhada ao estilo de fala e à entonação do falante de que você mais gosta. Evite muitos trechos de diálogo em que o falante se afaste dos padrões de fala desejados que você quer ouvir.

Se necessário, use um removedor de ruído para reduzir qualquer ruído de fundo.

Você encontra mais informações em nossa documentação aqui.

Sim. Você pode clonar sua voz em qualquer idioma compatível com Flash v2.5 e Multilingual v2. Veja a lista completa de idiomas compatíveis aqui.

Você também pode clonar uma voz que fala um idioma não compatível com a IA. O clone pode capturar o tom do falante, mas não conseguirá falar esse idioma, e os resultados podem ser imprevisíveis. Não recomendamos isso.

Não. Você só pode criar um Clone Profissional de Voz da sua própria voz. Mesmo com o consentimento da pessoa, você não pode clonar a voz de outra pessoa. Todos os Clones Profissionais de Voz exigem um processo de verificação para confirmar que a voz pertence a você.

Se alguém quiser compartilhar a própria voz com você, essa pessoa poderá criar e verificar um Clone Profissional de Voz na própria conta e depois compartilhá-lo com você de forma privada usando um link de compartilhamento. Saiba mais em nosso artigo: Como compartilho uma voz?

Infelizmente, isso não é possível. Como informado durante o processo de configuração do seu Clone Profissional de Voz (PVC), ao avançar para a etapa de verificação, você não poderá voltar atrás até verificar sua voz.

Se precisar de ajuda com seu Clone Profissional de Voz, entre em contato com o suporte enviando um e-mail para support@elevenlabs.io.

Todos os Clones de Voz Profissionais (PVCs) serão treinados automaticamente nos modelos Flash v2.5, Turbo v2.5 e Multilingual v2. PVCs treinados com áudio em inglês também serão treinados automaticamente nos modelos Flash v2 e Turbo v2.

Se você já tem um PVC, agora pode fazer o ajuste fino em modelos adicionais. No futuro, se forem lançados novos modelos compatíveis com ajuste fino, você receberá uma notificação. Ela é exibida por meio de um ícone de exclamação, que aparecerá à direita da sua voz na lista de vozes em Minhas vozes. Ao passar o cursor sobre esse ícone, a notificação será exibida.

Para iniciar o processo de ajuste fino, passe o cursor sobre o nome da sua voz na lista em Minhas vozes, e você verá todos os modelos disponíveis. Os modelos nos quais a voz já passou por ajuste fino serão exibidos com um ícone de marca de seleção, e os modelos disponíveis para ajuste fino serão exibidos com um ícone de mais. Para iniciar o ajuste fino, basta clicar no modelo. 

Enquanto a voz passa pelo ajuste fino, você pode passar o cursor sobre o nome do modelo para acompanhar o progresso. Devido ao cache de vozes, talvez seja necessário atualizar a página para ver o progresso mais recente. Quando o ajuste fino for concluído, você receberá uma notificação no app e por e-mail.

A quantidade de vagas para Clone de Voz Profissional (PVC) varia conforme o plano de assinatura:


Vagas básicas de PVC
  • Plano Gratuito e Starter: nenhuma vaga de PVC disponível
  • Plano Creator, Pro e Scale legado: 1 vaga de PVC
  • Plano Scale e Business legado: 3 vagas de PVC
  • Plano Business: 10 vagas de PVC
  • Plano Enterprise: número personalizado de vagas de PVC

Vagas adicionais de PVC

Você pode obter vagas adicionais de PVC quando um Clone de Voz Profissional que você compartilhou na Voice Library recebe a classificação Qualidade de Estúdio.

  • A avaliação de Qualidade de Estúdio se aplica apenas às vozes que você compartilhou na Voice Library
  • Depois que sua voz for aceita na Voice Library, a avaliação de Qualidade de Estúdio acontece automaticamente. Ela não é imediata
  • Se seu PVC compartilhado receber a classificação Qualidade de Estúdio, você receberá automaticamente uma vaga adicional de PVC
  • Isso pode acontecer várias vezes se diversas vozes compartilhadas receberem a classificação Qualidade de Estúdio
  • Você não poderá criar mais PVCs, a menos que:
    • Obtenha vagas extras pela avaliação de Qualidade de Estúdio de vozes compartilhadas na Voice Library
    • Faça upgrade para o plano Scale ou superior
Observações importantes
  • Clones de Voz Profissionais só podem ser usados para clonar sua própria voz
  • Se você fizer downgrade para um plano inferior ao Creator, seu PVC permanecerá na sua conta, mas você não poderá usá-lo até fazer upgrade para Creator ou superior
  • O número total de vozes personalizadas que você pode ter, incluindo PVCs, depende do seu plano de assinatura

A clonagem com clonagem de voz instantânea pode ser um pouco complicada, e temos algumas orientações gerais. Mas elas são apenas isso: orientações. Não temos regras definidas quanto ao número ou à duração das amostras. Já vimos usuários usarem amostras de apenas 30 segundos e obterem resultados excelentes, enquanto outros usaram 10 minutos de áudio e tiveram resultados piores. Ainda assim, há alguns pontos que você deve considerar.

  • A qualidade do áudio é o aspecto mais importante a considerar ao usar a clonagem de voz instantânea.
  • O número de amostras não importa; o importante é a duração total. Ter mais de 2 a 3 minutos de áudio trará pouca melhora e, em alguns casos, pode até prejudicar a estabilidade do clone.

Depois que você verificar sua voz, ela precisará passar pelo ajuste fino em nossos modelos antes de poder ser usada. Enquanto isso acontece, você pode verificar o status da sua voz em Minhas vozes passando o cursor sobre o nome dela. Isso mostrará todos os modelos disponíveis para sua voz. Para verificar o status de cada modelo, passe o cursor sobre o nome do modelo. 

Se algo der errado, você poderá ver o seguinte status:

Lamentamos, mas a execução do treinamento apresentou problemas e foi tentada novamente. Não é necessária nenhuma outra ação. Isso significa que algo deu errado, mas sua voz foi automaticamente colocada na fila para tentar novamente o processo de ajuste fino. Sua voz deverá concluir o processo de ajuste fino com sucesso na próxima tentativa, mas, se você tiver várias falhas, pode haver um problema com o conjunto de dados que a IA não consegue resolver.

Você pode tentar resolver isso excluindo a voz e enviando os dados novamente, desde o início. Isso ajudou alguns usuários.

Se isso não resolver o problema, talvez seja necessário revisar o áudio de treinamento e possivelmente usar um áudio de treinamento diferente.

Você sempre pode entrar em contato com o suporte pelo e-mail support@elevenlabs.io se estiver enfrentando falhas durante o processo de ajuste fino.

Se você esgotar todas as tentativas de verificação durante a criação do seu clone de voz profissional, poderá aguardar 24 horas e então tentar o processo novamente.

Você também pode entrar em contato com o suporte pelo e-mail support@elevenlabs.io para que possam analisar o caso. Se estiver tudo correto, eles redefinirão suas tentativas de verificação para que você possa tentar o processo novamente.

Aqui estão algumas recomendações para ajudar você a verificar seu Clone de Voz Profissional com sucesso:

  • Verifique se seu navegador tem permissão para usar o microfone e se ele não está silenciado.
  • Garanta que o áudio gravado pelo microfone do computador soe semelhante ao áudio enviado para clonagem, sem ruído de fundo ou outras interferências de áudio externo.
  • Tente falar em um estilo semelhante ao do áudio usado para treinar a voz.
  • Leia cada linha de verificação apenas uma vez e depois pressione Parar para interromper a gravação. Ler a linha mais de uma vez pode fazer o processo de verificação falhar.

Você verá esse erro se tentar usar seu Clone de Voz Profissional (PVC) antes que ele conclua o processo de ajuste fino e esteja disponível para uso.

Quando você cria um PVC, ele precisa passar por vários processos antes de ficar disponível para uso.  Depois de verificar sua voz, ela será processada e colocada na fila para ajuste fino.   Dependendo de quantas outras vozes estão atualmente na fila para ajuste fino, estimamos que esse processo normalmente leve de 3 a 6 horas, mas pode levar até 24 horas.

Você pode acompanhar o progresso do seu PVC em Minhas vozes encontrando a voz na sua lista de vozes e clicando em Ver para conferir mais detalhes.  Você pode passar o cursor sobre cada modelo para ver o status atual.  

Para mais detalhes sobre o significado de cada status, consulte O que significa o status do meu Clone de Voz Profissional?

Quando seu PVC concluir o ajuste fino e estiver disponível para uso, você verá uma notificação pop-up e também receberá um e-mail.

Seu Clone de Voz Profissional passará por alguns estágios diferentes durante o processamento. Esses estágios são refletidos no status exibido para seu Clone de Voz Profissional em Minhas vozes.

Para ver o status atual, localize sua voz na lista e observe os ícones exibidos à direita.

Rascunho: Esse status significa que sua voz está incompleta. Em geral, isso acontece porque você não concluiu a criação da voz ou ainda não a verificou.

Para passar pelo processo de verificação, clique no ícone de marca de seleção.

Para voltar ao processo de criação de voz, clique em Mais ações (três pontos) e selecione Editar voz.

Depois que você verificar sua voz, ela precisará passar pelo ajuste fino em nossos modelos antes que você possa usá-la. Você pode acompanhar esse processo passando o cursor sobre o nome da sua voz em Minhas vozes. Você verá todos os modelos disponíveis listados aqui, com um ícone indicando o status de cada modelo. 

Passe o cursor sobre o nome do modelo para ver mais informações. Você verá um dos seguintes status:

A execução do treinamento foi agendada: Isso significa que sua voz está aguardando a abertura de uma vaga para poder ser treinada. O tempo que sua voz ficará na fila dependerá de quantas outras vozes também estão na fila.

Criando conjunto de dados e Executando ajuste fino: Quando uma vaga for aberta, o processo de ajuste fino começará. Isso pode levar de 6 a 24 horas. Você verá o progresso da sua voz em cada etapa do processo de treinamento, indicado por uma porcentagem.

Lamentamos, mas a execução do treinamento apresentou problemas e foi tentada novamente. Não é necessária nenhuma outra ação

Isso significa que algo deu errado, mas sua voz foi automaticamente colocada na fila para tentar novamente o processo de ajuste fino. Sua voz deverá concluir o processo de ajuste fino com sucesso na próxima tentativa, mas, se você tiver várias falhas, entre em contato com o suporte pelo e-mail support@elevenlabs.io.

A voz está pronta para ser usada com o modelo: Isso significa que o processo de ajuste fino deste modelo foi concluído e agora você pode usar sua voz com ele.

Clique para iniciar o ajuste fino: Alguns modelos não são treinados automaticamente, e você precisará clicar no nome do modelo para iniciar o ajuste fino. Se modelos adicionais ficarem disponíveis para sua voz passar por ajuste fino, você verá um ícone de exclamação ao lado da sua voz. 

Para iniciar o processo de ajuste fino, basta passar o cursor sobre o nome da sua voz e clicar no nome do modelo.

A Clonagem de Voz Profissional oferece suporte a todos os idiomas disponíveis na família de modelos Eleven v4 — mais de 90 idiomas no total.

A família de modelos Eleven v4 oferece suporte a mais de 90 idiomas, incluindo:

Africâner (afr), Amárico (amh), Árabe (ara), Armênio (hye), Assamese (asm), Asturiano (ast), Azerbaijano (aze), Bielorrusso (bel), Bengali (ben), Bósnio (bos), Búlgaro (bul), Birmanês (mya), Cantonês (yue), Catalão (cat), Cebuano (ceb), Croata (hrv), Tcheco (ces), Dinamarquês (dan), Holandês (nld), Inglês (eng), Estoniano (est), Filipino (fil), Finlandês (fin), Francês (fra), Fula/Pulaar (ful), Galego (glg), Georgiano (kat), Alemão (deu), Grego (ell), Guzerate (guj), Hauçá (hau), Hebraico (heb), Hindi (hin), Húngaro (hun), Islandês (isl), Indonésio (ind), Italiano (ita), Japonês (jpn), Javanês (jav), Kamba (kam), Canarês (kan), Cazaque (kaz), Coreano (kor), Quirguiz (kir), Lao (lao), Letão (lav), Lingala (lin), Lituano (lit), Luganda (lug), Luxemburguês (ltz), Macedônio (mkd), Malaio (msa), Malaiala (mal), Maltês (mlt), Chinês mandarim (cmn), Maori (mri), Marata (mar), Mongol (mon), Nepali (nep), Norueguês bokmål (nob), Occitano (oci), Odia (ori), Pachto (pus), Persa (fas), Polonês (pol), Português, Brasil (por), Punjabi (pan), Romeno (ron), Russo (rus), Sérvio (srp), Shona (sna), Sindi (snd), Eslovaco (slk), Esloveno (slv), Somali (som), Curdo sorani (ckb), Espanhol, América Latina (spa), Suaíli (swa), Sueco (swe), Tadjique (tgk), Tâmil (tam), Telugu (tel), Tailandês (tha), Turco (tur), Ucraniano (ukr), Urdu (urd), Uzbeque (uzb), Vietnamita (vie), Galês (cym), Wolof (wol), Zulu (zul).

A Clonagem de Voz Profissional envolve treinar (ajustar) o modelo com grandes conjuntos da voz de um determinado locutor para criar um modelo personalizado.

Depois que você enviar suas amostras e verificar sua voz, seu Clone de Voz Profissional será adicionado à fila. O tempo estimado de treinamento é de aproximadamente 3 a 6 horas. Isso depende de alguns fatores, por isso é difícil fornecer uma estimativa exata. Infelizmente, às vezes pode levar mais tempo.

Você pode verificar o status atual da sua voz em Minhas vozes. Para mais informações, consulte O que significa o status do meu Clone de Voz Profissional?

Quando seu PVC concluir o processo de ajuste fino, você receberá notificações no app e por e-mail informando que sua voz está pronta para uso.

No results