Pular para o conteúdo

Conversão de Voz

Publicado
Última atualização

OuvirOuça este artigo

O que é conversão de voz?

A conversão de voz permite transformar a voz de uma pessoa na de outra. Ela usa um processo chamado clonagem de voz para codificar a voz de destino — ou seja, a voz para a qual fazemos a conversão — e gerar a mesma mensagem falada de uma forma que corresponda à identidade do locutor de destino, mas preserve a entonação original.

Usos

As tecnologias de conversão de voz e clonagem de voz de alta qualidade têm o potencial de revolucionar a forma como o conteúdo é produzido, distribuído e consumido em diversos setores. Elas prometem otimizar o tempo e os custos de produção, além de oferecer formas de remuneração passiva para quem disponibiliza sua voz para treinar algoritmos de conversão.

  • No cinema, atores poderiam compartilhar seus bancos de dados de voz com produtores para criar faixas de áudio sem precisar viajar até o set ou estúdio;
  • falas ditas incorretamente poderiam ser regravadas com muito mais eficiência na pós-produção;
  • a tecnologia também pode ser usada para reproduzir fielmente as vozes de figuras históricas em cenários fictícios ou dar vida novamente a atores falecidos;
  • o desenvolvimento de jogos também pode se beneficiar da tecnologia: corrigir falas ou simplesmente experimentar poderia ser feito na hora, sem a presença física do ator para gravar;
  • na medicina, pacientes que perderam a capacidade de falar, por exemplo devido ao tratamento de câncer de garganta, poderiam ter a chance de se comunicar novamente com a própria voz;
  • assistentes virtuais poderiam se tornar personalizados, já que usuários domésticos talvez achem mais natural interagir, por exemplo, com a voz de alguém querido do que com a de um estranho virtual;
  • por outro lado, o setor de publicidade poderia se beneficiar da introdução de locuções sintéticas que soam tão reais quanto qualquer voz humana, sem os desafios relacionados a direitos autorais e royalties. Se for necessária justamente uma voz reconhecível, os produtores de anúncios também poderão usar a tecnologia para clonar, com consentimento, a voz de um ator específico, sem exigir sua presença física em longas sessões de gravação;
  • os setores de audiolivros e podcasts são apenas mais dois mercados em crescimento nos quais aplicar tecnologias de clonagem e conversão de voz oferece a oportunidade de otimizar a produção e a edição de conteúdo imersivo.

Conversão de voz da ElevenLabs

Embora desenvolvamos software de conversão de voz na Eleven como parte do nosso conjunto de ferramentas, nossa pesquisa sobre clonagem de voz e síntese de voz impulsiona principalmente o desenvolvimento do nosso principal produto, que planejamos lançar no início do próximo ano: a ferramenta automática de dublagem que preserva a identidade.

Nosso objetivo é tornar todo conteúdo falado acessível em diferentes idiomas, na voz do locutor original, com um clique. Imagine um vídeo educativo no YouTube em inglês. Se alguém só fala espanhol — mas acharia o assunto interessante se conhecesse o idioma — isso é um problema. As legendas oferecem uma solução, claro, mas nosso objetivo é proporcionar uma forma muito mais imersiva e envolvente de consumir conteúdo. Queremos conseguir gerar essa mesma pessoa falando a mesma mensagem naturalmente em espanhol com nível nativo, mesmo que ela não fale espanhol de verdade.

Para isso, a clonagem de voz nos permite preservar a identidade da pessoa — o som da sua voz. Nós a usamos para gerar novas falas em outro idioma, de modo que pareça ser a mesma pessoa falando.

A conversão de voz entra em cena porque queremos preservar as emoções, a intenção e o estilo de fala para obter o máximo de imersão. Treinamos modelos robustos multilíngues, que nos permitem analisar falas no idioma de origem e mapeá-las para o idioma de destino com a entonação correta.

Processo

Para converter a voz de uma pessoa na de outra — ou seja, a fala de origem em fala de destino — precisamos de um algoritmo que expresse o conteúdo da fala de origem com as características da fala de destino. Uma boa analogia são os apps de troca de rosto, que permitem misturar seu rosto ao de outra pessoa e criar uma imagem que combina os dois.

Para fazer isso, é preciso pegar a imagem de um rosto e mapear seus atributos. Os pontos no exemplo abaixo fazem exatamente isso: eles definem os limites dentro dos quais os traços do outro rosto seriam renderizados.

Na conversão de voz, precisamos de uma forma de o algoritmo codificar as propriedades da fala de destino. O algoritmo é treinado com um conjunto de dados que contém muitos exemplos dessa fala. Ele divide essas amostras em um nível fundamental — os “átomos” da fala, por assim dizer. A fala é composta por frases. As frases são compostas por palavras. As palavras são formadas por fonemas, que determinam as características da fala de destino. Esse é o nível fundamental em que o algoritmo opera.

O segredo da conversão de voz é reproduzir o conteúdo da fala de origem usando os fonemas da fala de destino. Mas há uma contrapartida, assim como no exemplo de troca de rosto: quanto mais marcadores você usa para mapear os atributos de um rosto, mais restrições impõe ao rosto que será mapeado dentro deles. Menos marcadores significam menos restrições. O mesmo vale para a conversão de voz. Quanto mais priorizamos a fala de destino, maior o risco de perder a sintonia com a fala de origem. Mas, se não a priorizarmos o bastante, corremos o risco de perder muito do que torna aquela fala característica. Por exemplo, se reproduzíssemos a gravação de alguém gritando com raiva na voz de Morgan Freeman, teríamos um problema. Se priorizarmos demais as emoções da fala de origem, perderemos a impressão de que é realmente Morgan Freeman falando. Se dermos ênfase demais ao padrão de fala dele, perderemos a carga emocional da fala de origem.

Ética

As preocupações éticas relacionadas à clonagem de voz merecem atenção, pois o potencial de uso indevido da tecnologia preocupa um número crescente de pessoas. Em 2020, deepfakes de áudio foram usados por golpistas que se passaram por um CEO em uma ligação telefônica para autorizar uma transferência bancária de US$ 35 milhões. Uma tecnologia capaz de fazer parecer de forma convincente que alguém disse algo que não disse naturalmente gera receios de uso para desinformar, difamar ou cometer fraude. Da mesma forma, a conversão de voz levanta questões importantes sobre violação de direitos autorais se permitir que usuários lucrem com conteúdo gerado sem o consentimento dos donos das vozes.

Na Eleven, sentimos que precisamos fazer o possível para garantir que nossa tecnologia não seja usada para fins maliciosos e implementar salvaguardas contra seus riscos:

  • só trabalhamos com clientes que cumprem nossos Termos, os quais proíbem o uso malicioso da nossa tecnologia com a intenção de desinformar, difamar, cometer fraude ou para qualquer outro fim que possa ser considerado ilegal ou prejudicial;
  • o conteúdo de vídeo sintético produzido pela Eleven inclui uma marca-d’água clara informando que ele foi gerado por IA. O conteúdo de áudio contém uma descrição clara do arquivo. Quando usamos vozes reconhecíveis, fazemos isso para fins de demonstração e em contextos que não geram conflitos de interesse;
  • ao mesmo tempo, buscamos apoiar os donos das vozes e seus licenciadores na reivindicação de seus direitos.
  • Se você tiver ideias sobre como melhorar nossa abordagem, fale conosco em ethics@elevenlabs.io

Acreditamos que o receio de abusos não deve ser o fator dominante na forma como lidamos com novas tecnologias poderosas. Em vez disso, devemos buscar garantir que salvaguardas adequadas sejam implementadas durante o desenvolvimento para minimizar o risco de danos, ao mesmo tempo em que aproveitamos ao máximo o potencial que a tecnologia oferece à comunidade em geral.

Futuro

As tecnologias de conversão de voz e clonagem de voz prometem revolucionar o cinema, a televisão, a criação de conteúdo, o desenvolvimento de jogos, os podcasts e os audiolivros, além do setor de publicidade. Mas suas aplicações vão além do uso comercial, com possibilidades na medicina, educação e comunicação.

A clonagem de voz está abrindo caminho para um futuro em que qualquer conteúdo poderá ser gerado em qualquer idioma e voz, alcançando milhões de pessoas no mundo todo e criando uma economia totalmente nova. Nosso objetivo na Eleven é ajudar a tornar esse futuro realidade.

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade