Pular para o conteúdo

Esta Voz Não Existe - Voz IA Generativa

Publicado

OuvirOuça este artigo

Ultimamente, parece que todo mundo está falando sobre IA generativa. Grandes modelos de linguagem e de conversão de texto em imagem, impulsionados por deep learning, como ChatGPT, Stable Diffusion, DALL-E e Midjourney, causaram grande repercussão no mundo da tecnologia e além dele. Muitos os consideram alguns dos avanços recentes mais importantes em IA. Concordando ou não, a sensação geral é que algo muito poderoso surgiu. Em 2023, vamos ouvir falar de modelos que ajudam você a desenhar ou criar vídeos. Assim como perguntamos qual é o smartphone mais avançado do momento, em breve vamos perguntar qual é o modelo de base mais avançado. Mas, em meio a toda essa empolgação, acreditamos que há uma área da mídia generativa que ainda recebe muito menos atenção do que merece: a voz IA. É também a área em que buscamos nos tornar líderes. Na Eleven, usamos todos os dias o potencial das técnicas de deep learning para viabilizar nossas ferramentas realistas de Text to Speech e Clonar Voz com IA. E agora também estamos implementando nosso próprio modelo generativo, que permite criar vozes sintéticas inteiramente novas do zero.

Gerador de voz — crie uma voz

Nossos usuários acessam a plataforma todos os dias para dar vida a seus personagens, seja em audiolivros, jogos ou fanfics. Percebemos que nosso banco atual de vozes é pequeno demais para que todos encontrem vozes que atendam às necessidades de seu conteúdo e, ao mesmo tempo, sejam exclusivas de cada usuário. Nossa solução foi permitir que você crie vozes sintéticas inteiramente novas.

A ideia de como fazer isso surgiu quando analisamos os métodos que usamos atualmente para síntese de fala e clonagem de voz. Ambos os processos exigem uma forma de codificar as características de uma voz específica. Os embeddings de locutor carregam essa identidade: são uma representação vetorial da voz de um locutor. Percebemos que poderíamos fazer amostragens da distribuição desses embeddings treinando um modelo dedicado, capaz de criar infinitas vozes novas.

Como nossos usuários geralmente buscam características específicas de fala, precisávamos adicionar certo nível de controle ao processo. Expandimos nosso modelo com condicionamento para gerar vozes com base em suas características. Agora, o modelo permite definir parâmetros básicos que estabelecem a identidade central da nova voz: gênero, idade, sotaque, tom e estilo de fala. Em outras palavras, sempre que você clicar em "gerar", mesmo escolhendo os mesmos parâmetros básicos, receberá uma voz completamente nova que não existia antes.

Confira abaixo alguns exemplos de vozes que podem ser criadas dessa forma:

00:00
00:00
00:00
00:00
00:00
00:00

"Design Voice" estará disponível em nossa plataforma em fevereiro, como parte do Voice Lab.

Para que serve?

Nossas ferramentas já conseguem produzir falas tão naturais quanto as de qualquer pessoa, e esperamos que o universo de aplicações possíveis para vozes artificiais continue se expandindo. Muitas dessas novas aplicações, incluindo a gravação de áudio para publicações de notícias ou comerciais, exigirão que uma voz fique restrita e seja identificada com uma marca ou caso de uso específico, sem ser usada em outros contextos. Outros casos de uso, como narrativas e jogos, priorizam flexibilidade e liberdade para experimentar desde o início do desenvolvimento. Por isso, em vez de criar um enorme conjunto de locutores virtuais, decidimos permitir que os usuários tenham a palavra final sobre quais vozes melhor atendem a seus objetivos.

Autores de livros agora não só têm a oportunidade de converter facilmente suas obras em áudio, como também mantêm o controle artístico sobre a criação de uma narração personalizada. Isso oferece ao público novas formas interessantes de interagir com as publicações, além de aumentar muito o número de livros que poderemos ouvir.

Veículos de notícias têm investido cada vez mais em áudio, e escolher vozes marcantes para representar suas publicações é uma tarefa importante — muitos ouvintes valorizam tanto a forma quanto o conteúdo. Igualmente importante, os veículos agora podem ter certeza de que uma determinada voz os representa, e somente a eles.

Desenvolvedores de jogos agora podem dar voz a uma infinidade de NPCs que antes não falavam, com todas as ferramentas necessárias ao seu alcance. Além de reduzir custos sem comprometer a qualidade, eles também podem criar vozes totalmente únicas para os mundos virtuais que desenvolvem.

Profissionais de publicidade precisam de locuções adequadas a campanhas específicas, então poder criar uma narração envolvente e pensada para cada objetivo logo no início do desenvolvimento é uma vantagem considerável. Agora, eles podem experimentar instantaneamente diferentes vozes e estilos de interpretação, sem precisar mobilizar recursos adicionais.

De criadores que produzem todos os tipos de conteúdo em áudio e vídeo a profissionais de empresas que buscam dar voz às comunicações de suas organizações, as possibilidades de criar áudios envolventes, únicos e adaptados a um caso de uso específico agora são infinitas.

IA ética

Assim como a clonagem de voz desperta receios sobre as consequências de seu possível uso indevido, cada vez mais pessoas se preocupam que a disseminação da tecnologia de IA coloque em risco o sustento de profissionais. Na Eleven, vemos um futuro em que dubladores possam licenciar suas vozes para treinar modelos de fala para usos específicos, em troca de remuneração. Clientes e estúdios continuarão incluindo com satisfação talentos profissionais de voz em seus projetos, e o uso de IA simplesmente contribuirá para prazos de entrega mais curtos e mais liberdade para experimentar e definir rumos nas etapas iniciais de desenvolvimento. A tecnologia vai mudar a forma como o áudio falado é criado e gravado, mas o fato de dubladores não precisarem mais estar fisicamente presentes em todas as sessões realmente lhes dá a liberdade de participar de mais projetos ao mesmo tempo, além de preservar suas vozes de forma duradoura.

Além disso, o que nos anima é que uma grande variedade de livros, notícias, jogos independentes e outros conteúdos cujos autores e desenvolvedores não teriam condições de arcar com os custos de gravação agora poderão ser acessados por outro meio. Com esse acesso ampliado, surge a oportunidade de alcançar públicos maiores em cada caso.

Na Eleven, temos total compromisso tanto com o respeito aos direitos de propriedade intelectual quanto com a implementação de medidas de proteção contra o possível uso indevido de nossa tecnologia:

  • Só fazemos parcerias com clientes que seguem nossos Termos, que proíbem o uso malicioso de nossa tecnologia para qualquer finalidade que possa ser considerada ilegal ou prejudicial;
  • Também estamos trabalhando para inserir marcas d'água em todo áudio gerado pelo nosso modelo, para que ele possa ser rastreado instantaneamente até nós;
  • Quando usamos vozes reconhecíveis, fazemos isso para fins de demonstração e em contextos que não geram conflitos de interesse;
  • Ao mesmo tempo, buscamos apoiar os titulares de vozes e seus licenciadores na reivindicação de seus direitos, e todas as infrações conhecidas serão analisadas e receberão as medidas cabíveis.

Olhando para o futuro — aprimore sua própria voz

No futuro, planejamos combinar os recursos de nossos modelos de geração de voz e Clonar Voz com IA para permitir que os usuários aprimorem suas próprias vozes. Você poderá clonar sua voz e depois manipulá-la para obter o efeito que desejar. Se achar que seu estilo natural de fala é um pouco monótono, poderá adicionar mais variedade a ele. Se realmente não gostar de ser gravado, poderá ajustar o resultado para que soe mais natural. Qualquer pessoa que precise produzir áudio com a própria voz, seja para uma apresentação pré-gravada ou uma mensagem de áudio, poderá fazer isso com nosso conjunto de ferramentas, com apenas um clique.

Feliz Ano-Novo

Com o fim de 2022, gostaríamos de agradecer aos nossos usuários beta pela participação contínua e pelo feedback. Muitos dos recursos que estamos desenvolvendo surgiram a partir das suas contribuições e sugestões. Estamos muito felizes por ter vocês conosco e desejamos a todos um Feliz Ano-Novo.

Beta da ElevenLabs
Acesse aqui para se cadastrar em nossa plataforma beta e experimentar por conta própria. Estamos sempre fazendo melhorias, e toda percepção dos usuários é muito valiosa para nós nesta fase inicial.

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade