Apresentamos o Eleven v4Conheça o Eleven v4, nosso modelo mais expressivo até agora. Com 3x mais créditos incluídos no Creator+ até 12 de outubro

Pular para o conteúdo

Voice Design - A Primeira IA Generativa Para Áudio

Publicado

OuvirOuça este artigo

No mês passado, anunciamos que nosso modelo generativo para criação de vozes estava a caminho. Finalmente ele chegou e é o primeiro do seu tipo — nós o chamamos de Voice Design. O recurso permite criar novas vozes do zero, selecionando características principais, como gênero, idade e sotaque. Mesmo com as mesmas configurações de parâmetros, nosso modelo adiciona aleatoriedade a cada vez que você clica em gerar, garantindo que cada voz ouvida seja totalmente única. Voice Design faz parte do nosso esforço mais amplo de oferecer a editoras e criadores as ferramentas de IA mais versáteis para contar histórias.

Voice Design

O modelo por trás do Voice Design é, em grande parte, resultado das nossas pesquisas em síntese de fala e clonagem de voz, embora há muito tempo gostássemos da ideia de uma ferramenta generativa para fala. Já vimos aplicações práticas para modelos generativos de texto para imagem e chatbots, mas faltava uma ferramenta semelhante para áudio. Desde o nosso lançamento, recebemos pedidos para adicionar mais locutores ao nosso acervo. Em vez de sobrecarregar a biblioteca com inúmeras vozes e fazer você ouvir cada prévia para saber quem é quem, decidimos inverter a lógica e deixar que você defina a identidade do locutor, permitindo uma variedade infinita dentro dessas restrições.

Adicionar certo grau de controle à seleção de vozes era importante, pois nossos usuários frequentemente buscam características de fala específicas para seus roteiros. Garantir que cada voz gerada seja única era igualmente crucial, já que muitos casos de uso exigem, ou pelo menos se beneficiam de, acesso exclusivo a uma voz. Além de oferecer aos usuários uma nova possibilidade criativa, as vozes geradas com o Voice Design são completamente artificiais e não pertencem a nenhuma pessoa real.

Aplicações

Além de converter textos em áudio de qualidade sem esforço com nossa ferramenta principal de Síntese de fala, autores de livros agora podem usar o Voice Design para ter controle artístico sobre a narração e moldar a personalidade de cada personagem com vozes personalizadas.

Editoras de notícias que estão entrando no universo do áudio precisam de vozes para suas histórias. Como os narradores passam a ser identificados com as publicações que representam, escolher a locução certa se torna uma tarefa importante que não costuma ser repetida. O Voice Design permite que editoras escolham e comparem praticamente inúmeros narradores na hora. Também traz a tranquilidade de ter uma voz específica representando apenas a sua publicação.

Desenvolvedores de jogos não precisam mais decidir se um personagem específico justifica os custos de gravação. Dezenas de milhares de NPCs que antes eram mudos agora podem ter personalidades únicas, ampliando os limites da imersão virtual.

Se você é um criador de conteúdo trabalhando no seu próximo lançamento ou um profissional de comunicação corporativa buscando dar voz às comunicações da empresa, as possibilidades de criar áudio realista e envolvente para casos de uso e públicos específicos agora são ilimitadas.

Ecossistema

O Voice Design é um dos vários recursos de edição de narração que planejamos lançar este ano. O próximo é o Estúdio — nossa nova estação de trabalho para estruturar textos longos, inserir pausas, regenerar trechos de áudio e atribuir partes do texto a diferentes locutores. O Estúdio chega no fim de março e, mais tarde, no segundo trimestre deste ano, receberá suporte para edição de entonação.

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade