A primeira IA que consegue rir
- Publicado
OuvirOuça este artigo
Em nosso último artigo, apresentamos algumas amostras mais longas geradas pela nossa ferramenta de síntese de fala e explicamos brevemente como o design exclusivo do nosso modelo permite gerar fala com ritmo natural e sem soar robótica. Hoje vamos mostrar que ele também é mais rico emocionalmente e mais consciente do contexto do que qualquer outro. Isso não só torna a experiência de ouvi-lo muito envolvente, como também o torna ideal para usos que vão da narração de livros e jogos à publicidade.
Emoções
Os dois pontos fortes do nosso modelo — fluência e entonação adequada — vêm da grande quantidade de dados de treinamento que ele analisou (mais de 500 mil horas!), mas o fator central é como ele aprende com esses dados, o que depende de sua arquitetura. Em sua essência, ele foi criado para entender as emoções presentes na escrita e decidir se quem fala deve soar feliz, irritado, triste ou neutro. Veja alguns exemplos:
Todas as diferenças de entonação e humor vêm exclusivamente do texto — nada mais influenciou o resultado. A pontuação e o significado das palavras têm um papel central na forma de pronunciar uma frase, mas repare também que, quando quem fala está feliz com a vitória, o modelo reproduz de forma convincente sons que não fazem parte da fala comum, como risadas (em breve, vamos lançar uma compilação das diferentes risadas que nossa IA consegue produzir!). Da mesma forma, ele exagera adequadamente a reação quando quem fala acha algo hilário — é ‘engraçadíííssimo’.
Contexto
Mas conhecer o significado de palavras individuais não basta. Nosso modelo é igualmente sensível ao contexto mais amplo de cada enunciado: ele avalia se algo faz sentido pela relação com o texto anterior e posterior. Essa perspectiva mais ampla permite que ele dê a entonação correta a trechos mais longos, aplicando um padrão emocional unificador a uma linha de raciocínio que se estende por várias frases, como mostramos em nosso artigo anterior com conteúdos mais extensos. Ela também ajuda a evitar erros lógicos. Por exemplo, algumas palavras são escritas da mesma forma, mas têm significados diferentes, como “manga”, que pode ser uma fruta ou parte de uma roupa. Decidir qual significado é adequado depende do contexto:
Texto escrito vs. falado
Como projetamos nossa plataforma para atender às necessidades de conteúdos mais longos, também precisamos que nosso modelo entenda que símbolos, abreviações e certas convenções comuns na escrita devem ser pronunciados de uma forma específica ou não devem ser lidos literalmente. Por exemplo, o modelo precisa saber que FBI, TNT e ATM são pronunciados de forma diferente de UNESCO ou NASA. Da mesma forma, US$ 3 tri funciona perfeitamente na escrita, mas, quando lido em voz alta, precisa se tornar ‘três trilhões de dólares’.
Intervenção humana
Reconhecer essas distinções sutis é fundamental, pois nosso objetivo é minimizar a necessidade de intervenção humana no processo de geração. Afinal, não divulgamos a capacidade da nossa ferramenta de gerar um audiolivro em minutos para que alguém precise ouvir todo o áudio e depois reescrever o texto inteiro. Ainda assim, mesmo atualizando continuamente as regras de pronúncia do nosso modelo, sempre é possível que algo o confunda. Por isso, estamos desenvolvendo um sistema para sinalizar incertezas, que permitirá aos usuários ver instantaneamente quais trechos o modelo considerou problemáticos e ensiná-lo como eles devem ser pronunciados.
Inúmeras aplicações
Todos os recursos que mostramos são passos para transformar nosso software na ferramenta de locução com IA mais versátil.
Editoras de notícias já descobriram que aumentar sua presença em áudio é uma ótima forma de reter assinantes. O grande benefício de incorporar a leitura em áudio a cada artigo é que as pessoas podem ouvir enquanto fazem outra coisa. Essas editoras costumam usar dubladores, o que é caro e não permite cobrir todos os artigos. Ou usam seus próprios repórteres para ler as matérias, o que demanda tempo e, portanto, também custa caro. Quem usa fala sintética para dar voz ao conteúdo economiza dinheiro, mas paga outro preço ao comprometer a qualidade. Agora, com a ElevenLabs, não é preciso fazer concessões: você pode ter o melhor dos dois mundos.
Ou imagine gerar audiolivros com locuções distintas e emocionalmente envolventes para todos os personagens, em poucos minutos. Isso não apenas cria novas formas de interagir com livros, como também facilita muito o acesso para pessoas com dificuldades de aprendizagem.
Pense nas possibilidades que agora se abrem para desenvolvedores de videogames que não precisam mais decidir se um personagem é importante o suficiente para justificar o custo considerável de dublá-lo com atores reais. Agora, todos os NPCs podem ter suas próprias vozes e personalidades.
Agências de publicidade e produtoras agora podem experimentar livremente e ajustar locuções ao tom de qualquer campanha — seja para um canal de TV esportivo ou para uma marca de relógios de luxo. A voz de qualquer ator pode ser licenciada para clonagem, permitindo aplicar mudanças instantaneamente e sem a presença física do ator. Ou, se optarem por uma voz totalmente sintética, os anunciantes também não precisam se preocupar em pagar direitos de uso da voz.
Assistentes virtuais podem se tornar mais realistas tanto porque a clonagem de voz permite que falem com uma voz familiar para determinado usuário quanto porque essa nova profundidade de expressão tornaria a interação com eles mais natural.
ElevenLabs Beta
Acesse aqui para se cadastrar na nossa plataforma beta e experimentar por conta própria. Estamos sempre fazendo melhorias, e o feedback de todos os usuários é muito valioso para nós nesta fase inicial. Aproveite!




