Apresentando Eleven Multilingual v1: Nosso Novo Modelo de Síntese de Voz
- Publicado
OuvirOuça este artigo
Hoje, temos o prazer de lançar o Eleven Multilingual v1 — nosso avançado modelo de síntese de voz compatível com sete novos idiomas: francês, alemão, hindi, italiano, polonês, português, e espanhol. Com base na pesquisa que desenvolveu o Eleven Monolingual v1, nossa abordagem atual de deep learning utiliza mais dados, maior capacidade computacional e novas técnicas em um modelo cada vez mais sofisticado, capaz de compreender nuances textuais e entregar uma performance emocionalmente rica. Esse avanço amplia os horizontes criativos de criadores, desenvolvedores de jogos e editoras, além de abrir caminho para o uso de mídia generativa na criação de conteúdo mais localizado, acessível e criativo.
O novo modelo está disponível em todos os planos de assinatura, e você já pode experimentá-lo em nossa plataforma Beta.
Para usá-lo, basta selecioná-lo no menu suspenso recém-adicionado do painel de Síntese de Voz.
Visão geral da pesquisa
Assim como seu antecessor, o novo modelo é baseado inteiramente em nossa pesquisa interna. Ele mantém todos os pontos fortes que fizeram do Eleven Monolingual v1 uma excelente ferramenta para contar histórias, como a capacidade de ajustar a interpretação conforme o contexto e transmitir intenção e emoções de forma hiper-realista. Esses recursos agora foram expandidos para os novos idiomas compatíveis por meio do treinamento com dados multilíngues.
Um recurso notável do modelo é sua capacidade de identificar texto multilíngue e articulá-lo adequadamente. Agora você pode gerar fala em vários idiomas usando um único prompt e preservar as características únicas da voz de cada locutor. Para obter os melhores resultados, recomendamos fornecer um prompt em um único idioma. Embora o modelo já possa ter um desempenho razoável com vários idiomas ao mesmo tempo, ainda são necessárias melhorias.
O novo modelo é compatível com outros recursos do VoiceLab — como o Instant Clonar Voz com IA e Voice Design. Espera-se que todas as vozes criadas mantenham a maioria de suas características originais de fala em todos os idiomas, incluindo seu sotaque original.
Dito isso, o modelo tem limitações conhecidas: números, siglas e palavras estrangeiras às vezes são pronunciados em inglês quando inseridos em outro idioma. Por exemplo, o número "11" ou a palavra “radio”, digitados em um prompt em espanhol, podem ser pronunciados como em inglês. Recomendamos escrever siglas e números por extenso no idioma de destino enquanto trabalhamos em melhorias.
Democratização da voz
A ElevenLabs nasceu do sonho de tornar todo conteúdo universalmente acessível, em qualquer idioma e com qualquer voz. Os membros da nossa equipe vêm de toda a Europa, Ásia e Estados Unidos. À medida que nossa equipe e o mundo se tornam cada vez mais multilíngues, estamos ainda mais unidos pela visão de disponibilizar vozes IA com qualidade humana em todos os idiomas.
A versão mais recente do nosso modelo de Text to Speech (TTS) é apenas o primeiro passo no nosso caminho para tornar essa visão realidade. Com o avanço das vozes IA com qualidade humana, usuários e empresas agora podem criar e personalizar conteúdo de áudio de acordo com suas necessidades, prioridades e preferências. Isso já demonstrou potencial para equilibrar as oportunidades entre criadores, pequenas empresas e artistas independentes. Ao aproveitar o poder do áudio criado com IA, usuários podem desenvolver experiências sonoras de alta qualidade que competem com as produzidas por organizações maiores e com mais recursos.
Esses benefícios agora se estendem a aplicações multilíngues, multiculturais e educacionais, ao permitir que usuários, empresas e instituições produzam áudios autênticos que se conectam com um público mais amplo. Ao oferecer uma ampla variedade de vozes, sotaques e idiomas, a IA ajuda a reduzir diferenças culturais e promove a compreensão global. Na Eleven, acreditamos que essa nova acessibilidade promove mais criatividade, inovação e diversidade.
Criadores de conteúdo que buscam engajar públicos diversos agora têm as ferramentas para reduzir diferenças culturais e promover a inclusão.
Desenvolvedores de jogos e editoras podem criar experiências imersivas e localizadas para públicos internacionais, superando barreiras linguísticas e conectando-se com jogadores e ouvintes para maximizar o engajamento e a eficiência, sem perda de qualidade ou precisão.
Instituições de ensino agora têm os meios para produzir conteúdo de áudio para diversos usuários em seus idiomas de destino, fortalecendo a compreensão linguística e até mesmo as habilidades de pronúncia, além de atender a diferentes estilos de ensino e necessidades de aprendizagem.
Instituições de acessibilidade agora podem ampliar o acesso de pessoas com deficiência visual ou dificuldades de aprendizagem, oferecendo meios para converter facilmente recursos menos acessíveis em um formato adequado às suas necessidades, tanto no conteúdo quanto na forma.
Mal podemos esperar para ver nossos criadores e desenvolvedores atuais e futuros ampliarem os limites do possível!




