Pular para o conteúdo

ElevenLabs Sai da Fase Beta e Lança Eleven Multilingual v2 - um Modelo de Fala com IA para Quase 30 Idiomas

Publicado

OuvirOuça este artigo

  • A plataforma de voz IA ElevenLabs dá um salto significativo em seus esforços para eliminar as barreiras linguísticas do conteúdo com o lançamento de um novo modelo fundamental de deep learning compatível com recursos multilíngues em 28 idiomas - o Eleven Multilingual v2
  • Esse avanço permitirá que empresas de mídia, desenvolvedores de jogos, editoras e criadores independentes de todo o mundo melhorem drasticamente a acessibilidade de seu conteúdo
  • Esses novos recursos, que chegam após uma série de lançamentos e melhorias desde o lançamento da plataforma em janeiro, também marcam o fim oficial da fase Beta da empresa
  • A missão da ElevenLabs é tornar todo conteúdo universalmente acessível em qualquer idioma e com qualquer voz

ElevenLabs, líder mundial em software de voz IA, lançou hoje um novo modelo de geração de voz multilíngue capaz de produzir com precisão áudio criado com IA, rico em emoção, em quase 30 idiomas.

O avanço, baseado inteiramente em pesquisa interna, permitirá que criadores produzam conteúdo de áudio localizado para mercados internacionais na Europa, Ásia e Oriente Médio. A ElevenLabs passou os últimos 18 meses analisando os sinais da fala humana, criando novos mecanismos para compreender o contexto e transmitir emoções na geração de fala, além de sintetizar vozes novas e únicas.

Com o Eleven Multilingual v2, quando um texto é inserido na plataforma de Text to Speech da ElevenLabs, o novo modelo consegue identificar automaticamente quase 30 idiomas escritos e gerar fala neles com um nível de autenticidade sem precedentes.

Ao mesmo tempo, independentemente de ser usada uma voz sintética ou clonada, as características únicas da voz do falante são preservadas em todos os idiomas, inclusive seu sotaque original. Isso significa que a mesma voz pode dar vida a conteúdos em 28 idiomas diferentes.

Esse lançamento sucede a disponibilização pública do recurso Professional Clonar Voz com IA para todos os criadores da plataforma. Essa atualização de produto, disponibilizada junto a recursos adicionais de segurança, permite que usuários criem uma cópia digital perfeita da própria voz, praticamente indistinguível da original. O lançamento de hoje significa que sua voz poderá falar nos quase 30 idiomas oferecidos pelo modelo multilíngue.

Os idiomas compatíveis agora incluem: chinês, coreano, holandês, turco, sueco, indonésio, filipino, japonês, ucraniano, grego, tcheco, finlandês, romeno, dinamarquês, búlgaro, malaio, eslovaco, croata, árabe clássico, e tâmil.

Eles se juntam aos idiomas disponíveis anteriormente, incluindo inglês, polonês, alemão, espanhol, francês, italiano, hindi e português.

Após lançamentos recentes de recursos e melhorias contínuas na plataforma, a ElevenLabs também confirmou hoje que a plataforma está oficialmente saindo da fase Beta. Essa transição marca um momento decisivo no compromisso da empresa de fornecer ferramentas confiáveis e de ponta para seus mais de 1 milhão de usuários no mundo.

Olhando para o futuro, a ElevenLabs planeja introduzir um mecanismo que permita aos usuários compartilhar vozes na plataforma e se beneficiar do desenvolvimento de novos áudios, promovendo oportunidades de colaboração entre humanos e IA.

Mati Staniszewski, CEO e cofundador da ElevenLabs, comenta:

A ElevenLabs nasceu do sonho de tornar todo conteúdo universalmente acessível em qualquer idioma e com qualquer voz. Com o lançamento do Eleven Multilingual v2, estamos um passo mais perto de transformar esse sonho em realidade e de disponibilizar vozes IA com qualidade humana em todos os dialetos.

“Nossas ferramentas de geração de Text to Speech ajudam a nivelar o campo e levam recursos de áudio falado de alta qualidade a todos os criadores. Esses benefícios agora se estendem a aplicações multilíngues em quase 30 idiomas. Com o tempo, esperamos abranger ainda mais idiomas e vozes com a ajuda da IA e eliminar as barreiras linguísticas do conteúdo. Na ElevenLabs, acreditamos que esses avanços em acessibilidade promoverão mais criatividade, inovação e diversidade.

Ao reduzir o custo e os recursos necessários para criar conteúdo de áudio de alta qualidade em vários idiomas, a ElevenLabs permite que empresas e criadores produzam conteúdos mais criativos e acessíveis, que encontrem eco entre culturas e idiomas.

Para desenvolvedores independentes de jogos e editoras, a ferramenta de geração de fala multilíngue oferece novas oportunidades para traduzir experiências de jogos e conteúdo de áudio para públicos internacionais, conectando-se com jogadores e ouvintes em seus próprios idiomas sem comprometer a qualidade ou a precisão do áudio falado.

Da mesma forma, as instituições de ensino agora podem fornecer instantaneamente aos alunos conteúdo de áudio preciso nos idiomas-alvo, fortalecendo a compreensão linguística e as habilidades de pronúncia, além de atender a diferentes estilos de ensino e necessidades de aprendizagem de estudantes internacionais.

Criadores de todos os tipos podem usar a ferramenta da ElevenLabs para melhorar a acessibilidade do conteúdo para pessoas com deficiência visual ou necessidades adicionais de aprendizagem, complementando o conteúdo visual com fala disponível em vários idiomas.

Seu conjunto inicial de ferramentas de voz IA, apresentado em janeiro de 2023, incluía a capacidade de transformar qualquer texto em fala por meio de uma seleção de vozes sintéticas pré-projetadas, além da capacidade de criar um clone da própria voz. A ferramenta de síntese de fala multilíngue é mais um passo na missão da ElevenLabs de tornar todo conteúdo universalmente acessível em qualquer idioma e com qualquer voz.

A tecnologia já foi adotada em diversos segmentos e setores criativos, permitindo que autores independentes criem audiolivros, deem voz a personagens secundários em videogames, ajudem pessoas com deficiência visual a acessar conteúdo escrito online e impulsionem a primeira emissora de rádio com IA do mundo. A ElevenLabs também firmou parceria com diversos criadores de conteúdo e estúdios líderes, incluindo geradores de vídeo com IA D-ID, uma das maiores editoras de audiolivros do mundo, Storytel, a plataforma de vídeos científicos de acesso aberto ScienceCast cuja ferramenta de geração de vídeo resume artigos de pesquisa científica publicados no arXiv, a importante plataforma global de criadores de conteúdo TheSoul Publishing, desenvolvedores de jogos incríveis, como Embark Studios e Paradox Interactive, e a plataforma de mídia MNTN.

Contato
press@elevenlabs.io

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade