Eleven v4
Nosso modelo de Text to Speech mais recente e avançado.
Eleven v4 é nosso modelo de Text to Speech mais recente e avançado, e o primeiro de uma nova geração de modelos. Ele melhora a qualidade de saída, a precisão da voz, a consistência, a emoção, a interpretação, as tags de áudio e a cobertura de idiomas em comparação com o Eleven v3.
Em geral, o Eleven v4 representa uma evolução em relação ao Eleven v3 e oferece resultados melhores em quase todos os casos. Recomendamos muito migrar para o v4 e testá-lo com suas próprias vozes e conteúdo para perceber a diferença. Embora alguns casos específicos possam exigir uma opção diferente, a maioria dos usuários deve considerar o v4 a melhor escolha.
Para saber mais sobre tags, pontuação e prompts de diálogo, consulte Como usar prompts no Eleven v4.
Clonagem de voz
A precisão da clonagem de voz dá um grande salto com o Eleven v4. As vozes clonadas capturam as características da voz de origem — timbre, cadência e interpretação — com mais fidelidade do que qualquer modelo anterior.
As Clonagens Instantâneas de Voz (IVCs) estão mais precisas do que nunca no Eleven v4. Elas capturam com mais fidelidade as características definidoras de uma voz de origem, facilitando a criação rápida de um clone convincente a partir de uma amostra curta de áudio.
As Clonagens Profissionais de Voz (PVCs) têm suporte completo no Eleven v4. Elas se baseiam nos mesmos avanços em precisão de voz e oferecem uma reprodução mais fiel da voz de origem para workflows que exigem o mais alto nível de consistência e controle.
Devido a esse salto significativo de precisão, o Eleven v4 pode soar substancialmente diferente do Eleven v3. O Eleven v3 estabeleceu a base para o Eleven v4, com forte ênfase em interpretação e precisão, enquanto o Eleven v4 se apoia nessa base com uma precisão de voz substancialmente maior. Como resultado, o Eleven v4 foi projetado para capturar a voz de origem com mais fidelidade, embora você ainda possa preferir como uma voz soava no Eleven v3. Precisão e preferência pessoal nem sempre são a mesma coisa, então recomendamos comparar as duas versões com seu próprio conteúdo para escolher a melhor opção para seu caso de uso.
Como o Eleven v4 reproduz com mais fidelidade as características da voz de origem, incluindo sotaque, interpretação, volume e outras qualidades distintas, a qualidade da gravação de origem é mais importante do que nunca. Áudios de treinamento claros e limpos ajudam o Eleven v4 a capturar a voz com precisão, sem introduzir sons ou características indesejados. Ruído de fundo, distorção ou outros problemas de gravação podem afetar o resultado.
Ainda estamos experimentando o Eleven v4 para entender a melhor forma de usá-lo. Até agora, ele parece muito melhor para capturar nuances de áudio, especialmente quando há muito áudio de treinamento, como nas Clonagens Profissionais de Voz. Nossas orientações sobre o uso de dados de treinamento variados podem mudar à medida que continuamos testando como controlar o modelo com um conjunto de dados mais versátil. Por enquanto, recomendamos manter um único estilo de fala no áudio de treinamento, que o Eleven v4 deve capturar melhor do que os modelos anteriores.
Tratamento de sotaques nativos
Esta é uma das maiores mudanças do Eleven v4 em comparação com qualquer um dos modelos mais antigos, e vale a pena entendê-la bem.
Quando o idioma que você está gerando corresponde ao idioma da sua voz de referência, o sotaque original é preservado exatamente como antes.
Quando o idioma que você está gerando é diferente do idioma da voz de referência, o Eleven v4 gera uma fala fluente e natural no idioma de destino — em vez de manter o sotaque da voz de referência em seu idioma original.
Na prática: se você clonar a voz de uma pessoa que fala coreano e gerar inglês, o Eleven v4 produzirá um inglês natural e fluente, em vez de inglês falado com sotaque coreano. Isso torna todas as vozes utilizáveis em todos os idiomas compatíveis e é especialmente útil para dublagem, conteúdo multilíngue e agentes de voz que precisam atender usuários em diferentes idiomas com uma única voz.
Se seu workflow depende de uma voz manter seu sotaque nativo em outros idiomas, teste esse comportamento diretamente com o Eleven v4 antes de migrar — essa é uma mudança deliberada na forma como a geração entre idiomas funciona, não um bug.
No entanto, essa nova funcionalidade ainda está sendo ajustada, e estamos explorando formas de torná-la uma opção ativável em vez de deixá-la sempre ativa. Isso ainda é um projeto de pesquisa, então não temos um cronograma nem mais informações sobre isso neste momento.
Variantes do modelo
O Eleven v4 tem duas variantes, para que você escolha o equilíbrio certo entre qualidade e velocidade para seu caso de uso:
- Eleven v4 (
eleven_v4) — nosso modelo de mais alta qualidade, ideal para criação de conteúdo, audiolivros, locuções de personagens e qualquer caso de uso em que a qualidade seja a maior prioridade. - Eleven v4 Turbo (
eleven_v4_turbo) — qualidade extremamente alta com latência impressionantemente baixa, desenvolvido especificamente para casos de uso em tempo real, como agentes conversacionais e experiências de voz interativas.
As duas variantes usam duas configurações de voz: Estabilidade e Similaridade.
A estabilidade controla o quanto a interpretação se mantém consistente entre gerações. Valores menores permitem uma interpretação mais expressiva e variada; valores maiores mantêm o desempenho mais próximo de uma referência fixa.
A similaridade controla o quanto a saída segue a voz de referência. Valores maiores reforçam uma maior fidelidade à referência, o que pode reduzir um pouco a naturalidade.
Os controles deslizantes de Estilo e Velocidade não estão disponíveis no Eleven v4, e SSML não é compatível.
Tags de áudio (por exemplo, [whispering], [shouting], [laughing]) permitem direcionar a interpretação com controle detalhado, e o Eleven v4 as processa com um nível de nuance superior ao dos modelos anteriores. Elas ainda não são perfeitas, e continuamos aprimorando a confiabilidade com que o modelo segue as instruções das tags — esta é uma área de investimento contínuo, e continuará melhorando.
Exemplos
Estes exemplos são brutos. Nada passou por pós-processamento intenso: sem EQ, compressão, normalização, de-essing, remoção de plosivas ou algo semelhante. Se você ouvir problemas recorrentes, como clipping, plosivas, EQ irregular ou variações de volume, é muito provável que eles estejam nos dados de treinamento dessa voz. O modelo Eleven v4 apenas os capturou, pois é muito preciso, mesmo ao capturar imperfeições. Deixamos o áudio sem alterações para que você possa ouvir o que o modelo produziu.
Precisão da clonagem de voz
Cada exemplo começa com uma prévia da Voice Library. Em seguida, pegamos um texto e o geramos usando uma Clonagem Instantânea de Voz dessa voz tanto no Eleven v3 quanto no Eleven v4.
Esta não é uma comparação perfeita. O Eleven v4 também funciona com Clonagens Profissionais de Voz, que podem tornar a correspondência ainda mais precisa. No entanto, para manter uma comparação mais justa, usamos Clonagens Instantâneas de Voz para o Eleven v3 e o Eleven v4.
Estes exemplos mostram o quanto da voz original o modelo capta. É importante observar que isso também inclui EQ, qualidade, volume e quaisquer outros detalhes menores e imperfeições no áudio, como plosivas, sibilância intensa e flutuação de volume.
Ouça a prévia, depois o Eleven v3 e, por fim, o Eleven v4.
Voz NfUrCNRReUL9RXS9upG1.
Voz HBDoL4wkcalemIO0nUAu.
Interpretação de voz
Estas são gerações do Eleven v4. As tags de áudio no texto direcionam a interpretação.
Voz EkK5I93UQWFDigLMpZcX.
Voz t7VaN65ClS2VrEUwk1nR.
Audiolivro
Esta é uma narração do Eleven v4. As tags definem o ritmo e o tom da cena.
Voz KHRvDizAHFVPzoSehNY6.
O modelo continuará evoluindo
O Eleven v4 está em desenvolvimento ativo e contínuo. À medida que continuamos treinando e aprimorando o modelo após o lançamento, seu comportamento pode mudar ao longo do tempo conforme a qualidade melhora. Recomendamos testar novamente seu caso de uso periodicamente à medida que o modelo evolui, e compartilharemos atualizações importantes à medida que forem lançadas.
Perguntas frequentes
Quais idiomas o Eleven v4 oferece suporte?
O Eleven v4 oferece suporte a africâner, amárico, árabe, armênio, assamês, asturiano, azerbaijano, bielorrusso, bengali, bósnio, búlgaro, birmanês, cantonês, catalão, cebuano, croata, tcheco, dinamarquês, holandês, inglês, estoniano, filipino, finlandês, francês, fula (pulaar), galego, georgiano, alemão, grego, guzerate, hauçá, hebraico, hindi, húngaro, islandês, indonésio, italiano, japonês, canarês, cazaque, coreano, quirguiz, lao, lingala, lituano, luganda, luxemburguês, macedônio, malaio, malaiala, maltês, chinês mandarim, maori, marata, mongol, nepalês, norueguês bokmål, occitano, odia, pachto, persa, polonês, português (Brasil), panjabi, romeno, russo, sérvio, xona, sindi, eslovaco, esloveno, somali, curdo sorani, espanhol (América Latina), suaíli, sueco, tadjique, tâmil, telugo, tailandês, turco, ucraniano, urdu, uzbeque, vietnamita, galês e uolof.
Alguns idiomas são processados com mais fluência do que outros, mas, em geral, o Eleven v4 processa muito bem a grande maioria deles.
Uma voz clonada manterá seu sotaque?
Quando a voz de referência e a fala gerada estão no mesmo idioma, o sotaque da voz é preservado. Por exemplo, se você clonar alguém falando inglês com um determinado sotaque inglês e gerar fala em inglês, esse sotaque será mantido.
Posso fazer uma voz falar outro idioma com seu sotaque original?
Por padrão, quando o idioma gerado é diferente do idioma da voz de referência, o Eleven v4 busca produzir uma fala fluente e natural no idioma de destino, em vez de manter o sotaque de referência. Você pode tentar usar tags de áudio para orientar um sotaque ou estilo de interpretação, mas os resultados podem variar, então teste sua voz e caso de uso específicos.
Um clone do Eleven v4 soará como sua versão do Eleven v3?
Em geral, o Eleven v4 reproduz as características da voz de origem com muito mais precisão do que o Eleven v3, incluindo timbre, cadência, interpretação e outras maneirismos. Como resultado, um clone do Eleven v4 geralmente soará mais parecido com a voz de origem e pode soar bem diferente de sua versão do Eleven v3.
Preciso treinar o Eleven v4?
O Eleven v4 funciona tanto com Clonagem Instantânea de Voz quanto com Clonagem Profissional de Voz.
Com a Clonagem Instantânea de Voz, você cria uma voz sem uma etapa de treinamento separada. Envie uma amostra curta, geralmente de um a dois minutos, e em segundos você terá uma voz que poderá usar.
A Clonagem Profissional de Voz funciona da mesma forma que nos modelos anteriores. Ela treina um modelo dedicado com um conjunto maior de gravações.
Se você já tem uma Clonagem Profissional de Voz e quer treiná-la no Eleven v4, abra Minhas vozes, encontre a voz na lista e passe o cursor sobre ela. Você verá os modelos disponíveis para essa voz. Clique no botão de mais ao lado do Eleven v4 para iniciar o ajuste fino.
Devo usar o Voice Design com o Eleven v4?
As vozes do Voice Design funcionam com o Eleven v4, mas podem não ter uma interpretação tão expressiva nem soar tão bem quanto nos modelos anteriores.