Eleven v4

Nosso modelo de Text to Speech mais recente e avançado.

Eleven v4 é nosso modelo de Text to Speech mais recente e avançado, e o primeiro de uma nova geração de modelos. Ele melhora a qualidade de saída, a precisão da voz, a consistência, a emoção, a interpretação, as tags de áudio e a cobertura de idiomas em comparação com o Eleven v3.

Em geral, o Eleven v4 representa uma evolução em relação ao Eleven v3 e oferece resultados melhores em quase todos os casos. Recomendamos muito migrar para o v4 e testá-lo com suas próprias vozes e conteúdo para perceber a diferença. Embora alguns casos específicos possam exigir uma opção diferente, a maioria dos usuários deve considerar o v4 a melhor escolha.

Para saber mais sobre tags, pontuação e prompts de diálogo, consulte Como usar prompts no Eleven v4.

Clonagem de voz

A precisão da clonagem de voz dá um grande salto com o Eleven v4. As vozes clonadas capturam as características da voz de origem — timbre, cadência e interpretação — com mais fidelidade do que qualquer modelo anterior.

As Clonagens Instantâneas de Voz (IVCs) estão mais precisas do que nunca no Eleven v4. Elas capturam com mais fidelidade as características definidoras de uma voz de origem, facilitando a criação rápida de um clone convincente a partir de uma amostra curta de áudio.

As Clonagens Profissionais de Voz (PVCs) têm suporte completo no Eleven v4. Elas se baseiam nos mesmos avanços em precisão de voz e oferecem uma reprodução mais fiel da voz de origem para workflows que exigem o mais alto nível de consistência e controle.

Devido a esse salto significativo de precisão, o Eleven v4 pode soar substancialmente diferente do Eleven v3. O Eleven v3 estabeleceu a base para o Eleven v4, com forte ênfase em interpretação e precisão, enquanto o Eleven v4 se apoia nessa base com uma precisão de voz substancialmente maior. Como resultado, o Eleven v4 foi projetado para capturar a voz de origem com mais fidelidade, embora você ainda possa preferir como uma voz soava no Eleven v3. Precisão e preferência pessoal nem sempre são a mesma coisa, então recomendamos comparar as duas versões com seu próprio conteúdo para escolher a melhor opção para seu caso de uso.

Como o Eleven v4 reproduz com mais fidelidade as características da voz de origem, incluindo sotaque, interpretação, volume e outras qualidades distintas, a qualidade da gravação de origem é mais importante do que nunca. Áudios de treinamento claros e limpos ajudam o Eleven v4 a capturar a voz com precisão, sem introduzir sons ou características indesejados. Ruído de fundo, distorção ou outros problemas de gravação podem afetar o resultado.

Ainda estamos experimentando o Eleven v4 para entender a melhor forma de usá-lo. Até agora, ele parece muito melhor para capturar nuances de áudio, especialmente quando há muito áudio de treinamento, como nas Clonagens Profissionais de Voz. Nossas orientações sobre o uso de dados de treinamento variados podem mudar à medida que continuamos testando como controlar o modelo com um conjunto de dados mais versátil. Por enquanto, recomendamos manter um único estilo de fala no áudio de treinamento, que o Eleven v4 deve capturar melhor do que os modelos anteriores.

Tratamento de sotaques nativos

Esta é uma das maiores mudanças do Eleven v4 em comparação com qualquer um dos modelos mais antigos, e vale a pena entendê-la bem.

Quando o idioma que você está gerando corresponde ao idioma da sua voz de referência, o sotaque original é preservado exatamente como antes.

Quando o idioma que você está gerando é diferente do idioma da voz de referência, o Eleven v4 gera uma fala fluente e natural no idioma de destino — em vez de manter o sotaque da voz de referência em seu idioma original.

Na prática: se você clonar a voz de uma pessoa que fala coreano e gerar inglês, o Eleven v4 produzirá um inglês natural e fluente, em vez de inglês falado com sotaque coreano. Isso torna todas as vozes utilizáveis em todos os idiomas compatíveis e é especialmente útil para dublagem, conteúdo multilíngue e agentes de voz que precisam atender usuários em diferentes idiomas com uma única voz.

Se seu workflow depende de uma voz manter seu sotaque nativo em outros idiomas, teste esse comportamento diretamente com o Eleven v4 antes de migrar — essa é uma mudança deliberada na forma como a geração entre idiomas funciona, não um bug.

No entanto, essa nova funcionalidade ainda está sendo ajustada, e estamos explorando formas de torná-la uma opção ativável em vez de deixá-la sempre ativa. Isso ainda é um projeto de pesquisa, então não temos um cronograma nem mais informações sobre isso neste momento.

Variantes do modelo

O Eleven v4 tem duas variantes, para que você escolha o equilíbrio certo entre qualidade e velocidade para seu caso de uso:

  • Eleven v4 (eleven_v4) — nosso modelo de mais alta qualidade, ideal para criação de conteúdo, audiolivros, locuções de personagens e qualquer caso de uso em que a qualidade seja a maior prioridade.
  • Eleven v4 Turbo (eleven_v4_turbo) — qualidade extremamente alta com latência impressionantemente baixa, desenvolvido especificamente para casos de uso em tempo real, como agentes conversacionais e experiências de voz interativas.

As duas variantes usam duas configurações de voz: Estabilidade e Similaridade.

A estabilidade controla o quanto a interpretação se mantém consistente entre gerações. Valores menores permitem uma interpretação mais expressiva e variada; valores maiores mantêm o desempenho mais próximo de uma referência fixa.

A similaridade controla o quanto a saída segue a voz de referência. Valores maiores reforçam uma maior fidelidade à referência, o que pode reduzir um pouco a naturalidade.

Os controles deslizantes de Estilo e Velocidade não estão disponíveis no Eleven v4, e SSML não é compatível.

Tags de áudio (por exemplo, [whispering], [shouting], [laughing]) permitem direcionar a interpretação com controle detalhado, e o Eleven v4 as processa com um nível de nuance superior ao dos modelos anteriores. Elas ainda não são perfeitas, e continuamos aprimorando a confiabilidade com que o modelo segue as instruções das tags — esta é uma área de investimento contínuo, e continuará melhorando.

Exemplos

Estes exemplos são brutos. Nada passou por pós-processamento intenso: sem EQ, compressão, normalização, de-essing, remoção de plosivas ou algo semelhante. Se você ouvir problemas recorrentes, como clipping, plosivas, EQ irregular ou variações de volume, é muito provável que eles estejam nos dados de treinamento dessa voz. O modelo Eleven v4 apenas os capturou, pois é muito preciso, mesmo ao capturar imperfeições. Deixamos o áudio sem alterações para que você possa ouvir o que o modelo produziu.

Precisão da clonagem de voz

Cada exemplo começa com uma prévia da Voice Library. Em seguida, pegamos um texto e o geramos usando uma Clonagem Instantânea de Voz dessa voz tanto no Eleven v3 quanto no Eleven v4.

Esta não é uma comparação perfeita. O Eleven v4 também funciona com Clonagens Profissionais de Voz, que podem tornar a correspondência ainda mais precisa. No entanto, para manter uma comparação mais justa, usamos Clonagens Instantâneas de Voz para o Eleven v3 e o Eleven v4.

Estes exemplos mostram o quanto da voz original o modelo capta. É importante observar que isso também inclui EQ, qualidade, volume e quaisquer outros detalhes menores e imperfeições no áudio, como plosivas, sibilância intensa e flutuação de volume.

Ouça a prévia, depois o Eleven v3 e, por fim, o Eleven v4.

Voz NfUrCNRReUL9RXS9upG1.

"Brother... I must cross the sea, though I'd rather stay beside you. If the gods will it, we'll see each other again. Until then, when the sun sinks beyond the waves, know that I'll be looking toward home."
He clasped my forearm beneath the pale morning sky. I held on a moment longer, then watched him turn toward the waiting ship.

Voz HBDoL4wkcalemIO0nUAu.

"When I was young, I thought the mountain stood because it was strong. Then winter came, and the mountain wore its crown of snow without complaint. Spring followed, and it let every stream run free.
"So remember, traveler: strength is not always holding fast. Sometimes it is knowing what to carry, and what the season asks you to release."

Interpretação de voz

Estas são gerações do Eleven v4. As tags de áudio no texto direcionam a interpretação.

Voz EkK5I93UQWFDigLMpZcX.

[casual] "You're looking for work, eh? Hmm, I might have something for you. Just outside the valley, there's a group of wild horned boars I need you to take care of - nasty little beasts. The village would be grateful if you could get that done, and I'll make it worth your while."
------------
[annoyed] [under his breath] "Oh, you again... [sigh] Did you take care of that little problem I mentioned earlier? No, not yet? All right, off you go. I don't have time to chitchat. I'm busy standing here... handing out quests."
------------
[ecstatic] "You did it, you crazy bastard! [dismissive] Not that I didn't have any faith in you, but you wouldn't be the first one to fail. Yes, yes, I know. One of them might have been a little bigger than the others. But hey, you survived. You got it done. You helped the village."

Voz t7VaN65ClS2VrEUwk1nR.

[quietly curious] "Hmm… that mark. I haven't seen one like it in years. Where did you get it? Oh, you gonna make me guess? [giggle]"
------------
[measured] "No need to explain, if you'd rather not. This town has a way of leaving its mark on people. [soft chuckle] Usually not quite so literally."
------------
[lower, thoughtful] "Keep it covered when you can. There are still a few who remember what it means, and they may not ask as politely as I have."

Audiolivro

Esta é uma narração do Eleven v4. As tags definem o ritmo e o tom da cena.

Voz KHRvDizAHFVPzoSehNY6.

[Quiet, measured narration] The moonlit training court lay beneath the keep, its stone walls silvered with frost. Beyond the battlements, a dragon's distant call rolled over the mountains.
Sir Alden lifted his blunted practice sword. "Ready?"
Bram, his broad shoulders wrapped in a travel-worn cloak, studied the wooden shield strapped to his arm. "I've faced worse odds."
[Pause, dry amusement] "You lost to a turnip cart yesterday," Sir Alden said.
"It was a very determined cart," Bran muttered
[Gradually building energy] They circled across the frost-dusted stones. One step. Another. Alden watched Bram's hands; Bram watched the faint blue glow gathering along Alden's blade. The air between them prickled with harmless magic.
[Quick, light, playful pace] Bram charged. Alden slipped aside. Clack! Wood met steel. Bram turned, his cloak flaring, and swung wide. Alden ducked beneath it. Bram's boot skidded on the frost; he windmilled, caught himself, and bowed as if he'd meant to do that all along.
"Magnificent," Alden said.
"I was giving you time to admire the cloak," Bran retorted.

O modelo continuará evoluindo

O Eleven v4 está em desenvolvimento ativo e contínuo. À medida que continuamos treinando e aprimorando o modelo após o lançamento, seu comportamento pode mudar ao longo do tempo conforme a qualidade melhora. Recomendamos testar novamente seu caso de uso periodicamente à medida que o modelo evolui, e compartilharemos atualizações importantes à medida que forem lançadas.

Perguntas frequentes

O Eleven v4 oferece suporte a africâner, amárico, árabe, armênio, assamês, asturiano, azerbaijano, bielorrusso, bengali, bósnio, búlgaro, birmanês, cantonês, catalão, cebuano, croata, tcheco, dinamarquês, holandês, inglês, estoniano, filipino, finlandês, francês, fula (pulaar), galego, georgiano, alemão, grego, guzerate, hauçá, hebraico, hindi, húngaro, islandês, indonésio, italiano, japonês, canarês, cazaque, coreano, quirguiz, lao, lingala, lituano, luganda, luxemburguês, macedônio, malaio, malaiala, maltês, chinês mandarim, maori, marata, mongol, nepalês, norueguês bokmål, occitano, odia, pachto, persa, polonês, português (Brasil), panjabi, romeno, russo, sérvio, xona, sindi, eslovaco, esloveno, somali, curdo sorani, espanhol (América Latina), suaíli, sueco, tadjique, tâmil, telugo, tailandês, turco, ucraniano, urdu, uzbeque, vietnamita, galês e uolof.

Alguns idiomas são processados com mais fluência do que outros, mas, em geral, o Eleven v4 processa muito bem a grande maioria deles.

Quando a voz de referência e a fala gerada estão no mesmo idioma, o sotaque da voz é preservado. Por exemplo, se você clonar alguém falando inglês com um determinado sotaque inglês e gerar fala em inglês, esse sotaque será mantido.

Por padrão, quando o idioma gerado é diferente do idioma da voz de referência, o Eleven v4 busca produzir uma fala fluente e natural no idioma de destino, em vez de manter o sotaque de referência. Você pode tentar usar tags de áudio para orientar um sotaque ou estilo de interpretação, mas os resultados podem variar, então teste sua voz e caso de uso específicos.

Em geral, o Eleven v4 reproduz as características da voz de origem com muito mais precisão do que o Eleven v3, incluindo timbre, cadência, interpretação e outras maneirismos. Como resultado, um clone do Eleven v4 geralmente soará mais parecido com a voz de origem e pode soar bem diferente de sua versão do Eleven v3.

O Eleven v4 funciona tanto com Clonagem Instantânea de Voz quanto com Clonagem Profissional de Voz.

Com a Clonagem Instantânea de Voz, você cria uma voz sem uma etapa de treinamento separada. Envie uma amostra curta, geralmente de um a dois minutos, e em segundos você terá uma voz que poderá usar.

A Clonagem Profissional de Voz funciona da mesma forma que nos modelos anteriores. Ela treina um modelo dedicado com um conjunto maior de gravações.

Se você já tem uma Clonagem Profissional de Voz e quer treiná-la no Eleven v4, abra Minhas vozes, encontre a voz na lista e passe o cursor sobre ela. Você verá os modelos disponíveis para essa voz. Clique no botão de mais ao lado do Eleven v4 para iniciar o ajuste fino.

As vozes do Voice Design funcionam com o Eleven v4, mas podem não ter uma interpretação tão expressiva nem soar tão bem quanto nos modelos anteriores.