Text to Speech

Um guia para converter texto em voz com a ElevenLabs

Visão geral

A tecnologia Text to Speech da ElevenLabs é parte essencial das nossas soluções e gera vozes criadas com IA de alta qualidade em várias aplicações no mundo todo. É provável que você já tenha ouvido nossas vozes em ação, proporcionando experiências de áudio naturais.

Começar a gerar seu primeiro áudio com Text to Speech é muito simples. No entanto, para aproveitar ao máximo esse recurso, há alguns pontos que você precisa ter em mente.

Guia

Demonstração de Text to Speech

1

Entrada de texto

Digite ou cole seu texto na caixa de entrada da página Text to Speech.

2

Seleção de voz

Selecione a voz que deseja usar em suas Vozes, no canto inferior esquerdo da tela.

3

Ajuste as configurações (opcional)

Modifique as configurações de voz para obter o resultado desejado.
4

Gerar

Clique no botão ‘Gerar’ para criar seu arquivo de áudio.

Configurações

Conheça as vozes, os modelos e as configurações para criar fala de alta qualidade.

As configurações que você usa, especialmente a voz e o modelo, afetam significativamente o resultado. É muito importante conhecê-las e entender algumas boas práticas. Embora outras configurações também influenciem o resultado, seu impacto é menor em comparação com a voz e o modelo que você seleciona.

A ordem de importância é a seguinte: a seleção da voz é o mais importante, seguida pela seleção do modelo e pelas configurações do modelo. Todos esses elementos, e a combinação entre eles, influenciam o resultado.

Vozes

Seleção de voz do Text to Speech

Oferecemos muitos tipos de vozes, incluindo as Vozes padrão selecionadas por nós, nossa ampla Voice Library with praticamente qualquer voz que você imaginar, vozes totalmente sintéticas criadas com nossa ferramenta de Design de voz e sua própria coleção de vozes clonadas, criada com nossas duas tecnologias: Clonagem instantânea de voz e Clonagem profissional de voz.

Nem todas as vozes são iguais, e muito depende do áudio de origem usado para criá-las. Algumas vozes oferecem uma interpretação e entrega melhores e mais humanas, enquanto outras são mais estáveis.

Escolher a voz certa para o seu conteúdo específico é essencial. Essa provavelmente é a decisão mais importante e que terá o maior impacto no resultado final. Ela determina o gênero, o tom, o sotaque, o ritmo e a entrega. Vale a pena dedicar mais tempo para selecionar a voz perfeita e testá-la adequadamente, garantindo que ela seja consistente e atenda às suas expectativas.

Para gerar fala em um idioma específico, usar uma voz nativa da Voice Library ou clonar uma voz que fale esse idioma com o sotaque correto produzirá os melhores resultados. Embora qualquer voz possa tecnicamente falar qualquer idioma, ela manterá seu sotaque original. Por exemplo, usar uma voz nativa em inglês para gerar fala em francês provavelmente resultará em uma saída em francês, mas com sotaque inglês, pois a IA precisa generalizar como essa voz soaria em um idioma no qual não foi treinada.

Saiba mais sobre vozes

Se você tem uma voz de que gosta, mas quer uma entrega diferente, nossa ferramenta de Remixagem de voz pode ajudar. Ela permite usar prompts em linguagem natural para alterar a entrega, o ritmo, o tom, o gênero e até os sotaques de uma voz. Ao mudar sotaques, a voz base e o sotaque desejado são muito importantes. Os resultados podem variar: às vezes funciona perfeitamente, enquanto em outras pode ser necessário tentar algumas vezes para acertar.

É possível obter resultados muito bons com a Remixagem de voz, mas eles geralmente não serão tão bons quanto os de uma Clonagem profissional de voz feita corretamente. Eles serão mais próximos dos de uma Clonagem instantânea de voz.

Lembre-se de que a remixagem de voz funciona apenas com vozes específicas. Por exemplo, você não pode remixar vozes da Voice Library; só é possível remixar vozes que você mesmo criou ou as vozes padrão.

Modelos

Seleção de modelo do Text to Speech

Oferecemos duas famílias de modelos: os modelos Standard (alta qualidade) e os modelos Flash, otimizados para latência extremamente baixa. A maioria das famílias inclui versões apenas em inglês e multilíngues.

Eleven v4 é nosso modelo mais recente. Ele está disponível em duas variantes: Eleven v4 e Eleven v4 Turbo.

A seleção do modelo é a segunda maior influência no resultado final do áudio, logo depois da seleção da voz. Recomendamos reservar um momento para testar os diferentes modelos com a voz escolhida e encontrar a melhor combinação. Todos os nossos modelos têm pontos fortes e limitações, e funcionam melhor com algumas vozes do que com outras, então encontrar uma boa combinação é importante.

Se o resultado for exclusivamente em inglês, recomendamos fortemente usar um de nossos modelos apenas em inglês. Eles costumam ser mais fáceis de usar, mais estáveis e, em geral, oferecem desempenho superior para conteúdo apenas em inglês. Se o seu conteúdo estiver em outro idioma ou puder ser multilíngue, você deverá usar um dos modelos multilíngues.

Saiba mais sobre nossos modelos

Configurações de voz

Configurações de voz do Text to Speech

A configuração mais comum é estabilidade em torno de 50, similaridade em torno de 75 e estilo em 0, com poucas alterações depois disso. É claro que tudo depende da voz original e do estilo de interpretação que você busca.

É importante observar que a IA não é determinística; definir os controles deslizantes com valores específicos não garante os mesmos resultados todas as vezes. Em vez disso, eles funcionam mais como uma faixa, determinando o quanto a aleatoriedade pode variar entre cada geração.

Velocidade

A configuração de velocidade permite acelerar ou desacelerar a fala gerada. O valor padrão é 1.0, o que significa que a velocidade não é ajustada. Valores abaixo de 1.0 desaceleram a voz, até o mínimo de 0.7. Valores acima de 1.0 aceleram a voz, até o máximo de 1.2. Valores extremos podem afetar a qualidade da fala gerada.

A velocidade não está disponível para o modelo Eleven v3.

Estabilidade

O controle deslizante de estabilidade determina o quão estável é a voz e a aleatoriedade entre cada geração. Reduzir esse controle introduz uma gama emocional mais ampla para a voz. Como mencionado antes, isso também é bastante influenciado pela voz original. Definir o controle muito baixo pode resultar em interpretações estranhas e excessivamente aleatórias, fazendo o personagem falar rápido demais. Por outro lado, defini-lo muito alto pode levar a uma voz monótona com pouca emoção.

Para uma interpretação mais viva e dramática, recomendamos definir o controle de estabilidade em um valor menor e gerar algumas vezes até encontrar uma interpretação de que você goste.

Por outro lado, se quiser uma interpretação mais séria, até quase monótona em valores muito altos, recomendamos definir o controle de estabilidade em um valor maior. Como o resultado é mais consistente e estável, você geralmente não precisa gerar tantas amostras para alcançar o resultado desejado. Experimente para descobrir o que funciona melhor para você!

Similaridade

O controle deslizante de similaridade define o quanto a IA deve seguir a voz original ao tentar replicá-la. Se o áudio original for de baixa qualidade e o controle de similaridade estiver alto demais, a IA poderá reproduzir artefatos ou ruídos de fundo ao tentar imitar a voz, caso eles estejam presentes na gravação original.

A similaridade não está disponível para o modelo Eleven v3.

Exagero de estilo

Com a introdução dos modelos mais recentes, também adicionamos uma configuração de exagero de estilo. Essa configuração tenta amplificar o estilo do locutor original. Ela consome recursos computacionais adicionais e pode aumentar a latência se for definida com qualquer valor diferente de 0. É importante observar que o uso dessa configuração torna o modelo um pouco menos estável, pois ele busca enfatizar e imitar o estilo da voz original.

Em geral, recomendamos manter essa configuração em 0 o tempo todo.

Speaker Boost

Essa configuração aumenta a similaridade com o locutor original. No entanto, usá-la exige uma carga computacional um pouco maior, o que, por sua vez, aumenta a latência. As diferenças introduzidas por essa configuração geralmente são bastante sutis.

O Speaker Boost não está disponível para o modelo Eleven v3.

Gerar

Depois de selecionar sua voz, escolher um modelo e configurar suas opções, o processo de geração é simples: você insere o texto, pressiona “Gerar fala” e o áudio é gerado.

Embora o processo seja muito simples à primeira vista, o texto que você insere é extremamente importante para alcançar o resultado desejado. Ao usar palavras que podem estar “fora da distribuição” — ou seja, coisas que a IA raramente encontrou durante o treinamento — como nomes estranhos, abreviações incomuns, símbolos ou até emojis, você corre o risco de confundir a IA e tornar o resultado mais instável. Emojis e certos símbolos são particularmente difíceis de interpretar corretamente para a IA.

Ao usar o Text to Speech pela interface, executamos uma etapa de normalização automática na sua entrada para melhorar a legibilidade do texto e facilitar o processamento pela IA. Em geral, essa etapa converte símbolos e números em texto por extenso, orientando a IA quanto à pronúncia correta.

Uma boa prática que recomendamos fortemente é evitar escrever números como algarismos ou usar símbolos, especialmente ao usar modelos multilíngues, embora isso também se aplique aos modelos apenas em inglês. Como números e símbolos são escritos da mesma forma em muitos idiomas, mas pronunciados de maneiras diferentes, usar algarismos cria ambiguidade para a IA. Por exemplo, o número “1” é escrito da mesma forma em inglês e em muitos outros idiomas, mas sua pronúncia varia. Escrever o número por extenso, como “um”, elimina a necessidade de a IA interpretar o que deve fazer.

Estamos trabalhando em fluxos de trabalho mais avançados que permitem influenciar a entrega e a interpretação da IA usando o que chamamos de Tags de áudio. Esse recurso está disponível no Eleven v4 e no Eleven v3. Se quiser saber mais sobre esse recurso, recomendamos ler nosso guia de prompting.

Perguntas frequentes

O primeiro fator, e um dos mais importantes, é que uma entrada boa, de alta qualidade e consistente resultará em uma saída boa, de alta qualidade e consistente.

Se você fornecer à IA um áudio que não seja ideal — por exemplo, um áudio com muito ruído, reverberação em fala clara, vários locutores ou inconsistência no volume, na performance ou na interpretação — a IA se tornará mais instável, e a saída será mais imprevisível.

Se você pretende clonar sua própria voz, recomendamos fortemente que consulte as diretrizes da documentação para criar clones de voz adequados, pois isso dará a você a melhor base possível para começar. Mesmo que pretenda usar apenas Clones de Voz Instantâneos, também é recomendável ler a seção sobre Clonagem de Voz Profissional. Essa seção contém informações valiosas sobre como criar clones de voz, embora os requisitos dessas duas tecnologias sejam um pouco diferentes.

O segundo fator a considerar é que a voz escolhida terá um enorme efeito na saída. Além de a qualidade e a consistência das amostras usadas para criar esse clone específico serem extremamente importantes, como mencionado no primeiro fator, o idioma e a tonalidade da voz também são importantes.

Se você quer uma voz que soe feliz e animada, deve usar uma voz clonada com amostras felizes e animadas. Por outro lado, se quiser uma voz introspectiva e melancólica, deve selecionar uma voz com essas características.

No entanto, também é essencial usar uma voz treinada no idioma correto. Por exemplo, todos os clones de voz profissionais que oferecemos como vozes padrão são vozes em inglês e foram treinados com amostras em inglês. Portanto, se elas falarem outros idiomas, o desempenho nesses idiomas pode ser imprevisível. É essencial usar uma voz clonada a partir de amostras em que a pessoa falava o idioma que você quer que a IA fale.

Isso pode parecer um pouco trivial, mas pode fazer uma grande diferença. A IA tenta entender como ler algo com base no contexto do próprio texto, o que inclui não apenas as palavras usadas, mas também como elas são organizadas, como a pontuação é aplicada, a gramática e a formatação geral do texto.

Isso pode ter uma influência pequena, mas impactante, na interpretação da IA. Se você escrever uma palavra incorretamente, a IA não a corrigirá e tentará lê-la como foi escrita.

As configurações da IA não são determinísticas, o que significa que, mesmo com as mesmas condições iniciais (voz, configurações, modelo), ela fornecerá resultados ligeiramente diferentes, de forma semelhante a como um dublador apresenta uma performance um pouco diferente a cada vez.

Essa variabilidade pode ocorrer devido a vários fatores, como as opções mencionadas anteriormente: voz, configurações e modelo. Em geral, a amplitude dessa variabilidade pode ser controlada pelo controle deslizante de estabilidade. Uma configuração de estabilidade menor significa uma faixa maior de variação entre as gerações, mas também introduz variabilidade entre gerações, em que a IA pode ter uma interpretação um pouco mais expressiva.

Uma variabilidade maior muitas vezes pode ser desejável, pois definir a estabilidade como muito alta pode fazer determinadas vozes soarem monótonas, já que não dá à IA a mesma liberdade para gerar conteúdo mais variável. No entanto, definir a estabilidade como muito baixa também pode introduzir outros problemas, tornando as gerações instáveis, especialmente com determinadas vozes que podem ter usado áudio abaixo do ideal no processo de clonagem.

A configuração padrão de 50 geralmente é um ótimo ponto de partida para a maioria das aplicações.

Recomendamos migrar para o Eleven v4 e testá-lo com seu próprio conteúdo.

O Eleven v4 é nosso modelo de Text to Speech mais recente e avançado, e o primeiro de uma nova geração de modelos. Em comparação com o Eleven v3, ele melhora a qualidade da saída, a precisão da voz, a emoção, as tags de áudio e a cobertura de idiomas.

A precisão da clonagem de voz dá um grande salto com o Eleven v4. As vozes clonadas capturam as características da voz de origem — timbre, cadência e entonação — com mais fidelidade do que em qualquer modelo anterior.

Os Clones de Voz Instantâneos (IVCs) estão mais precisos do que nunca no Eleven v4. Eles capturam com mais fidelidade as características marcantes de uma voz de origem, facilitando criar rapidamente um clone convincente a partir de uma amostra curta de áudio.

Os Clones de Voz Profissionais (PVCs) têm suporte completo no Eleven v4. Eles se baseiam nos mesmos avanços na precisão da voz, oferecendo uma reprodução mais fiel da voz de origem para workflows que exigem o mais alto nível de consistência e controle.

O Eleven v4 vem em duas variantes, para que você possa escolher o equilíbrio ideal entre qualidade e velocidade para seu caso de uso:

  • Eleven v4 (eleven_v4) — nosso modelo de maior qualidade, ideal para criação de conteúdo, audiolivros, locuções de personagens e qualquer caso de uso em que a qualidade seja a maior prioridade.
  • Eleven v4 Turbo (eleven_v4_turbo) — qualidade extremamente alta, mantendo uma latência impressionantemente baixa, desenvolvido especificamente para casos de uso em tempo real, como agentes conversacionais e experiências interativas por voz.

Ambas as variantes usam duas configurações de voz: Estabilidade e Similaridade. Os controles deslizantes de Estilo e Velocidade não estão disponíveis no Eleven v4, e SSML não é compatível.

Quando o idioma que você está gerando corresponde ao idioma da sua voz de referência, o sotaque original é preservado exatamente como antes. Quando o idioma que você está gerando é diferente do idioma da voz de referência, o Eleven v4 gera falas fluidas e naturais no idioma de destino — em vez de transferir o sotaque da voz de referência de seu idioma original.

Você pode gerar com Criar fala e Transmitir fala usando o ID de modelo eleven_v4. Para vários locutores, use Criar diálogo e Transmitir diálogo.

Para clonagem, sotaques, comparações e a descrição completa, consulte Eleven v4. Para tags e prompting, consulte Prompting do Eleven v4.

Recomendamos migrar para o Eleven v4 e testá-lo com seu próprio conteúdo. Muitas das técnicas de prompting do Eleven v4 também se aplicam ao Eleven v3.

Eleven v3 é um modelo de Text to Speech expressivo e com grande riqueza emocional. Ele produz falas naturais e realistas, com ampla variedade emocional e compreensão contextual em mais de 70 idiomas.

O Eleven v3 oferece:

  • Suporte a tags de áudio
    • emoções: [sad] [angry] [happily]
    • orientação de entrega: [whispers] [shouts]
    • reações não verbais: [laughs] [clears throat] [sighs]
  • Modo de diálogo para áudios naturais com vários locutores
  • Suporte a mais de 70 idiomas

Este modelo funciona bem para conversas entre personagens, narração de audiolivros e diálogos emocionais.

Você pode gerar com o v3 pela API usando nossos endpoints Criar fala e Transmitir fala, especificando o ID de modelo eleven_v3.

Você também pode usar nossos endpoints Criar diálogo e Transmitir diálogo para criar um diálogo natural com vários locutores.

Acesse os recursos abaixo para saber mais:

O controle de velocidade da voz está disponível para Text to Speech via Speech Synthesis, Estúdio, ElevenAgents e nossa API.

Você pode controlar a velocidade da voz usando a configuração Velocidade.

Os valores possíveis variam de 0,7 a 1,2. Valores abaixo de 1 deixam a fala mais lenta, e valores acima de 1 a aceleram. Valores extremos podem afetar a qualidade da fala gerada. 

Essa configuração está disponível para todas as vozes e todos os modelos. Você pode encontrá-la nas configurações de voz.

Para saber como controlar a fala ao usar a API, consulte nossa referência da API.

Qualquer voz pode falar qualquer um dos idiomas compatíveis.

O funcionamento do modelo atual não exige que você selecione um idioma específico. Basta escrever no idioma que você quer que a IA fale, e ela entende automaticamente. No entanto, como pode haver sobreposição entre idiomas diferentes que usam palavras e vocabulários semelhantes, mas com pronúncias e sotaques bastante distintos, você deve usar uma voz clonada a partir de alguém falando o idioma com o sotaque correto.

O idioma é determinado pelo texto, enquanto o sotaque e a pronúncia são determinados pela própria voz. Ela precisa desses dois contextos para funcionar da melhor forma.

Estamos desenvolvendo novas tecnologias para facilitar a seleção de idioma, mas, pela forma como a IA é construída, tudo isso ainda está em desenvolvimento.

Você pode baixar os arquivos gerados de duas formas:

Você pode baixar um arquivo gerado imediatamente clicando no botão de download no canto inferior direito após gerar o conteúdo.

Arquivos gerados anteriormente podem ser baixados pelo seu histórico. 

Para acessar seu histórico, entre na sua conta e selecione Text to Speech na barra lateral. Depois, acesse seu histórico clicando na aba de histórico no painel do lado direito da tela. Em telas estreitas, você pode acessar seu histórico clicando no ícone de histórico acima do botão Gerar fala.

No seu histórico, você pode clicar no ícone de download para ver a opção de baixar como arquivo MP3 (128 kbps) ou WAV. 

Você também pode clicar em Avançado para baixar em outros formatos de arquivo:

  • MP3 (192 kbps)
  • MP3 (256 kbps)
  • M4A
  • FLAC

Sim. Com o Eleven v4 e o Eleven v3, você pode usar tags de áudio como [sighs] ou [exhales] para adicionar respiração e reações semelhantes à fala gerada.

Consulte o guia de prompting para mais detalhes sobre tags de áudio e controle de interpretação.

Nossos modelos Flash e Turbo foram desenvolvidos especialmente para aplicações de baixa latência.

Flash v2 e Flash v2.5 são nossos modelos de latência ultrabaixa, gerando áudio em menos de 75 ms. O Flash v2 está disponível apenas em inglês, enquanto o Flash v2.5 oferece suporte a 32 idiomas. Você pode conferir a lista completa de todos os idiomas compatíveis aqui.

Nossos modelos Turbo também têm baixa latência, mas, como os modelos Flash oferecem resultados muito semelhantes, recomendamos usar os modelos Flash em vez do Turbo. O Turbo v2 está disponível apenas em inglês, enquanto o Turbo v2.5 oferece suporte a 32 idiomas e é 25% mais rápido que o Turbo v2, gerando áudio em cerca de 300 ms.

Tanto o Flash quanto o Turbo são modelos altamente otimizados, desenvolvidos especificamente para aplicações de baixa latência sem comprometer a qualidade vocal e mantendo o padrão de qualidade esperado dos nossos modelos.

Ambos os modelos têm desconto quando você gera conteúdo pela API. Para mais detalhes, consulte os preços da API.

Também oferecemos o ElevenAgents, nossa plataforma para implantar agentes de voz interativos e personalizados. Visite nossa documentação do ElevenAgents para saber mais.

Há algumas formas de inserir uma pausa ou intervalo e influenciar o ritmo e a cadência do falante. O método depende do modelo.

Tags de áudio (Eleven v4 e Eleven v3)

Com o Eleven v4 e o Eleven v3, use tags de áudio e pontuação para controlar o ritmo e a interpretação. Esses modelos não oferecem suporte a tags de pausa SSML.

Consulte o guia de prompting para saber como usar prompting para pausas e interpretação.

Tags de pausa (Multilingual v2, Flash v2 e Flash v2.5)

A forma mais consistente de adicionar uma pausa no Multilingual v2, Flash v2 e Flash v2.5 é usar a sintaxe da tag de pausa SSML <break time="1.5s" />. Isso cria uma pausa exata e natural na fala. Não é apenas um silêncio inserido entre palavras — o modelo entende a sintaxe e adiciona uma pausa natural.

A forma como o modelo lida com essas pausas pode variar. A voz usada tem um papel fundamental no resultado. Algumas vozes, treinadas com alguns “uh” e “ah”, podem inserir esses maneirismos vocais durante as pausas, como uma pessoa falante faria.

Um exemplo seria:

“Me dê um segundo para pensar.” <break time="1.0s" /> “Sim, isso funcionaria.”

O tempo da pausa deve ser descrito em segundos. A IA consegue lidar com pausas de até 3 segundos e elas podem ser usadas no Text to Speech e pela API.

Se você usar um número excessivo de pausas SSML no texto, isso poderá causar problemas. A fala pode acelerar, ou o áudio pode apresentar mais ruídos e outros artefatos. Estamos trabalhando para resolver isso.

Pontuação

Estas opções são menos consistentes que as tags de pausa ou tags de áudio, mas ainda podem influenciar o ritmo.

Um hífen simples - ou travessão — costuma funcionar bem. Você pode adicionar vários hífens, como -- --, para uma pausa mais longa.

“Está - ficando - tarde.”

Reticências ... às vezes podem adicionar uma pausa entre palavras, mas normalmente também acrescentam certa hesitação ou nervosismo à voz, o que nem sempre é adequado.

“Eu… é, acho que sim…”

O Eleven v3 inclui suporte nativo ao Alfabeto Fonético Internacional (IPA). Saiba mais em IPA com o Eleven v3.

Tags de fonemas SSML (somente Flash v2 e Turbo v2)

No Flash v2 e no Turbo v2, você pode forçar uma determinada pronúncia com tags de fonemas SSML. Oferecemos suporte a IPA e CMU. O CMU tende a ser um pouco mais previsível e consistente na implementação atual. Saiba mais em nosso guia de pronúncia.

Grafias alternativas

Como alternativa, uma solução é encontrar outra grafia e escrever uma palavra de forma mais fonética. Você pode usar vários recursos, como letras maiúsculas, hífens, apóstrofos ou até aspas simples ao redor de uma ou mais letras.

Por exemplo, uma palavra como “trapezii” poderia ser escrita como “trapezIi” para dar mais ênfase ao “ii” da palavra.

O Eleven v4 e o Eleven v3 oferecem suporte a tags de áudio. Recomendamos o Eleven v4. Coloque uma instrução curta entre colchetes e insira-a no texto onde a interpretação deve mudar. As mesmas tags funcionam nos dois modelos.

  • Emoções: [curious] [crying] [mischievously]
  • Direção de interpretação: [whispers] [shouts]
  • Reações humanas: [laughs] [clears throat] [sighs]

Para informações mais detalhadas, consulte nosso guia de prompting.

Você pode gerar conteúdo pela API usando nossos endpoints Criar fala e Transmitir fala, especificando o ID de modelo eleven_v4 ou eleven_v3.

Você também pode usar nossos endpoints Criar diálogo e Transmitir diálogo para criar diálogos com som natural e vários falantes.

Para aplicações em tempo real, o Eleven v4 Turbo (eleven_v4_turbo) também oferece suporte a tags de áudio.

Visite os recursos a seguir para mais informações:

Os arquivos gerados com Text to Speech ou Modificador de Voz IA podem ser baixados nos formatos MP3, WAV, M4A ou FLAC. Os arquivos WAV, M4A e FLAC precisam ser baixados pelo seu histórico.

Como baixar arquivos WAV

Selecione Text to Speech ou Modificador de Voz IA na barra lateral e acesse seu histórico clicando na aba de histórico, no painel à direita da tela. Em telas estreitas, você pode acessar seu histórico clicando no ícone de histórico acima do botão Gerar fala.

No seu histórico, clique no ícone de download para ver a opção de baixar o arquivo em MP3 ou WAV.

Como baixar arquivos FLAC ou M4A

Selecione Text to Speech ou Modificador de Voz IA na barra lateral e acesse seu histórico clicando na aba de histórico, no painel à direita da tela. Em telas estreitas, você pode acessar seu histórico clicando no ícone de histórico acima do botão Gerar fala.

No seu histórico, clique no ícone de download para ver a opção de baixar o arquivo em MP3 ou WAV. Para acessar formatos adicionais, incluindo FLAC e M4A, clique em Avançado e selecione o formato de sua preferência.

Idioma ao gerar pelo site

Quando você gera áudio no site da ElevenLabs, nossa IA detecta automaticamente o idioma com base no contexto do texto do seu prompt. Isso significa que é melhor evitar usar vários idiomas em um único prompt, pois isso pode causar confusão sobre qual idioma deve ser usado. No momento, não é possível especificar um idioma ao gerar pelo site.

Idioma ao gerar pela API

Se você gerar áudio pela API, poderá especificar manualmente o idioma do seu prompt usando o parâmetro language_code. Esse é um parâmetro opcional que aceita códigos de idioma ISO 639-1.

Isso pode ser útil para prompts curtos ou ambíguos, como quando o texto contém apenas números. Especificar o idioma garante que o normalizador aplique as regras corretas para esse idioma.

Para mais informações sobre normalização, consulte este artigo.

Sotaque

O sotaque usado na sua geração vem da voz que você está usando. Se você usar uma voz que não foi treinada no idioma que está gerando, poderá notar um leve sotaque do idioma original da voz.

Para obter os melhores resultados, recomendamos usar uma voz treinada com áudios no idioma que você está gerando, com o sotaque de sua preferência. Isso ajuda a IA a compreender a pronúncia e a entonação com mais precisão.

Isso é especialmente importante para idiomas parecidos ou que compartilham muitas palavras em comum. Escolher uma voz treinada no idioma correto garante que a IA use a pronúncia e o sotaque corretos.

Você pode:

  • Criar uma voz clonada usando áudio no idioma e sotaque de sua preferência.
  • Explorar a Voice Library e usar os filtros de busca para encontrar vozes adequadas que atendam às suas necessidades.

O custo para gerar com o Eleven v3 é de 1 crédito por caractere no site. As gerações pela API têm desconto — consulte os preços da API para ver os detalhes.

Consulte os recursos a seguir para mais informações:

Com o Eleven v4 e o Eleven v3, você pode usar tags de áudio, como [laughs], para adicionar risadas e outras reações à fala gerada. Consulte o guia de prompting para mais detalhes.

Para outros modelos, a expressão emocional depende do contexto, da pontuação e das configurações de voz. Consulte Como produzir emoções?.

O modelo é sensível ao contexto mais amplo de cada enunciado: ele avalia se algo faz sentido pela forma como se relaciona com o texto anterior e posterior. Essa perspectiva mais ampla permite que ele entoe corretamente trechos mais longos, aplicando um padrão emocional unificado a uma linha de raciocínio que se estende por várias frases.

Dicas para produzir emoções:

  • O contexto é essencial para gerar emoções específicas. Se você inserir um texto engraçado ou com risadas, poderá obter um resultado alegre. O mesmo vale para raiva, tristeza e outras emoções — definir o contexto é fundamental.
  • A pontuação e as configurações de voz têm o papel principal na forma como o resultado é transmitido.
  • Dê ênfase colocando as palavras ou frases relevantes entre aspas.
  • Para fala gerada com uma voz clonada, o estilo de fala das amostras enviadas para clonagem é reproduzido no resultado. Se a fala da amostra enviada for monótona, o modelo terá dificuldade para produzir um resultado expressivo.

Com o Eleven v4 e o Eleven v3, você também pode usar tags de áudio para controlar emoções e a interpretação de forma mais direta, por exemplo [happy], [sad], [angry], [whispers] e [laughs]. Consulte o guia de prompting para mais detalhes.

Essas dicas ajudam a orientar a expressão emocional, mas não garantem um resultado específico.

Infelizmente, no momento não oferecemos a dedução no download como alternativa à dedução na geração. Atualmente, não há como pré-visualizar gerações sem consumir a cota.

Quando você pressiona “Gerar” no site, créditos são consumidos porque os servidores precisam ser ativados e o áudio precisa ser gerado. Não há como testar ou pré-visualizar uma voz com seu próprio texto sem usar créditos.

Permitimos duas regenerações gratuitas no Text to Speech pelo site nas seguintes circunstâncias:

  • O prompt (para Text to Speech) ou arquivo (para Modificador de Voz IA), a voz e o modelo permanecem os mesmos. Você pode alterar os controles deslizantes das configurações de voz.
  • A primeira geração foi feita há menos de duas horas.
  • Você não atualizou a página desde que gerou o áudio original.

Nesse caso, você verá “Regenerar fala”, e o número de regenerações gratuitas restantes será exibido ao passar o cursor sobre o botão “Regenerar fala”:

Depois que suas regenerações gratuitas forem usadas, o botão voltará a exibir “Gerar fala”, e será mostrado o número de créditos que serão usados para a geração:

As regenerações gratuitas estão disponíveis apenas no Text to Speech pelo site. Elas não estão disponíveis pela API.

Estamos avaliando se há uma forma de disponibilizar pré-visualizações com essa qualidade sem aumentar os preços ou custos. Também estamos explorando maneiras de tornar a IA mais controlável, para que você não precise pré-visualizar e obtenha o resultado desejado, de preferência já na primeira tentativa.

Qualquer voz pode falar qualquer idioma atualmente compatível com a IA. No entanto, se você não usar uma voz nativa do idioma que deseja que a IA fale — por exemplo, uma voz gerada ou uma voz clonada falando inglês —, a IA poderá ter um leve sotaque inglês ou alternar entre idiomas semelhantes.

Para ver uma lista completa de todos os idiomas compatíveis, consulte este artigo: Quais idiomas vocês oferecem suporte?

O modelo atual não exige que você selecione um idioma específico. Em vez disso, você escreve no idioma que deseja que a IA fale, e ela entende automaticamente. No entanto, como pode haver sobreposição entre idiomas diferentes que usam palavras e vocabulário semelhantes, mas com pronúncias e sotaques bastante diferentes, você deve usar uma voz clonada que tenha sido clonada falando o idioma com o sotaque correto. Isso garante que a IA tenha mais contexto sobre como falar algo e em qual idioma.

O idioma é determinado pelo texto, enquanto o sotaque e a pronúncia são determinados pela própria voz.

Estamos desenvolvendo novas tecnologias para facilitar a seleção de idioma, mas, devido à forma como a IA é construída, tudo isso ainda está em andamento.

No Text to Speech, pelo site, você pode gerar até 5.000 caracteres em uma única geração em qualquer plano pago e até 2.500 em todos os planos gratuitos.

No entanto, se você pretende gerar conteúdo longo com mais de alguns milhares de caracteres, recomendamos muito usar o Estúdio, que permite gerar facilmente conteúdos muito longos, como livros e romances. Você pode saber mais aqui.

Se você estiver gerando pela API, o tamanho máximo da entrada varia conforme o modelo usado:

Text to Speech

Flash v2.5 - até 40.000 caracteres (~40 minutos de áudio)

Turbo v2.5 - até 40.000 caracteres (~40 minutos de áudio)

Flash v2 - até 30.000 caracteres (~30 minutos de áudio)

Turbo v2 - até 30.000 caracteres (~30 minutos de áudio)

Multilingual v2 - até 10.000 caracteres (~10 minutos de áudio)

Modificador de Voz IA

Multilingual v2 - até 10 minutos de áudio

Todas as vozes prontas e vozes geradas são em inglês. Isso significa que elas podem não ter o sotaque ou a pronúncia corretos ao falar outros idiomas.

Na Voice Library, na categoria profissional, você encontra vozes que a comunidade compartilhou conosco. Essas vozes são seus próprios Clones de Voz Profissionais. Em geral, elas têm uma tag de idioma que indica o idioma em que foram clonadas, tornando-as nativas desse idioma. Você também pode usar o filtro de busca por idioma para filtrar idiomas específicos.

Números, datas, símbolos e siglas podem ser um desafio para a IA, pois muitas vezes há várias formas de pronunciá-los corretamente. Isso também pode depender do idioma usado; por exemplo, “11” pode ser lido como “Eleven”, mas também pode ser “Once” em espanhol ou “Elf” em alemão.

Há várias formas de garantir a pronúncia correta de números, datas, siglas e símbolos.

Escreva por extenso, em palavras

Para obter os melhores resultados, recomendamos escrever números, siglas, datas e símbolos por extenso, em palavras, da forma como você gostaria que a IA os pronunciasse. Isso garante que a IA tenha o máximo de contexto para fornecer a saída correta. Por exemplo, para “$100”, recomendamos escrever “cem dólares” ou “cento de dólares” para garantir o resultado desejado.

Usando um LLM

Se você usa um modelo de linguagem grande para gerar seus prompts de texto, por exemplo, ao usar ElevenAgents, pode instruir o modelo a sempre escrever números, datas, símbolos e siglas por extenso, da forma que preferir que a IA os pronuncie.

Normalização

Se você estiver gerando pela API, poderá especificar se deseja aplicar a normalização de texto usando o parâmetro apply_text_normalization. A normalização de texto escreve números e datas por extenso para garantir uma pronúncia melhor. Essa opção adiciona latência, pois o processo de normalização exige tempo adicional de processamento.

O parâmetro apply_text_normalization tem três modos:

  • on, o que significa que ele é sempre aplicado
  • off, o que significa que ele nunca é aplicado
  • auto, o que significa que a IA decidirá automaticamente quando aplicar a normalização de texto

Você também pode especificar o idioma do seu prompt usando o parâmetro language_code. Esse é um parâmetro opcional que aceita códigos de idioma ISO 639-1. 

Isso pode ser útil para prompts curtos ou ambíguos, como quando o texto inclui apenas números ou símbolos. Especificar o idioma garante que o normalizador aplique as regras corretas para esse idioma.

Para mais informações, consulte nossa referência da API.

A normalização é ativada por padrão ao gerar usando Text to Speech pelo site.  

No Estúdio, o padrão é que a normalização seja aplicada automaticamente, o que significa que a IA decidirá quando aplicar a normalização de texto. Você também pode configurar a normalização para ser sempre aplicada — essa opção fica em Configurações do projeto, na aba Avançado.

Pronúncias incorretas podem acontecer por alguns motivos diferentes. O mais comum é a palavra estar simplesmente escrita de forma errada. A IA não tentará corrigir palavras escritas incorretamente e tentará lê-las exatamente como foram escritas. Por isso, é importante revisar e confirmar que o texto está revisado e finalizado antes de pedir para a IA lê-lo.

Se quiser forçar uma determinada pronúncia, você pode usar tags de fonema SSML com nosso modelo Flash v2. Saiba mais sobre isso em nosso guia de pronúncia.

Às vezes, a IA pode pronunciar palavras incorretamente ou ter um sotaque estranho, diferente do que você espera. Isso pode acontecer por alguns motivos e, na maioria dos casos, depende muito da voz e do idioma. A melhor forma de garantir o sotaque e a pronúncia corretos é clonar uma voz com o sotaque e a pronúncia certos. Isso dará à IA mais contexto ao gerar o áudio.

O idioma é especificado pelo texto, e o sotaque é especificado pela voz. Portanto, se você estiver escrevendo em um idioma que pode compartilhar muitas palavras comuns ou que seja bastante relacionado a outro idioma, a IA pode ter dificuldade para entender como pronunciar certas palavras ou alternar entre sotaques.

No entanto, em certas circunstâncias, a IA pode pronunciar incorretamente palavras escritas corretamente, até mesmo em inglês. Isso parece depender muito da voz e do texto usados, mas deve ocorrer raramente.

No results