Text to Speech

Saiba como transformar texto em áudio falado realista com a ElevenLabs.

Visão geral

A API Text to Speech (TTS) da ElevenLabs transforma texto em áudio realista, com entonação, ritmo e percepção emocional refinados. Nossos modelos se adaptam a pistas textuais em 32 idiomas e diversos estilos de voz e podem ser usados para:

  • Narrar campanhas globais de mídia e anúncios
  • Produzir audiolivros em vários idiomas com entonação emocional complexa
  • Transmitir áudio em tempo real a partir de texto

Ouça um exemplo:

Explore nossa Voice Library para encontrar a voz ideal para seu projeto.

A Voice Library não está disponível pela API para usuários do plano gratuito.

Qualidade de voz

Para aplicações em tempo real, o Flash v2.5 oferece latência ultrabaixa de 75 ms, enquanto o Multilingual v2 fornece áudio da mais alta qualidade com expressão mais refinada.

Opções de voz

A ElevenLabs oferece milhares de vozes em 32 idiomas por meio de diversos métodos de criação:

Saiba mais sobre nossas opções de voz.

O formato de resposta padrão é mp3, mas outros formatos, como pcm e ulaw, estão disponíveis.

  • MP3
    • Taxas de amostragem: 22.05kHz - 44.1kHz
    • Taxas de bits: 32kbps - 192kbps
    • 22.05kHz @ 32kbps
    • 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
  • PCM (S16LE)
    • Taxas de amostragem: 16kHz - 44.1kHz
    • Taxas de bits: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
    • Profundidade de 16 bits
  • μ-law
    • Taxa de amostragem de 8kHz
    • Otimizado para aplicações de telefonia
  • A-law
    • Taxa de amostragem de 8kHz
    • Otimizado para aplicações de telefonia
  • Opus
    • Taxa de amostragem: 48kHz
    • Taxas de bits: 32kbps - 192kbps

Opções de áudio de maior qualidade estão disponíveis apenas nos planos pagos — consulte nossa página de preços para mais detalhes.

Idiomas compatíveis

Nossos modelos multilíngues v2 oferecem suporte a 29 idiomas:

Inglês (EUA, Reino Unido, Austrália, Canadá), Japonês, Chinês, Alemão, Hindi, Francês (França, Canadá), Coreano, Português (Brasil, Portugal), Italiano, Espanhol (Espanha, México), Indonésio, Holandês, Turco, Filipino, Polonês, Sueco, Búlgaro, Romeno, Árabe (Arábia Saudita, Emirados Árabes Unidos), Tcheco, Grego, Finlandês, Croata, Malaio, Eslovaco, Dinamarquês, Tâmil, Ucraniano e Russo.

O Flash v2.5 oferece suporte a 32 idiomas — todos os idiomas dos modelos v2, além de:

Húngaro, Norueguês e Vietnamita

Basta inserir texto em qualquer um dos idiomas compatíveis e selecionar uma voz correspondente na nossa Voice Library. Para obter resultados mais naturais, escolha uma voz com um sotaque que corresponda ao idioma e à região desejados.

Prompting

Os modelos interpretam o contexto emocional diretamente da entrada de texto. Por exemplo, adicionar texto descritivo como “ela disse animada” ou usar pontos de exclamação influencia a emoção da fala. Configurações de voz como Estabilidade e Similaridade ajudam a controlar a consistência, enquanto a emoção subjacente vem de pistas textuais.

Leia o guia de prompting para mais detalhes.

O texto descritivo será falado pelo modelo e, se desejar, deverá ser cortado ou removido manualmente do áudio.

Perguntas frequentes

Sim, você pode criar clones instantâneos de voz da sua própria voz a partir de clipes de áudio curtos. Para clones de alta fidelidade, confira nosso recurso de clonagem profissional de voz.

Sim. Você mantém a propriedade de qualquer áudio que gerar. No entanto, os direitos de uso comercial estão disponíveis apenas em planos pagos. Com uma assinatura paga, você pode usar o áudio gerado para fins comerciais e monetizar os resultados se possuir os direitos de propriedade intelectual do conteúdo de entrada.

Uma regeneração gratuita permite gerar novamente o mesmo conteúdo de conversão de texto em fala sem custo adicional, sujeita às seguintes condições:

  • Você pode gerar novamente cada conteúdo até 2 vezes gratuitamente
  • O conteúdo deve ser exatamente o mesmo da geração anterior. Qualquer alteração no texto, nas configurações de voz ou em outros parâmetros exigirá uma nova geração paga

As regenerações gratuitas são úteis caso haja uma leve distorção no áudio gerado. De acordo com os benchmarks internos da ElevenLabs, as regenerações resolvem cerca de metade dos problemas de qualidade, e os problemas restantes geralmente são causados por dados de treinamento de baixa qualidade.

Use os modelos Flash de baixa latência (Flash v2 ou v2.5), otimizados para cenários de conversação ou interação quase em tempo real. Consulte nosso guia de otimização de latência para mais detalhes.

Os modelos são não determinísticos. Para obter consistência, use o parâmetro seed opcional, embora diferenças sutis ainda possam ocorrer.

Divida textos longos em segmentos e use streaming para reprodução em tempo real e processamento eficiente. Para manter o fluxo natural da prosódia entre as partes, inclua os parâmetros de texto anterior/próximo ou de ID da solicitação anterior/próxima .

Informações principais

  • Determinismo: A saída é não determinística — use o parâmetro seed para resultados mais consistentes
  • Regenerações gratuitas: Até 2 regenerações gratuitas por geração (somente com o mesmo conteúdo e parâmetros)
  • Propriedade: Você mantém a propriedade do áudio gerado; o uso comercial exige um plano pago
  • Casos de uso de baixa latência: Use modelos Flash (eleven_flash_v2 ou eleven_flash_v2_5) — consulte o guia de otimização de latência
  • Textos longos: Divida textos longos em segmentos; use os parâmetros previous_text / next_text para manter a prosódia natural entre as partes