Text to Speech
Saiba como transformar texto em áudio falado realista com a ElevenLabs.
Visão geral
A API Text to Speech (TTS) da ElevenLabs transforma texto em áudio realista, com entonação, ritmo e percepção emocional refinados. Nossos modelos se adaptam a pistas textuais em 32 idiomas e diversos estilos de voz e podem ser usados para:
- Narrar campanhas globais de mídia e anúncios
- Produzir audiolivros em vários idiomas com entonação emocional complexa
- Transmitir áudio em tempo real a partir de texto
Ouça um exemplo:
Explore nossa Voice Library para encontrar a voz ideal para seu projeto.
Qualidade de voz
Para aplicações em tempo real, o Flash v2.5 oferece latência ultrabaixa de 75 ms, enquanto o Multilingual v2 fornece áudio da mais alta qualidade com expressão mais refinada.
Opções de voz
A ElevenLabs oferece milhares de vozes em 32 idiomas por meio de diversos métodos de criação:
- Voice Library com mais de 3.000 vozes compartilhadas pela comunidade
- Clonagem profissional de voz para réplicas com a mais alta fidelidade
- Clonagem instantânea de voz para replicar vozes rapidamente
- Design de voz para gerar vozes personalizadas a partir de descrições em texto
Saiba mais sobre nossas opções de voz.
Formatos de saída compatíveis
O formato de resposta padrão é mp3, mas outros formatos, como pcm e ulaw, estão disponíveis.
- MP3
- Taxas de amostragem: 22.05kHz - 44.1kHz
- Taxas de bits: 32kbps - 192kbps
- 22.05kHz @ 32kbps
- 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
- PCM (S16LE)
- Taxas de amostragem: 16kHz - 44.1kHz
- Taxas de bits: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
- Profundidade de 16 bits
- μ-law
- Taxa de amostragem de 8kHz
- Otimizado para aplicações de telefonia
- A-law
- Taxa de amostragem de 8kHz
- Otimizado para aplicações de telefonia
- Opus
- Taxa de amostragem: 48kHz
- Taxas de bits: 32kbps - 192kbps
Opções de áudio de maior qualidade estão disponíveis apenas nos planos pagos — consulte nossa página de preços para mais detalhes.
Idiomas compatíveis
Nossos modelos multilíngues v2 oferecem suporte a 29 idiomas:
Inglês (EUA, Reino Unido, Austrália, Canadá), Japonês, Chinês, Alemão, Hindi, Francês (França, Canadá), Coreano, Português (Brasil, Portugal), Italiano, Espanhol (Espanha, México), Indonésio, Holandês, Turco, Filipino, Polonês, Sueco, Búlgaro, Romeno, Árabe (Arábia Saudita, Emirados Árabes Unidos), Tcheco, Grego, Finlandês, Croata, Malaio, Eslovaco, Dinamarquês, Tâmil, Ucraniano e Russo.
O Flash v2.5 oferece suporte a 32 idiomas — todos os idiomas dos modelos v2, além de:
Húngaro, Norueguês e Vietnamita
Basta inserir texto em qualquer um dos idiomas compatíveis e selecionar uma voz correspondente na nossa Voice Library. Para obter resultados mais naturais, escolha uma voz com um sotaque que corresponda ao idioma e à região desejados.
Prompting
Os modelos interpretam o contexto emocional diretamente da entrada de texto. Por exemplo, adicionar texto descritivo como “ela disse animada” ou usar pontos de exclamação influencia a emoção da fala. Configurações de voz como Estabilidade e Similaridade ajudam a controlar a consistência, enquanto a emoção subjacente vem de pistas textuais.
Leia o guia de prompting para mais detalhes.
O texto descritivo será falado pelo modelo e, se desejar, deverá ser cortado ou removido manualmente do áudio.
Perguntas frequentes
Posso clonar minha própria voz?
Sim, você pode criar clones instantâneos de voz da sua própria voz a partir de clipes de áudio curtos. Para clones de alta fidelidade, confira nosso recurso de clonagem profissional de voz.
Sou proprietário do áudio gerado?
Sim. Você mantém a propriedade de qualquer áudio que gerar. No entanto, os direitos de uso comercial estão disponíveis apenas em planos pagos. Com uma assinatura paga, você pode usar o áudio gerado para fins comerciais e monetizar os resultados se possuir os direitos de propriedade intelectual do conteúdo de entrada.
O que se qualifica como uma regeneração gratuita?
Uma regeneração gratuita permite gerar novamente o mesmo conteúdo de conversão de texto em fala sem custo adicional, sujeita às seguintes condições:
- Você pode gerar novamente cada conteúdo até 2 vezes gratuitamente
- O conteúdo deve ser exatamente o mesmo da geração anterior. Qualquer alteração no texto, nas configurações de voz ou em outros parâmetros exigirá uma nova geração paga
As regenerações gratuitas são úteis caso haja uma leve distorção no áudio gerado. De acordo com os benchmarks internos da ElevenLabs, as regenerações resolvem cerca de metade dos problemas de qualidade, e os problemas restantes geralmente são causados por dados de treinamento de baixa qualidade.
Como reduzo a latência em casos de uso em tempo real?
Use os modelos Flash de baixa latência (Flash v2 ou v2.5), otimizados para cenários de conversação ou interação quase em tempo real. Consulte nosso guia de otimização de latência para mais detalhes.
Por que minha saída às vezes é inconsistente?
Os modelos são não determinísticos. Para obter consistência, use o parâmetro seed opcional, embora diferenças sutis ainda possam ocorrer.
Qual é a prática recomendada para conversões de textos longos?
Divida textos longos em segmentos e use streaming para reprodução em tempo real e processamento eficiente. Para manter o fluxo natural da prosódia entre as partes, inclua os parâmetros de texto anterior/próximo ou de ID da solicitação anterior/próxima .
Informações principais
- Determinismo: A saída é não determinística — use o parâmetro
seedpara resultados mais consistentes - Regenerações gratuitas: Até 2 regenerações gratuitas por geração (somente com o mesmo conteúdo e parâmetros)
- Propriedade: Você mantém a propriedade do áudio gerado; o uso comercial exige um plano pago
- Casos de uso de baixa latência: Use modelos Flash (
eleven_flash_v2oueleven_flash_v2_5) — consulte o guia de otimização de latência - Textos longos: Divida textos longos em segmentos; use os parâmetros
previous_text/next_textpara manter a prosódia natural entre as partes