API de Text to Speech
Geração de fala ultrarrealista e com baixa latência
Crie com TTS de alta qualidade e controlável para aplicações em tempo real e em lote. Modelos otimizados para latência, fidelidade e consistência em conteúdos longos.
- Lovable
- Synthesia
- Stripe
- Perplexity
- Twilio
Desenvolvido com os mais avançados modelos de voz IA
Escolha o modelo ideal para seu caso de uso: de agentes com latência ultrabaixa a narrações expressivas em formato longo.

Eleven v3
Nosso modelo mais expressivo e rico em emoções
- Interpretação e performance dramáticas
- Compatível com mais de 70 idiomas
- Limite de 3.000 caracteres
- Diálogo com vários interlocutores
- ~US$ 0,10 por minuto

v3 Conversacional
Nosso modelo mais expressivo para fala em tempo real.
- Baixa latência (~280 ms)
- Alta qualidade e interpretação expressiva
- Compatível com mais de 70 idiomas
- Tags de áudio personalizadas
- ~US$ 0,05 por minuto

Flash v2.5
Nosso modelo de síntese de fala com menor latência
- Latência ultrabaixa (~75 ms)
- Compatível com 32 idiomas
- Limite de 40.000 caracteres
- ~US$ 0,05 por minuto

Multilingual v2
Modelo de síntese de fala realista e com qualidade consistente
- Resultado com som natural
- Compatível com 29 idiomas
- Limite de 10.000 caracteres
- Desenvolvido para gerações de conteúdo longo
- ~US$ 0,10 por minuto
Tudo o que você precisa para criar fala pronta para produção
Gere fala expressiva e controlável com modelos desenvolvidos para uso em tempo real, conteúdos longos e produção.
Controle a emoção e a interpretação
Crie falas expressivas e controláveis, com camadas de emoção, eventos de áudio e paisagens sonoras imersivas.

Acesse mais de 11.000 vozes
Explore uma coleção em constante crescimento de vozes expressivas e realistas para qualquer caso de uso.

Criação e clonagem de voz
Crie em mais de 30 idiomas com vozes naturais, sotaques expressivos e áudio localizado para seu público.

Diálogo com vários interlocutores
Crie conversas naturais com vários interlocutores em mais de 70 idiomas, com vozes expressivas e controláveis.

Eventos de áudio e direção
Controle a interpretação com tags de áudio, indicações de tempo e direção narrativa integradas à fala.

Dicionários de pronúncia
Defina pronúncias personalizadas para garantir uma fala consistente e precisa para nomes e terminologias.



