Text to Speech
e o v4 Turbo
Crie vozes expressivas e controláveis com camadas de emoção, eventos de áudio e paisagens sonoras imersivas.
Eleven v4
Nosso modelo de voz mais rápido e expressivomodelo de voz
O Eleven v4 foi criado com uma arquitetura totalmente nova, que lê um roteiro como um dublador faria. Ele entende quem está falando, o que acabou de acontecer e como cada frase deve soar.

John - apresentador, teatral
Sia - conversacional, britânica
John - apresentador, teatral
John - apresentador, teatralUma variedade de emoções e sons
Voz em mais de 90 idiomas, com uma variedade excepcional de emoções, vários locutores e efeitos sonoros integrados para criar o cenário.

Criado com uma nova arquitetura
Escreva as instruções no roteiro
Adicione instruções como [laughs], [whispers] e [door slams] diretamente ao roteiro. O Eleven v4 segue sequências de tags com mais confiança que o v3, incluindo efeitos sonoros.
Crie áudios longos sem emendas
A conexão de contexto mantém o ritmo e a interpretação estáveis em roteiros de qualquer duração. Um audiolivro completo soa como uma única gravação, da primeira à última página.
Regenere sem alterar a voz
Refaça uma frase uma ou cinquenta vezes, e a pessoa continuará sendo a mesma. A estabilidade do locutor se mantém em diálogos, narrações e tudo entre eles.
Use um Clone de Voz Profissional
Clones de Voz Profissionais não eram compatíveis com o v3. No Eleven v4, eles voltaram e usam toda a variedade emocional do modelo em todos os idiomas que falam.
Eleven v4 Turbo
Apresentamos o Eleven v4 Turbopara uso em tempo real e agentes
Nosso modelo de voz em tempo real mais rápido, com toda a expressividade do Eleven v4, disponível pela API e pelo ElevenAgents. O Eleven v4 Turbo tem latência mediana de inferência de ~100 ms, tempo até a primeira fala de ~150 ms e mantém a consistência em interações longas.
Tempos de resposta que ninguém percebe
Com tempo mediano de 150 ms até a primeira fala, a latência desaparece e a conversa flui naturalmente.
Ouça em uma chamada real
Saiba mais sobre o Eleven v4 Turbo com um agente criado com ele.
Otimizado para conversas ao vivo
Transmita texto e receba áudio
Envie o texto conforme seu LLM o gera, e o áudio começa a chegar antes mesmo de a frase terminar. Streaming bidirecional, criado para loops de agentes.
Expressão na velocidade da conversa
O Turbo oferece toda a variedade expressiva do Eleven v4. Confirmações, escalonamentos e pausas soam de forma diferente, em vez de serem lidos da mesma maneira.
Uma voz em todas as interações
Os Clones de Voz Profissionais funcionam de forma idêntica nos dois modelos, mantendo uma única voz de marca consistente do início ao fim da chamada.
Fale como um nativo
Use textos em japonês, espanhol ou português, e a voz os falará com fluência e sotaque nativo.





Escolha entre mais de 17.500 vozes



Escolha entre mais de 17.500 vozes



Vozes para narração Um lugar para quem conta histórias. Vozes acolhedoras, confiáveis e consistentes em todos os projetos.
Vozes conversacionais Para conversas do dia a dia, você precisa de uma voz natural e descontraída. Nossas vozes conversacionais foram criadas para diálogos e podcasts com um tom espontâneo.
Vozes para redes sociais Vozes que ganham vida em conteúdos curtos. Capte a energia e a personalidade necessárias para manter o usuário no seu TikTok ou Reel do começo ao fim.
Vozes de personagens Uma seleção de vozes para seu mundo fictício. Escolha um elenco dinâmico que dá vida ao seu jogo, audiolivro ou animação.
Vozes educacionais Vozes confiáveis e pacientes que orientam estudantes em tópicos complexos. Ideais para cursos, tutoriais, simulações de treinamento e guias de todos os níveis.
Vozes para publicidade Vozes refinadas e cheias de confiança para impulsionar a venda do seu próximo produto. Perfeitas para anúncios digitais, de TV ou rádio.
Vozes para entretenimento De trailers de filmes impactantes a vozes cômicas feitas para interpretação, estas vozes transbordam personalidade. Para conteúdos em que a entrega importa tanto quanto o conteúdo.
Vozes multilíngues Vozes criadas para conteúdo global. Ritmo natural, expressões idiomáticas e sotaques que se conectam com o público em todos os mercados.
Ampliamos a adoção do Agentforce Voice por meio de controle determinístico, e o que ouvimos consistentemente dos clientes é que eles confiam nele porque cada ação de um agente é fundamentada e governada, em vez de improvisada. Uma parte essencial dessa estratégia é equilibrar esse determinismo com modelos de voz de alta qualidade e alta inteligência emocional. É justamente aí que vemos o Eleven v4 Turbo elevar o padrão, com respostas mais rápidas e naturais que atendem ao nível esperado pelos nossos clientes, permitindo levar o Agentforce Voice a ainda mais casos de uso.
Ao trabalhar com centenas de editoras para levar seu jornalismo ao áudio, vemos em primeira mão o quanto a qualidade da voz importa. Desde a parceria com a ElevenLabs, muitas editoras tiveram maior engajamento e tempos de escuta mais longos. O Eleven v4 dá às editoras mais formas de garantir que essas vozes sejam envolventes, familiares e inequivocamente próprias.
O ElevenLabs v4 traz um novo nível de som natural para conversas por voz. As vozes não são apenas mais expressivas, mas também mais controláveis, o que nos permite criar experiências de voz mais ricas e imersivas.
Na primeira vez que usei o Eleven v4, o som era tão limpo e realista que parecia que eu estava conduzindo uma sessão com um talento no estúdio.
Buscávamos um modelo de voz rápido o bastante para parecer uma conversa real sem abrir mão da qualidade, e o Eleven v4 Turbo é o primeiro a oferecer os dois. Para workflows de vendas automatizados, este é o ponto em que desenvolver deixa de parecer um experimento.
Escolha como ele soaantes de dizer uma palavra
Toda geração começa com uma voz. Clone uma que você já tem, crie uma a partir de uma descrição ou corrija a pronúncia de palavras específicas com suporte a IPA.


Clonar Voz com IA
Clone uma voz a partir de dez segundos de áudio ou treine um Clone de Voz Profissional para uma correspondência quase perfeita.
Criação de Voz
Descreva uma voz em uma frase e gere-a, sem precisar de sessão de gravação ou seleção de elenco.
Dicionário de Pronúncia
Defina como nomes, siglas e termos técnicos são pronunciados. Configure a fonética uma vez, e todas as gerações a usarão.
Comece a criar grátisFaça upgrade quando precisar de mais
Disponível via APILeve o Eleven v4 ao seu app
Crie experiências em tempo real e agentes de voz com o Eleven v4 Turbo, tudo pela ElevenAPI.
Acesse a API do Eleven v4 e do Eleven v4 Turbo
Adicione vozes expressivas a qualquer produto usando nossa API REST, endpoints de streaming ou SDKs para TypeScript e Python.
- Alterne modelos com um único model_id
- Envie texto por streaming e receba áudio em tempo real
- Mantenha a continuidade em gerações longas


