Introducing Eleven v4Introducing Eleven v4, our fastest and most emotive voice model

Pular para o conteúdo

Text to Speech

Conheça o Eleven v4
e o v4 Turbo

Crie vozes expressivas e controláveis com camadas de emoção, eventos de áudio e paisagens sonoras imersivas.

Eleven v4

Nosso modelo de voz mais rápido e expressivomodelo de voz

O Eleven v4 foi criado com uma arquitetura totalmente nova, que lê um roteiro como um dublador faria. Ele entende quem está falando, o que acabou de acontecer e como cada frase deve soar.

Uma variedade de emoções e sons

Voz em mais de 90 idiomas, com uma variedade excepcional de emoções, vários locutores e efeitos sonoros integrados para criar o cenário.

Demo 1 de 4

Criado com uma nova arquitetura

Escreva as instruções no roteiro

Adicione instruções como [laughs], [whispers] e [door slams] diretamente ao roteiro. O Eleven v4 segue sequências de tags com mais confiança que o v3, incluindo efeitos sonoros.

Crie áudios longos sem emendas

A conexão de contexto mantém o ritmo e a interpretação estáveis em roteiros de qualquer duração. Um audiolivro completo soa como uma única gravação, da primeira à última página.

Regenere sem alterar a voz

Refaça uma frase uma ou cinquenta vezes, e a pessoa continuará sendo a mesma. A estabilidade do locutor se mantém em diálogos, narrações e tudo entre eles.

Use um Clone de Voz Profissional

Clones de Voz Profissionais não eram compatíveis com o v3. No Eleven v4, eles voltaram e usam toda a variedade emocional do modelo em todos os idiomas que falam.

Eleven v4 Turbo

Apresentamos o Eleven v4 Turbopara uso em tempo real e agentes

Nosso modelo de voz em tempo real mais rápido, com toda a expressividade do Eleven v4, disponível pela API e pelo ElevenAgents. O Eleven v4 Turbo tem latência mediana de inferência de ~100 ms, tempo até a primeira fala de ~150 ms e mantém a consistência em interações longas.

Tempos de resposta que ninguém percebe

Com tempo mediano de 150 ms até a primeira fala, a latência desaparece e a conversa flui naturalmente.

Eleven v4 Turbo
150 ms101234567891501234567895001234567890 ms
Cartesia Sonic 3.6
262 ms201234567892601234567896201234567892 ms
OpenAI GPT-4o mini TTS
814 ms801234567898101234567891401234567894 ms
Tempo mediano até a primeira fala

Ouça em uma chamada real

Saiba mais sobre o Eleven v4 Turbo com um agente criado com ele.

Otimizado para conversas ao vivo

Transmita texto e receba áudio

Envie o texto conforme seu LLM o gera, e o áudio começa a chegar antes mesmo de a frase terminar. Streaming bidirecional, criado para loops de agentes.

Expressão na velocidade da conversa

O Turbo oferece toda a variedade expressiva do Eleven v4. Confirmações, escalonamentos e pausas soam de forma diferente, em vez de serem lidos da mesma maneira.

Uma voz em todas as interações

Os Clones de Voz Profissionais funcionam de forma idêntica nos dois modelos, mantendo uma única voz de marca consistente do início ao fim da chamada.

Fale como um nativo

Use textos em japonês, espanhol ou português, e a voz os falará com fluência e sotaque nativo.

Escolha entre mais de 17.500 vozes

Vozes para narração Um lugar para quem conta histórias. Vozes acolhedoras, confiáveis e consistentes em todos os projetos.

Vozes conversacionais Para conversas do dia a dia, você precisa de uma voz natural e descontraída. Nossas vozes conversacionais foram criadas para diálogos e podcasts com um tom espontâneo.

Vozes para redes sociais Vozes que ganham vida em conteúdos curtos. Capte a energia e a personalidade necessárias para manter o usuário no seu TikTok ou Reel do começo ao fim.

Vozes de personagens Uma seleção de vozes para seu mundo fictício. Escolha um elenco dinâmico que dá vida ao seu jogo, audiolivro ou animação.

Vozes educacionais Vozes confiáveis e pacientes que orientam estudantes em tópicos complexos. Ideais para cursos, tutoriais, simulações de treinamento e guias de todos os níveis.

Vozes para publicidade Vozes refinadas e cheias de confiança para impulsionar a venda do seu próximo produto. Perfeitas para anúncios digitais, de TV ou rádio.

Vozes para entretenimento De trailers de filmes impactantes a vozes cômicas feitas para interpretação, estas vozes transbordam personalidade. Para conteúdos em que a entrega importa tanto quanto o conteúdo.

Vozes multilíngues Vozes criadas para conteúdo global. Ritmo natural, expressões idiomáticas e sotaques que se conectam com o público em todos os mercados.

Ampliamos a adoção do Agentforce Voice por meio de controle determinístico, e o que ouvimos consistentemente dos clientes é que eles confiam nele porque cada ação de um agente é fundamentada e governada, em vez de improvisada. Uma parte essencial dessa estratégia é equilibrar esse determinismo com modelos de voz de alta qualidade e alta inteligência emocional. É justamente aí que vemos o Eleven v4 Turbo elevar o padrão, com respostas mais rápidas e naturais que atendem ao nível esperado pelos nossos clientes, permitindo levar o Agentforce Voice a ainda mais casos de uso.

Ryan Peterson, SVP de Produto do Agentforce Voice, Salesforce

Ao trabalhar com centenas de editoras para levar seu jornalismo ao áudio, vemos em primeira mão o quanto a qualidade da voz importa. Desde a parceria com a ElevenLabs, muitas editoras tiveram maior engajamento e tempos de escuta mais longos. O Eleven v4 dá às editoras mais formas de garantir que essas vozes sejam envolventes, familiares e inequivocamente próprias.

Patrick O'Flaherty, Cofundador da BeyondWords

O ElevenLabs v4 traz um novo nível de som natural para conversas por voz. As vozes não são apenas mais expressivas, mas também mais controláveis, o que nos permite criar experiências de voz mais ricas e imersivas.

Chrys Bader, Cofundadora e CEO

Na primeira vez que usei o Eleven v4, o som era tão limpo e realista que parecia que eu estava conduzindo uma sessão com um talento no estúdio.

Kyle Gudmundson, Líder de Música e Áudio, Accenture Accelerate

Buscávamos um modelo de voz rápido o bastante para parecer uma conversa real sem abrir mão da qualidade, e o Eleven v4 Turbo é o primeiro a oferecer os dois. Para workflows de vendas automatizados, este é o ponto em que desenvolver deixa de parecer um experimento.

Oscar Daniels, Líder de Produtos de Construção de Crédito, Spring Financial

Escolha como ele soaantes de dizer uma palavra

Toda geração começa com uma voz. Clone uma que você já tem, crie uma a partir de uma descrição ou corrija a pronúncia de palavras específicas com suporte a IPA.

Smiling person in an orange pleated garment and patterned scarf.
Glowing orange sphere with bright curved streaks against a textured orange background.

Clonar Voz com IA

Clone uma voz a partir de dez segundos de áudio ou treine um Clone de Voz Profissional para uma correspondência quase perfeita.

“Uma mulher no fim dos 20 anos, com uma voz clara e conversacional e sotaque americano. Tom simpático, brincalhão e descontraído.”

Criação de Voz

Descreva uma voz em uma frase e gere-a, sem precisar de sessão de gravação ou seleção de elenco.

OAuthou-óth
Hülkenbergrúl-ken-berg
Reykjavikreikiá-vik
YAMLiá-mal

Dicionário de Pronúncia

Defina como nomes, siglas e termos técnicos são pronunciados. Configure a fonética uma vez, e todas as gerações a usarão.

Comece a criar grátisFaça upgrade quando precisar de mais

  • Comece agora

    $ 0/mês

    Comece agora - é grátis

    O plano grátis inclui:

    • 10.000 créditos por mês
    • Uso pessoal
    • Não precisa de cartão de crédito
  • Planos Premium

    $ 6/mês

    Conheça os planos

    Os planos pagos incluem:

    • Mais de 30.000 créditos por mês
    • Clonagem de voz profissional
    • Limites maiores e geração mais rápida
  • Enterprise

    Preço personalizado

    Fale conosco

    O plano Enterprise inclui:

    • Maior volume
    • SSO personalizado
    • Suporte prioritário

Disponível via APILeve o Eleven v4 ao seu app

Crie experiências em tempo real e agentes de voz com o Eleven v4 Turbo, tudo pela ElevenAPI.

Acesse a API do Eleven v4 e do Eleven v4 Turbo

Adicione vozes expressivas a qualquer produto usando nossa API REST, endpoints de streaming ou SDKs para TypeScript e Python.

  • Alterne modelos com um único model_id
  • Envie texto por streaming e receba áudio em tempo real
  • Mantenha a continuidade em gerações longas
import { ElevenLabsClient, play } from '@elevenlabs/elevenlabs-js';
import 'dotenv/config';

const elevenlabs = new ElevenLabsClient({
  apiKey: process.env.ELEVENLABS_API_KEY
});
const audio = await elevenlabs.textToSpeech.convert(
  's3TPKV1kjDlVtZbl4Ksh', // "George" - browse voices at elevenlabs.io/app/voice-library
  {
    text: 'The first move is what sets everything in motion.',
    modelId: 'eleven_v4',
  }
);
play(audio);

Perguntas frequentes

Crie com o áudio de IA da mais alta qualidade