Criação de Voz

Um guia sobre como criar vozes a partir de um prompt de texto.
Criação de voz

Visão geral

A Criação de Voz ajuda criadores a preencher lacunas quando a voz exata que procuram não está disponível na Voice Library. Se você não encontrar uma voz adequada para seu projeto, poderá criar uma. A Criação de Voz é ideal para exploração e iteração rápidas, e a qualidade da saída pode variar dependendo do prompt e do caso de uso. Se você precisa da qualidade mais consistente e pronta para produção, as Clonagens Profissionais de Voz (PVC) atualmente são as vozes de maior qualidade da nossa plataforma. Portanto, se houver uma PVC disponível em nossa biblioteca que atenda às suas necessidades, recomendamos usá-la.

Você pode encontrar a Criação de Voz acessando Vozes -> Minhas vozes -> Criar uma voz -> Criação de Voz no app da ElevenLabs ou pela API.

Ao clicar em gerar, criaremos três opções de voz para você. A única cobrança pelo uso da Criação de Voz é o número de créditos necessários para gerar o texto de prévia, cobrado apenas uma vez, mesmo que geremos três amostras para você. Você pode ver o número de caracteres que será descontado na caixa de texto “Texto para prévia”.

Após gerar, você poderá selecionar e salvar uma das gerações, que ocupará uma das suas vagas de voz.

Guia de prompts

O prompt é a base da sua voz. Ele informa ao modelo que tipo de voz você está tentando criar — desde o sotaque e o tipo de personagem até o gênero e a personalidade da voz. Um prompt bem elaborado pode ser a diferença entre uma voz genérica e uma que realmente se encaixa na sua visão. Em geral, prompts mais descritivos e detalhados tendem a gerar resultados mais precisos e com mais nuances. Quanto mais detalhes você fornecer — incluindo idade, gênero, tom, sotaque, ritmo, emoção, estilo e muito mais — melhor o modelo poderá interpretar e criar uma voz intencional e personalizada.

No entanto, prompts curtos e simples também podem funcionar, especialmente se você busca uma voz mais neutra ou de uso mais amplo. Por exemplo, “Um narrador calmo” pode fornecer exatamente o que você precisa sem entrar em detalhes — principalmente se você não estiver tentando criar um personagem ou estilo muito específico. O nível certo de detalhe depende do seu caso de uso. Você está criando um personagem de fantasia? Um assistente virtual? Uma nova-iorquina cansada, na casa dos 60 anos, com um senso de humor seco? Quanto mais claramente você definir isso no prompt, mais próxima a saída estará do que você imagina.

Formato de prompt recomendado

Para obter resultados consistentes, estruture seu prompt usando este formato:

Native <Language>. <Gender>, <Age range>. <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>

Exemplo:

Native Spanish, español europeo (sin rasgos de español latinoamericano). Female, 35–40. Ok quality. Persona: operadora de suporte confiable. Emotion: reassuring, attentive, confident. Smooth, natural timbre with gentle intonation, forward proximity, and a noise-free signal. Delivers updates at a relaxed pace with clear emphasis on helpful information, projecting empathy and professionalism.

Erros comuns a evitar

  • Não use “sotaque” quando quiser dizer entonação — isso pode causar mudanças indesejadas de dialeto. Em vez disso, descreva padrões de entonação, ênfase ou interpretação.
  • Evite palavras de efeitos sonoros — termos como “reverb”, “echo”, “phone” ou “tape” podem afetar negativamente a qualidade da saída.
  • Seja explícito sobre idioma e dialeto — sempre especifique o idioma e a variante regional na primeira frase para evitar desvios.

Qualidade do áudio

A qualidade do áudio se refere à clareza, limpeza e fidelidade geral da voz gerada. Por padrão, a ElevenLabs busca produzir áudio limpo e com som natural — mas, se o seu projeto exigir um nível específico de qualidade, é melhor incluí-lo explicitamente no prompt.

Para obter resultados de alta qualidade, você pode ajudar o modelo adicionando uma frase como “qualidade de áudio perfeita” ou “gravação com qualidade de estúdio” à descrição da voz. Isso ajuda a garantir que a voz seja gerada com máxima clareza, mínima distorção e um acabamento refinado.

Você também pode usar descritores específicos de qualidade que geram resultados consistentes:

  • Qualidade aceitável
  • Boa qualidade
  • Qualidade muito boa
  • Qualidade excelente
  • Qualidade de estúdio
  • Qualidade de transmissão

Esses descritores ajudam a alcançar a maior qualidade de áudio quando incluídos no prompt.

Incluir esses tipos de frases às vezes pode reduzir a precisão geral do prompt se a voz for muito específica ou de nicho.

Também pode haver casos criativos em que uma qualidade de áudio inferior é intencional, como ao simular uma chamada telefônica, uma transmissão de rádio antiga ou imagens encontradas. Nessas situações, deixe os descritores de qualidade de fora ou inclua explicitamente frases como:

  • “Áudio de baixa fidelidade”
  • “Qualidade de áudio ruim”
  • “Parece uma mensagem de voz”
  • “Abafado e distante, como em um gravador antigo”

A posição dessa frase no prompt é flexível — ela pode aparecer no início ou no fim, e descobrimos que funciona bem em ambos os casos.

Idade, tom/timbre e gênero

Essas três características são a base do design de voz, moldando a identidade geral e a ressonância emocional da voz. Quanto mais detalhes você fornecer, mais fácil será para a IA produzir uma voz que se encaixe na sua visão criativa — seja para criar um personagem convincente, desenvolver um narrador envolvente ou projetar um assistente virtual.

Idade

Descrever a idade percebida da voz ajuda a definir sua maturidade, textura vocal e energia. Use termos específicos para direcionar a IA à qualidade vocal ideal.

Descritores úteis:

  • “Homem adolescente” / “mulher adolescente”
  • “Jovem adulto” / “na faixa dos 20 anos” / “início dos 30 anos”
  • “Homem de meia-idade” / “mulher na faixa dos 40 anos”
  • “Homem idoso” / “mulher mais velha” / “homem na faixa dos 80 anos”

Tom/timbre

Refere-se à qualidade física da voz, moldada pela altura, ressonância e textura vocal. É diferente da interpretação emocional ou da atitude.

Descritores comuns de tom/timbre:

  • “Profundo” / “grave”
  • “Suave” / “rico”
  • “Áspero” / “rouco”
  • “Anasalado” / “estridente”
  • “Arejado” / “soprado”
  • “Potente” / “resonante”
  • “Leve” / “fino”
  • “Quente” / “aveludado”
  • “Metálico” / “metalizado”

Gênero

O gênero geralmente influencia a altura, o peso vocal e a presença tonal — mas você pode ir além de categorias simples descrevendo o som em vez da identidade.

Exemplos:

  • “Uma voz feminina grave e rouca”
  • “Uma voz masculina, profunda e ressonante”
  • “Um gênero neutro — suave e de altura média”

Sotaque

O sotaque tem um papel fundamental na definição da identidade regional, cultural e emocional de uma voz. Se o seu projeto depende de um som autêntico — seja baseado no realismo ou estilizado para um personagem — ser claro e intencional sobre o sotaque desejado é essencial.

A escolha das palavras importa — certos termos tendem a gerar resultados mais consistentes. Por exemplo, “marcante” costuma gerar resultados melhores do que “forte” ao descrever o quanto um sotaque deve ser perceptível. Há bastante tentativa e erro envolvida, e incentivamos você a experimentar a formulação e ser o mais criativo e descritivo possível.

Tenha cuidado ao usar a palavra “sotaque” — se você se refere à entonação ou a padrões de ênfase, e não a um dialeto regional, use esses termos. Usar “sotaque” quando você quer dizer entonação pode provocar mudanças indesejadas de dialeto.

  • Exemplos de prompts claros sobre sotaque:
    • “Um homem de meia-idade com um sotaque francês marcante”
    • “Uma jovem com um leve sotaque do sul dos Estados Unidos”
    • “Um homem idoso com um forte sotaque do leste europeu”
    • “Uma mulher alegre falando com um sotaque britânico nítido”
    • “Um homem mais jovem com uma suave inflexão irlandesa”
    • “Uma voz autoritária com sotaque americano neutro”
    • “Um homem com sotaque regional australiano, descontraído e anasalado”

Evite descritores excessivamente vagos como “estrangeiro” ou “exótico” — eles são imprecisos e podem gerar resultados inconsistentes.

Combine o sotaque com outros traços, como tom, idade ou ritmo, para ter mais controle. Por exemplo: “Uma senhora sarcástica com um sotaque nova-iorquino marcante, falando devagar.”

Para vozes de fantasia ou ficcionais, você pode sugerir sotaques do mundo real como inspiração:

  • “Um elfo com um sotaque britânico marcante e adequado. Ele é régio e lírico.”
  • “Um goblin com um sotaque áspero do leste europeu.”

Ritmo

O ritmo se refere à velocidade e à cadência com que uma voz fala. É um componente essencial para moldar a personalidade, o tom emocional e a clareza da voz. Ser explícito sobre o ritmo é fundamental, especialmente ao criar vozes para casos de uso específicos, como narrativa, publicidade, diálogos de personagens ou conteúdo instrucional.

Use linguagem clara para descrever quão rápido ou devagar a voz deve falar. Você também pode descrever como o ritmo soa — se é constante, irregular, deliberado ou leve. Se o ritmo mudar, indique onde e por quê.

Exemplos de descritores de ritmo:

  • “Falando rapidamente” / “em um ritmo acelerado”
  • “Em um ritmo normal” / “falando normalmente”
  • “Falando devagar” / “com um ritmo lento”
  • “Ritmo deliberado e cadenciado”
  • “Prolongado, como se saboreasse cada palavra”
  • “Com uma cadência apressada, como se estivesse com pressa”
  • “Ritmo descontraído e conversacional”
  • “Rítmico e musical”
  • “Ritmo irregular, com pausas e explosões abruptas”
  • “Ritmo uniforme, com intervalos consistentes entre as palavras”
  • “Interpretação em staccato”

Texto para prévia

Depois de escrever um bom prompt de voz, o texto usado para visualizar essa voz tem um papel crucial na definição de como ela realmente soa. O texto de prévia funciona como um roteiro de interpretação — ele define o tom, o ritmo e a interpretação emocional que a voz tentará reproduzir.

Para obter os melhores resultados, o texto de prévia deve complementar a descrição da voz, e não contradizê-la. Por exemplo, se o prompt descreve uma “voz feminina jovem, calma e reflexiva, com um leve sotaque japonês”, usar uma frase como “Ei! Não aguento o que você fez com esse lugar maldito!!!” entrará em conflito com essa intenção. O modelo tentará conciliar essa incompatibilidade, muitas vezes gerando resultados artificiais ou inconsistentes.

Em vez disso, use um texto de exemplo que reflita a personalidade e o tom emocional pretendidos para a voz. Para o exemplo acima, algo como “Tem estado silencioso ultimamente… Tive tempo para pensar, e talvez fosse disso que eu mais precisava.” reforça o prompt e ajuda a gerar uma voz mais natural e coerente.

Além disso, descobrimos que textos de prévia mais longos tendem a gerar resultados mais estáveis e expressivos. Frases curtas às vezes podem soar abruptas ou inconsistentes, especialmente ao testar qualidades sutis como tom ou ritmo. Dar mais contexto ao modelo — uma frase completa ou até um parágrafo curto — permite que ele produza uma representação mais fluida e precisa da voz.

Parâmetros

Volume

Controla o volume da geração de Texto para prévia e, por fim, da voz depois de salva.

Escala de orientação

Determina o quanto o prompt é seguido. Valores mais altos seguirão o prompt com mais rigor, mas podem resultar em pior qualidade de áudio se o prompt for muito específico, enquanto valores mais baixos permitirão que o modelo seja mais criativo, em detrimento da precisão do prompt. Use um valor menor se a interpretação e a qualidade do áudio forem, em geral, mais importantes do que reproduzir perfeitamente o prompt. Valores altos são recomendados quando a precisão do sotaque ou do tom for extremamente importante.

Atributos e exemplos

Experimente diferentes formas de escrever esses descritores. Por exemplo, “Qualidade de áudio perfeita” também pode ser escrito como “a qualidade do áudio é perfeita”. Às vezes, essas formas podem gerar resultados diferentes!

AtributoExemplos
IdadeJovem, mais jovem, adulto, velho, idoso, na faixa dos 40 anos
SotaqueSotaque escocês “marcante”, sotaque asiático-americano “leve”, sotaque sulista americano
GêneroMasculino, feminino, gênero neutro, gênero ambíguo
Tom/timbre/alturaProfundo, quente, áspero, suave, estridente, aveludado, rouco, anasalado, gutural, duro, robótico, etéreo
RitmoCadência normal, ritmo acelerado, rapidamente, devagar, prolongado, ritmo calmo, ritmo natural/conversacional
Qualidade do áudioQualidade de áudio perfeita, a qualidade do áudio é ‘aceitável’, qualidade de áudio ruim
Personagem / ProfissãoPirata, empresário, fazendeiro, político, terapeuta, ogro, ser divino, locutor de TV
EmoçãoEnergético, animado, triste, emotivo, sarcástico, seco
AlturaGrave, agudo, altura normal

Exemplos de prompts e prévias de texto

Tipo de vozPrompt/DescriçãoPrévia de textoEscala de orientação
Comentarista esportivaUma comentarista esportiva cheia de energia, com forte sotaque britânico, narrando lance a lance uma partida de futebol com muita paixão e em um ritmo muito rápido. Sua voz é vibrante, entusiasmada e totalmente envolvida na ação.MINHA NOSSA — QUE GOLAÇO! Ela pega a bola logo depois do meio-campo, passa por DOIS defensores como se eles nem estivessem ALI e manda COM TUDO no ângulo! O goleiro não teve CHANCE NENHUMA! Isso é nível MUNDIAL da jovem atacante, e a torcida está de PÉ! Esta partida ganhou VIDA, e você consegue SENTIR o ritmo da partida MUDANDO!25%
Sargento instrutorUm sargento instrutor do exército gritando com sua equipe de soldados. Ele parece irritado e fala em ritmo acelerado.ESCUTEM AQUI, seus imprestáveis! Eu não vim aqui para cuidar de criança — vim para FORMAR SOLDADOS! Vocês se movem quando eu mando se mover e respiram quando eu mando respirar! Vocês têm dez segundos para entrar na linha ou vão se arrepender!!25%
Ogro malignoUm enorme ogro maligno falando em ritmo acelerado. Ele tem um tom bobo e ressonante.”Suas armas não passam de palitos de dente para mim. [laughs] Rendam-se agora e talvez eu lhes conceda um fim rápido. Já derrubei reinos e devorei exércitos. Que esperança vocês têm contra mim?“30%
Empreendedor britânico gente boaExcelente qualidade de áudio. Um homem entre 30 e 40 e poucos anos, com forte sotaque britânico, falando em ritmo natural, como se estivesse conversando com um amigo.[laughs] Sabe, é essa a questão. VOCÊ vê uma empresa, enquanto eu vejo… [lip smacks] eu vejo uma promessa, sabe o que quero dizer? [exhales] A gente não constrói só para lucrar; a gente constrói para, para ELEVAR! Se a nossa tecnologia não deixar o mundo mais gentil, inteligente e conectado do que o encontramos… [sighs] então o que estamos fazendo aqui?40%
Mulher sulistaUma mulher mais velha com forte sotaque do sul dos Estados Unidos. Ela é doce e sarcástica.”Bem, querida, se tudo o que fizermos for correr atrás de títulos e troféus, vamos perder o ponto principal. [light chuckle] Eu preferiria criar algo que facilitasse a vida das pessoas — e, se eu puder fazer isso de salto alto, com um sorriso e uma pitada de atrevimento, melhor ainda.”35%
Voz de trailer de filmeVoz dramática, usada para criar expectativa em trailers de filmes, geralmente associada a filmes de ação ou suspense”Em um mundo à beira do caos, um herói surgirá. Prepare-se para uma história de proporções épicas, em breve nas telonas.”20%
Rato estridenteUm ratinho fofo e estridente”Posso ser pequeno, mas minha atitude não é nem um pouco pequena! [giggles] Cuidado, pezões, ou vou dar uma mordidinha nos seus dedos que você não vai esquecer!“20%
Pirata furiosoUm pirata velho, furioso, barulhento e espalhafatoso”Já enfrentei tempestades que deixariam seus cabelos brancos e monstros marinhos que fariam seus joelhos tremerem. Você acha que pode cruzar o caminho do Capitão Coração Negro e viver para contar a história?“30%
Nova-iorquinoSotaque forte de Nova York, grave e rouco, durão e calejado pela vida, geralmente cínico”Caminho por estas ruas há mais tempo do que você pode imaginar, garoto. Não há nada que você possa dizer ou fazer que ainda vá me surpreender.”40%
Agente de suporte em espanholEspanhol nativo, espanhol europeu (sem traços de espanhol latino-americano). Mulher, 35–40 anos. Qualidade razoável. Persona: operadora de suporte confiável. Emoção: tranquilizadora, atenciosa, confiante.Timbre suave e natural, com entonação delicada, proximidade de microfone e sinal sem ruídos. Transmite atualizações em ritmo tranquilo, enfatizando com clareza as informações úteis e projetando empatia e profissionalismo.30%
Atendimento ao cliente em árabeÁrabe nativo, com leve influência de sotaque do Golfo (EAU). Mulher, 30–40 anos. Excelente qualidade. Persona: agente profissional de atendimento ao cliente. Emoção: calorosa, confiante, educada.Timbre aveludado, com tom calmo, ritmo cadenciado e entonação suave, mantendo proximidade com o microfone para um sinal de alta fidelidade e livre de artefatos. Presença clara e ênfase delicada em frases voltadas ao cliente para garantir fácil compreensão.35%
Narrador criativo polonêsPolonês nativo. Homem, 48–58 anos. Excelente qualidade. Persona: sonhador criativo. Emoção: curioso, gentil, convidativo.A voz é suave e livre de artefatos, com uma textura acolhedora e envolvente e ritmo constante, transmitida com proximidade natural. Entonação brilhante e ênfase precisa guiam o ouvinte pela narrativa.32%
Cientista malucoVoz de um gênio científico excêntrico, com padrões de fala rápidos e erráticos que aceleram com a empolgação. Seu sotaque com traços alemães fica mais pronunciado quando ele se agita. O tom varia muito, de murmúrios contemplativos a exclamações maníacas, com frequentes explosões de risadas insanas.”Eu sou o doutor Heinrich, gênio revolucionário rejeitado pelo limitado establishment científico! Bah! Chamaram minhas teorias de impossíveis, meus métodos de antiéticos — mas quem está rindo agora? (risada maníaca) Por vinte anos, aperfeiçoei minha criação neste laboratório na montanha, dominando energias além da compreensão mortal! Os tolos da academia vão se arrepender de suas zombarias quando meu desestabilizador quântico revelar o multiverso. Ou talvez novas formas de vida… o experimento tem certas variáveis imprevisíveis… FASCINANTES!“38%

Perguntas frequentes

O Design de Voz permite criar uma voz única a partir de um prompt de texto.

Ele foi criado para ajudar quando você não encontra exatamente a voz de que precisa na nossa Voice Library. Em vez de escolher entre opções existentes, agora você pode gerar uma voz personalizada descrevendo-a com suas próprias palavras.

Para começar, basta digitar um prompt descrevendo a voz que você deseja. Você pode incluir detalhes como sotaque, gênero, ritmo, tom e estilo de fala. Quanto mais específico for seu prompt, mais a voz corresponderá à sua intenção. Mas, se não tiver certeza, um prompt simples como “um narrador masculino calmo” também funciona.

As vozes criadas com o Design de Voz funcionam com o Eleven v4, nosso modelo mais recente, e com modelos anteriores, incluindo o Eleven v3. Elas oferecem suporte a tags de áudio. No Eleven v4, podem ser menos expressivas do que nos modelos anteriores.

Para mais dicas sobre como escrever prompts eficazes, consulte nosso guia de Design de Voz.

Observação: o Design de Voz ainda é experimental. Os Clones de Voz Profissionais oferecem a maior qualidade e consistência. Se você encontrar um PVC que atenda às suas necessidades, recomendamos usá-lo. Os Clones de Voz Profissionais têm suporte completo no Eleven v4. Eles não são totalmente otimizados para o Eleven v3.

O Design de Voz pode gerar uma ampla variedade de vozes, desde vozes realistas e humanas até vozes mais criativas, no estilo de personagens.

Se você não sabe por onde começar, experimente um prompt simples como “locutora de telejornal de meia-idade”. No entanto, prompts mais detalhados geralmente produzem resultados mais precisos e detalhados.

Você pode incluir diversas características no seu prompt, como:

  • idade
  • gênero
  • sotaque
  • tom
  • ritmo
  • emoção
  • estilo de fala
  • qualidade do áudio

Dois controles adicionais ajudam a definir o resultado:

  • Volume ajusta o volume tanto da prévia quanto da voz salva.
  • Escala de orientação determina o quanto a voz gerada segue seu prompt.

Para mais ajuda na criação de prompts, consulte nosso guia de Design de Voz.

O Design de Voz só consome créditos quando você gera vozes.

Sempre que você clica em Gerar voz, criamos três opções de voz com base no seu prompt. A cobrança é feita com base no número de caracteres do texto de prévia.

Você pode inserir seu próprio texto de prévia ou usar o botão Gerar automaticamente para criar um. As prévias geradas automaticamente incluem tags de áudio relevantes.

Para mais informações, consulte nosso guia de Design de Voz.

No results