Criação de Voz
Criação de Voz
Visão geral
A Criação de Voz ajuda criadores a preencher lacunas quando a voz exata que procuram não está disponível na Voice Library. Se você não encontrar uma voz adequada para seu projeto, poderá criar uma. A Criação de Voz é ideal para exploração e iteração rápidas, e a qualidade da saída pode variar dependendo do prompt e do caso de uso. Se você precisa da qualidade mais consistente e pronta para produção, as Clonagens Profissionais de Voz (PVC) atualmente são as vozes de maior qualidade da nossa plataforma. Portanto, se houver uma PVC disponível em nossa biblioteca que atenda às suas necessidades, recomendamos usá-la.
Você pode encontrar a Criação de Voz acessando Vozes -> Minhas vozes -> Criar uma voz -> Criação de Voz no app da ElevenLabs ou pela API.
Ao clicar em gerar, criaremos três opções de voz para você. A única cobrança pelo uso da Criação de Voz é o número de créditos necessários para gerar o texto de prévia, cobrado apenas uma vez, mesmo que geremos três amostras para você. Você pode ver o número de caracteres que será descontado na caixa de texto “Texto para prévia”.
Após gerar, você poderá selecionar e salvar uma das gerações, que ocupará uma das suas vagas de voz.
Guia de prompts
O prompt é a base da sua voz. Ele informa ao modelo que tipo de voz você está tentando criar — desde o sotaque e o tipo de personagem até o gênero e a personalidade da voz. Um prompt bem elaborado pode ser a diferença entre uma voz genérica e uma que realmente se encaixa na sua visão. Em geral, prompts mais descritivos e detalhados tendem a gerar resultados mais precisos e com mais nuances. Quanto mais detalhes você fornecer — incluindo idade, gênero, tom, sotaque, ritmo, emoção, estilo e muito mais — melhor o modelo poderá interpretar e criar uma voz intencional e personalizada.
No entanto, prompts curtos e simples também podem funcionar, especialmente se você busca uma voz mais neutra ou de uso mais amplo. Por exemplo, “Um narrador calmo” pode fornecer exatamente o que você precisa sem entrar em detalhes — principalmente se você não estiver tentando criar um personagem ou estilo muito específico. O nível certo de detalhe depende do seu caso de uso. Você está criando um personagem de fantasia? Um assistente virtual? Uma nova-iorquina cansada, na casa dos 60 anos, com um senso de humor seco? Quanto mais claramente você definir isso no prompt, mais próxima a saída estará do que você imagina.
Formato de prompt recomendado
Para obter resultados consistentes, estruture seu prompt usando este formato:
Exemplo:
Native Spanish, español europeo (sin rasgos de español latinoamericano). Female, 35–40. Ok quality. Persona: operadora de suporte confiable. Emotion: reassuring, attentive, confident. Smooth, natural timbre with gentle intonation, forward proximity, and a noise-free signal. Delivers updates at a relaxed pace with clear emphasis on helpful information, projecting empathy and professionalism.
Erros comuns a evitar
- Não use “sotaque” quando quiser dizer entonação — isso pode causar mudanças indesejadas de dialeto. Em vez disso, descreva padrões de entonação, ênfase ou interpretação.
- Evite palavras de efeitos sonoros — termos como “reverb”, “echo”, “phone” ou “tape” podem afetar negativamente a qualidade da saída.
- Seja explícito sobre idioma e dialeto — sempre especifique o idioma e a variante regional na primeira frase para evitar desvios.
Qualidade do áudio
A qualidade do áudio se refere à clareza, limpeza e fidelidade geral da voz gerada. Por padrão, a ElevenLabs busca produzir áudio limpo e com som natural — mas, se o seu projeto exigir um nível específico de qualidade, é melhor incluí-lo explicitamente no prompt.
Para obter resultados de alta qualidade, você pode ajudar o modelo adicionando uma frase como “qualidade de áudio perfeita” ou “gravação com qualidade de estúdio” à descrição da voz. Isso ajuda a garantir que a voz seja gerada com máxima clareza, mínima distorção e um acabamento refinado.
Você também pode usar descritores específicos de qualidade que geram resultados consistentes:
- Qualidade aceitável
- Boa qualidade
- Qualidade muito boa
- Qualidade excelente
- Qualidade de estúdio
- Qualidade de transmissão
Esses descritores ajudam a alcançar a maior qualidade de áudio quando incluídos no prompt.
Incluir esses tipos de frases às vezes pode reduzir a precisão geral do prompt se a voz for muito específica ou de nicho.
Também pode haver casos criativos em que uma qualidade de áudio inferior é intencional, como ao simular uma chamada telefônica, uma transmissão de rádio antiga ou imagens encontradas. Nessas situações, deixe os descritores de qualidade de fora ou inclua explicitamente frases como:
- “Áudio de baixa fidelidade”
- “Qualidade de áudio ruim”
- “Parece uma mensagem de voz”
- “Abafado e distante, como em um gravador antigo”
A posição dessa frase no prompt é flexível — ela pode aparecer no início ou no fim, e descobrimos que funciona bem em ambos os casos.
Idade, tom/timbre e gênero
Essas três características são a base do design de voz, moldando a identidade geral e a ressonância emocional da voz. Quanto mais detalhes você fornecer, mais fácil será para a IA produzir uma voz que se encaixe na sua visão criativa — seja para criar um personagem convincente, desenvolver um narrador envolvente ou projetar um assistente virtual.
Idade
Descrever a idade percebida da voz ajuda a definir sua maturidade, textura vocal e energia. Use termos específicos para direcionar a IA à qualidade vocal ideal.
Descritores úteis:
- “Homem adolescente” / “mulher adolescente”
- “Jovem adulto” / “na faixa dos 20 anos” / “início dos 30 anos”
- “Homem de meia-idade” / “mulher na faixa dos 40 anos”
- “Homem idoso” / “mulher mais velha” / “homem na faixa dos 80 anos”
Tom/timbre
Refere-se à qualidade física da voz, moldada pela altura, ressonância e textura vocal. É diferente da interpretação emocional ou da atitude.
Descritores comuns de tom/timbre:
- “Profundo” / “grave”
- “Suave” / “rico”
- “Áspero” / “rouco”
- “Anasalado” / “estridente”
- “Arejado” / “soprado”
- “Potente” / “resonante”
- “Leve” / “fino”
- “Quente” / “aveludado”
- “Metálico” / “metalizado”
Gênero
O gênero geralmente influencia a altura, o peso vocal e a presença tonal — mas você pode ir além de categorias simples descrevendo o som em vez da identidade.
Exemplos:
- “Uma voz feminina grave e rouca”
- “Uma voz masculina, profunda e ressonante”
- “Um gênero neutro — suave e de altura média”
Sotaque
O sotaque tem um papel fundamental na definição da identidade regional, cultural e emocional de uma voz. Se o seu projeto depende de um som autêntico — seja baseado no realismo ou estilizado para um personagem — ser claro e intencional sobre o sotaque desejado é essencial.
A escolha das palavras importa — certos termos tendem a gerar resultados mais consistentes. Por exemplo, “marcante” costuma gerar resultados melhores do que “forte” ao descrever o quanto um sotaque deve ser perceptível. Há bastante tentativa e erro envolvida, e incentivamos você a experimentar a formulação e ser o mais criativo e descritivo possível.
Tenha cuidado ao usar a palavra “sotaque” — se você se refere à entonação ou a padrões de ênfase, e não a um dialeto regional, use esses termos. Usar “sotaque” quando você quer dizer entonação pode provocar mudanças indesejadas de dialeto.
- Exemplos de prompts claros sobre sotaque:
- “Um homem de meia-idade com um sotaque francês marcante”
- “Uma jovem com um leve sotaque do sul dos Estados Unidos”
- “Um homem idoso com um forte sotaque do leste europeu”
- “Uma mulher alegre falando com um sotaque britânico nítido”
- “Um homem mais jovem com uma suave inflexão irlandesa”
- “Uma voz autoritária com sotaque americano neutro”
- “Um homem com sotaque regional australiano, descontraído e anasalado”
Evite descritores excessivamente vagos como “estrangeiro” ou “exótico” — eles são imprecisos e podem gerar resultados inconsistentes.
Combine o sotaque com outros traços, como tom, idade ou ritmo, para ter mais controle. Por exemplo: “Uma senhora sarcástica com um sotaque nova-iorquino marcante, falando devagar.”
Para vozes de fantasia ou ficcionais, você pode sugerir sotaques do mundo real como inspiração:
- “Um elfo com um sotaque britânico marcante e adequado. Ele é régio e lírico.”
- “Um goblin com um sotaque áspero do leste europeu.”
Ritmo
O ritmo se refere à velocidade e à cadência com que uma voz fala. É um componente essencial para moldar a personalidade, o tom emocional e a clareza da voz. Ser explícito sobre o ritmo é fundamental, especialmente ao criar vozes para casos de uso específicos, como narrativa, publicidade, diálogos de personagens ou conteúdo instrucional.
Use linguagem clara para descrever quão rápido ou devagar a voz deve falar. Você também pode descrever como o ritmo soa — se é constante, irregular, deliberado ou leve. Se o ritmo mudar, indique onde e por quê.
Exemplos de descritores de ritmo:
- “Falando rapidamente” / “em um ritmo acelerado”
- “Em um ritmo normal” / “falando normalmente”
- “Falando devagar” / “com um ritmo lento”
- “Ritmo deliberado e cadenciado”
- “Prolongado, como se saboreasse cada palavra”
- “Com uma cadência apressada, como se estivesse com pressa”
- “Ritmo descontraído e conversacional”
- “Rítmico e musical”
- “Ritmo irregular, com pausas e explosões abruptas”
- “Ritmo uniforme, com intervalos consistentes entre as palavras”
- “Interpretação em staccato”
Texto para prévia
Depois de escrever um bom prompt de voz, o texto usado para visualizar essa voz tem um papel crucial na definição de como ela realmente soa. O texto de prévia funciona como um roteiro de interpretação — ele define o tom, o ritmo e a interpretação emocional que a voz tentará reproduzir.
Para obter os melhores resultados, o texto de prévia deve complementar a descrição da voz, e não contradizê-la. Por exemplo, se o prompt descreve uma “voz feminina jovem, calma e reflexiva, com um leve sotaque japonês”, usar uma frase como “Ei! Não aguento o que você fez com esse lugar maldito!!!” entrará em conflito com essa intenção. O modelo tentará conciliar essa incompatibilidade, muitas vezes gerando resultados artificiais ou inconsistentes.
Em vez disso, use um texto de exemplo que reflita a personalidade e o tom emocional pretendidos para a voz. Para o exemplo acima, algo como “Tem estado silencioso ultimamente… Tive tempo para pensar, e talvez fosse disso que eu mais precisava.” reforça o prompt e ajuda a gerar uma voz mais natural e coerente.
Além disso, descobrimos que textos de prévia mais longos tendem a gerar resultados mais estáveis e expressivos. Frases curtas às vezes podem soar abruptas ou inconsistentes, especialmente ao testar qualidades sutis como tom ou ritmo. Dar mais contexto ao modelo — uma frase completa ou até um parágrafo curto — permite que ele produza uma representação mais fluida e precisa da voz.
Parâmetros
Volume
Controla o volume da geração de Texto para prévia e, por fim, da voz depois de salva.
Escala de orientação
Determina o quanto o prompt é seguido. Valores mais altos seguirão o prompt com mais rigor, mas podem resultar em pior qualidade de áudio se o prompt for muito específico, enquanto valores mais baixos permitirão que o modelo seja mais criativo, em detrimento da precisão do prompt. Use um valor menor se a interpretação e a qualidade do áudio forem, em geral, mais importantes do que reproduzir perfeitamente o prompt. Valores altos são recomendados quando a precisão do sotaque ou do tom for extremamente importante.
Atributos e exemplos
Experimente diferentes formas de escrever esses descritores. Por exemplo, “Qualidade de áudio perfeita” também pode ser escrito como “a qualidade do áudio é perfeita”. Às vezes, essas formas podem gerar resultados diferentes!