Texto para diálogos
Texto para diálogos
Saiba como criar diálogos imersivos e naturais com a ElevenLabs.
Visão geral
A API Text to Dialogue da ElevenLabs cria diálogos naturais e expressivos a partir de texto usando o Eleven v4 e o Eleven v3. Recomendamos o Eleven v4. Casos de uso populares incluem:
- Gerar conversas perfeitas para videogames
- Criar diálogos imersivos para podcasts e outros conteúdos de áudio
- Dar vida a audiolivros com narração expressiva
Talvez sejam necessárias várias gerações para alcançar os resultados desejados. Ao integrar o Text to Dialogue ao seu aplicativo, considere gerar várias opções e permitir que o usuário selecione a melhor.
Ouça um exemplo:
Opções de voz
A ElevenLabs oferece milhares de vozes por meio de diversos métodos de criação. O Eleven v4 oferece suporte a mais de 90 idiomas, e o Eleven v3, a mais de 70 idiomas.
- Voice Library com mais de 3.000 vozes compartilhadas pela comunidade
- Clonagem profissional de voz para réplicas com a mais alta fidelidade
- Clonagem instantânea de voz para replicar vozes rapidamente
- Design de voz para gerar vozes personalizadas a partir de descrições em texto
Saiba mais sobre nossas opções de voz.
Prompting
Os modelos interpretam o contexto emocional diretamente da entrada de texto. Por exemplo, adicionar texto descritivo como “ela disse animada” ou usar pontos de exclamação influencia a emoção da fala. Configurações de voz como Estabilidade e Similaridade ajudam a controlar a consistência, enquanto a emoção subjacente vem de pistas textuais.
Leia o guia de prompting para mais detalhes.
Entonações emocionais com tags de áudio
O Eleven v4 e o Eleven v3 permitem usar eventos de áudio não relacionados à fala para influenciar a entonação do diálogo. Isso é feito inserindo os eventos de áudio na entrada de texto entre colchetes.
No Text to Dialogue, cada turno do diálogo tem seu próprio texto e voz. Adicione tags de áudio dentro do texto do turno que elas devem afetar. O voice_id continua selecionando a voz do falante naquele turno, enquanto as tags orientam a entonação.
Por exemplo, um falante pode usar uma voz enquanto o texto começa com [giggling], e o próximo falante pode usar uma voz diferente enquanto o texto começa com [whispering]. Para ver um exemplo de API que combina tags com voice_id, consulte o guia de início rápido do Text to Dialogue.
As tags de áudio são instruções em linguagem natural, não um parâmetro de enum. Coloque a instrução entre colchetes e insira-a no texto onde a entonação deve mudar. Os exemplos abaixo não são completos; use o guia de prompting para mais orientações sobre tags eficazes.
As tags de áudio têm algumas formas diferentes:
Emoções e entonação
Por exemplo, [sad], [laughing] e [whispering]
Eventos de áudio
Por exemplo, [leaves rustling], [gentle footsteps] e [applause].
Direção geral
Por exemplo, [football], [wrestling match] e [auctioneer].
Alguns exemplos incluem:
Você também pode usar pontuação para indicar o fluxo do diálogo, como interrupções:
Reticências podem ser usadas para indicar frases inacabadas:
Formatos de saída compatíveis
O formato de resposta padrão é mp3, mas outros formatos, como pcm e ulaw, estão disponíveis.
- MP3
- Taxas de amostragem: 22.05kHz - 44.1kHz
- Taxas de bits: 32kbps - 192kbps
- 22.05kHz @ 32kbps
- 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
- PCM (S16LE)
- Taxas de amostragem: 16kHz - 44.1kHz
- Taxas de bits: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
- Profundidade de 16 bits
- μ-law
- Taxa de amostragem de 8kHz
- Otimizado para aplicações de telefonia
- A-law
- Taxa de amostragem de 8kHz
- Otimizado para aplicações de telefonia
- Opus
- Taxa de amostragem: 48kHz
- Taxas de bits: 32kbps - 192kbps
Opções de áudio de maior qualidade estão disponíveis apenas nos planos pagos — consulte nossa página de preços para mais detalhes.
Idiomas compatíveis
O Eleven v4 oferece suporte a mais de 90 idiomas. O Eleven v3 oferece suporte a mais de 70 idiomas. Consulte Eleven v4 e Eleven v3 para ver as listas completas.
Perguntas frequentes
Quais modelos posso usar?
O Text to Dialogue está disponível nos modelos Eleven v4 e Eleven v3.
Sou proprietário do áudio gerado?
Sim. Você mantém a propriedade de qualquer áudio que gerar. No entanto, os direitos de uso comercial estão disponíveis apenas em planos pagos. Com uma assinatura paga, você pode usar o áudio gerado para fins comerciais e monetizar os resultados se possuir os direitos de propriedade intelectual do conteúdo de entrada.
O que se qualifica como uma regeneração gratuita?
Uma regeneração gratuita permite gerar novamente o mesmo conteúdo de conversão de texto em fala sem custo adicional, sujeita às seguintes condições:
- Disponível apenas no painel da ElevenLabs.
- Você pode gerar novamente cada conteúdo até 2 vezes gratuitamente.
- O conteúdo deve ser exatamente o mesmo da geração anterior. Qualquer alteração no texto, nas configurações de voz ou em outros parâmetros exigirá uma nova geração paga.
As regenerações gratuitas são úteis caso haja uma leve distorção no áudio gerado. De acordo com os benchmarks internos da ElevenLabs, as regenerações resolvem cerca de metade dos problemas de qualidade, e os problemas restantes geralmente são causados por dados de treinamento de baixa qualidade.
Quantos falantes meu diálogo pode ter?
Não há limite para o número de falantes em um diálogo.
Por que minha saída às vezes é inconsistente?
Os modelos são não determinísticos. Para obter consistência, use o parâmetro seed opcional, embora diferenças sutis ainda possam ocorrer.
Qual é a prática recomendada para conversões de textos longos?
Mantenha o comprimento total de todos os valores de inputs[].text em até 2.000 caracteres por solicitação para uma geração confiável. Divida textos mais longos em partes e concatene o áudio resultante no seu aplicativo.
Informações principais
- Modelos: Disponível com Eleven v4 e Eleven v3
- Falantes: Sem limite de falantes por diálogo
- Tamanho da solicitação: Mantenha o comprimento total de todos os valores de
inputs[].textem até 2.000 caracteres por solicitação - Determinismo: A saída é não determinística — use o parâmetro
seedpara resultados mais consistentes - Regenerações gratuitas: Até 2 regenerações gratuitas por geração (mesmo conteúdo, mesmos parâmetros, somente no painel)
- Propriedade: Você mantém a propriedade do áudio gerado; o uso comercial exige um plano pago