Início rápido do Text to Dialogue

Saiba como gerar diálogos imersivos a partir de texto.

Este guia mostra como gerar diálogos imersivos e naturais a partir de texto usando a API de Text to Dialogue.

Mantenha o tamanho total de todos os valores de inputs[].text em até 2.000 caracteres por solicitação para uma geração confiável. Divida roteiros mais longos em partes e una o áudio no lado do cliente.

Como usar a API de Text to Dialogue

1

Criar uma chave de API

Crie uma chave de API no painel aqui, que você usará para acessar a API com segurança.

Armazene a chave como um segredo gerenciado e passe-a aos SDKs como uma variável de ambiente por meio de um arquivo .env ou diretamente na configuração do seu app, conforme sua preferência.

.env
ELEVENLABS_API_KEY=<your_api_key_here>
2

Instalar o SDK

Também usaremos a biblioteca dotenv para carregar nossa chave de API de uma variável de ambiente.

pip install elevenlabs
pip install python-dotenv
3

Fazer a solicitação à API

Crie um novo arquivo chamado example.py ou example.mts, dependendo da linguagem escolhida, e adicione o código a seguir. Adicione tags de áudio a cada valor de text para orientar a interpretação daquele locutor. O voice_id seleciona a voz do locutor para o mesmo item de entrada.

# example.py
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
from elevenlabs.play import play
load_dotenv()
elevenlabs = ElevenLabs(
api_key=os.getenv("ELEVENLABS_API_KEY"),
)
audio = elevenlabs.text_to_dialogue.convert(
inputs=[
{
"text": "[cheerfully] Hello, how are you?",
"voice_id": "9BWtsMINqrJLrRacOk9x",
},
{
"text": "[stuttering] I'm... I'm doing well, thank you.",
"voice_id": "IKne3meq5aSn9XLyUdCD",
}
]
)
play(audio)

Em seguida, execute:

python example.py

Você deve ouvir o áudio do diálogo sendo reproduzido.

Streaming com WebSocket

Para diálogos incrementais em uma conexão de longa duração com modelos Eleven v3, siga Text to Dialogue em tempo real. Para comparar este WebSocket com o WebSocket TTS padrão, consulte WebSockets de Text to Speech vs Text to Dialogue.

Próximas etapas