テキストtoダイアログ クイックスタート

テキストから没入感のある対話を生成する方法を学びます。

このガイドでは、テキストtoダイアログAPIを使用して、テキストから没入感があり自然に聞こえる対話を生成する方法を説明します。

安定した生成のため、リクエストごとのすべてのinputs[].text値の合計文字数は 2,000文字以下にしてください。長いスクリプトはチャンクに分割し、クライアント側でオーディオを結合してください。

テキストtoダイアログAPIを使用する

1

APIキーを作成する

ダッシュボードでAPIキーを作成し、安全にAPIへアクセスするために使用します。

キーは管理されたシークレットとして保存し、好みに応じて.envファイルによる環境変数として、またはアプリの設定で直接SDKに渡してください。

.env
ELEVENLABS_API_KEY=<your_api_key_here>
2

SDKをインストールする

dotenvライブラリも使用して、環境変数からAPIキーを読み込みます。

pip install elevenlabs
pip install python-dotenv
3

APIリクエストを送信する

使用する言語に応じて、example.pyまたはexample.mtsという新しいファイルを作成し、次のコードを追加します。 各text値にオーディオタグを追加して、その話者の話し方を指定します。voice_idは、 同じ入力項目の話者の音声を選択します。

# example.py
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
from elevenlabs.play import play
load_dotenv()
elevenlabs = ElevenLabs(
api_key=os.getenv("ELEVENLABS_API_KEY"),
)
audio = elevenlabs.text_to_dialogue.convert(
inputs=[
{
"text": "[cheerfully] Hello, how are you?",
"voice_id": "9BWtsMINqrJLrRacOk9x",
},
{
"text": "[stuttering] I'm... I'm doing well, thank you.",
"voice_id": "IKne3meq5aSn9XLyUdCD",
}
]
)
play(audio)

次に実行します。

python example.py

対話のオーディオが再生されます。

WebSocketストリーミング

Eleven v3モデルで長時間接続を介して対話を段階的に生成するには、リアルタイム テキストtoダイアログを参照してください。このWebSocketと標準TTS WebSocketを比較するには、テキスト読み上げとテキストtoダイアログのWebSocketの比較を参照してください。

次のステップ