テキストto対話

ElevenLabsで没入感があり自然に聞こえる対話を作成する方法をご紹介します。

概要

Eleven v3モデルを使用するElevenLabsのテキストtoダイアログAPIは、テキストから自然で表現力豊かな対話を生成します。主なユースケースは次のとおりです。

  • ビデオゲーム向けに完璧な会話を生成
  • ポッドキャストやその他のオーディオコンテンツ向けに没入感のある対話を作成
  • 表現力豊かなナレーションでオーディオブックに命を吹き込む

目的の結果を得るには、複数回の生成が必要になる場合があります。テキストtoダイアログをアプリケーションに統合する際は、複数の候補を生成し、ユーザーが最適なものを選べるようにすることを検討してください。

サンプルを聞く:

音声の選択肢

ElevenLabsでは、複数の作成方法により、70以上の言語で数千種類の音声を提供しています。

詳しくは、音声の選択肢をご覧ください。

プロンプト

モデルは、テキスト入力から感情的な文脈を直接解釈します。たとえば、 「彼女は興奮して言った」のような説明文を加えたり、感嘆符を使ったりすると、発話の 感情に影響します。StabilityやSimilarityなどの音声設定は一貫性の制御に役立ちますが、 根底にある感情はテキスト上の手がかりから生まれます。

詳しくは、プロンプトガイドをご覧ください。

オーディオタグによる感情表現

この機能は現在も積極的に開発中であり、実際の結果は異なる場合があります。

Eleven v3モデルでは、非音声のオーディオイベントを使用して対話の話し方に影響を与えられます。テキスト入力内で、オーディオイベントを角括弧で囲んで挿入します。

テキストtoダイアログでは、各対話ターンにそれぞれ固有のテキストと音声があります。影響させたいターンのテキスト内にオーディオタグを追加してください。voice_idは引き続きそのターンの話者音声を選択し、タグは話し方をガイドします。

たとえば、ある話者はテキストを[giggling]で始めながら1つの音声を使用し、次の話者はテキストを[whispering]で始めながら別の音声を使用できます。タグとvoice_idを組み合わせるAPIの例については、テキストtoダイアログのクイックスタートをご覧ください。

オーディオタグはenumパラメータではなく、自然言語による指示です。指示を角括弧で囲み、話し方を変えたい位置のテキストに配置します。以下の例がすべてではありません。効果的なタグについての詳しいガイダンスは、Eleven v3プロンプトガイドをご覧ください。

オーディオタグにはいくつかの形式があります。

感情と話し方

例:[sad]、[laughing]、[whispering]

オーディオイベント

例:[leaves rustling]、[gentle footsteps]、[applause]。

全体的な演出

例:[football]、[wrestling match]、[auctioneer]。

例:

"[giggling] That's really funny!"
"[groaning] That was awful."
"Well, [sigh] I'm not sure what to say."

中断など、対話の流れを示すために句読点を使うこともできます。

"[cautiously] Hello, is this seat-"
"[jumping in] Free? [cheerfully] Yes it is."

文が途切れることを示すには、省略記号を使用できます。

"[indecisive] Hi, can I get uhhh..."
"[quizzically] The usual?"
"[elated] Yes! [laughs] I'm so glad you knew!"

デフォルトのレスポンス形式はmp3ですが、pcmやulawなどの形式も利用できます。

  • MP3
    • サンプルレート:22.05kHz~44.1kHz
    • ビットレート:32kbps~192kbps
    • 22.05kHz @ 32kbps
    • 44.1kHz @ 32kbps、64kbps、96kbps、128kbps、192kbps
  • PCM(S16LE)
    • サンプルレート:16kHz~44.1kHz
    • ビットレート:8kHz、16kHz、22.05kHz、24kHz、44.1kHz、48kHz
    • 16ビット深度
  • μ-law
    • 8kHzサンプルレート
    • 電話アプリケーション向けに最適化
  • A-law
    • 8kHzサンプルレート
    • 電話アプリケーション向けに最適化
  • Opus
    • サンプルレート:48kHz
    • ビットレート:32kbps~192kbps

高品質なオーディオオプションは有料プランでのみ利用できます。詳しくは料金 ページをご覧ください。

対応言語

Eleven v3モデルは、以下を含む70以上の言語に対応しています。

アフリカーンス語(afr)、アラビア語(ara)、アルメニア語(hye)、アッサム語(asm)、アゼルバイジャン語(aze)、ベラルーシ語(bel)、ベンガル語(ben)、ボスニア語(bos)、ブルガリア語(bul)、カタロニア語(cat)、セブアノ語(ceb)、チェワ語(nya)、クロアチア語(hrv)、チェコ語(ces)、デンマーク語(dan)、オランダ語(nld)、英語(eng)、エストニア語(est)、フィリピノ語(fil)、フィンランド語(fin)、フランス語(fra)、ガリシア語(glg)、ジョージア語(kat)、ドイツ語(deu)、ギリシャ語(ell)、グジャラート語(guj)、ハウサ語(hau)、ヘブライ語(heb)、ヒンディー語(hin)、ハンガリー語(hun)、アイスランド語(isl)、インドネシア語(ind)、アイルランド語(gle)、イタリア語(ita)、日本語(jpn)、ジャワ語(jav)、カンナダ語(kan)、カザフ語(kaz)、キルギス語(kir)、韓国語(kor)、ラトビア語(lav)、リンガラ語(lin)、リトアニア語(lit)、ルクセンブルク語(ltz)、マケドニア語(mkd)、マレー語(msa)、マラヤーラム語(mal)、中国語(標準語)(cmn)、マラーティー語(mar)、ネパール語(nep)、ノルウェー語(nor)、パシュトー語(pus)、ペルシア語(fas)、ポーランド語(pol)、ポルトガル語(por)、パンジャブ語(pan)、ルーマニア語(ron)、ロシア語(rus)、セルビア語(srp)、シンド語(snd)、スロバキア語(slk)、スロベニア語(slv)、ソマリ語(som)、スペイン語(spa)、スワヒリ語(swa)、スウェーデン語(swe)、タミル語(tam)、テルグ語(tel)、タイ語(tha)、トルコ語(tur)、ウクライナ語(ukr)、ウルドゥー語(urd)、ベトナム語(vie)、ウェールズ語(cym)。

よくある質問

テキストtoダイアログはEleven v3モデルでのみ利用できます。

はい。生成したオーディオの所有権は保持されます。ただし、商用利用権は有料プランでのみ 利用できます。有料サブスクリプションでは、入力コンテンツのIP権利を所有している場合、生成したオーディオを商用利用し、 出力を収益化できます。

以下の条件を満たす場合、追加費用なしで同じテキスト読み上げコンテンツを再生成できます。

  • ElevenLabsダッシュボード内でのみ利用できます。
  • 各コンテンツは最大2回まで無料で再生成できます。
  • コンテンツは前回の生成と完全に同一でなければなりません。テキスト、音声設定、その他のパラメータを変更すると、新たな有料生成が必要になります。

無料再生成は、オーディオ出力にわずかな歪みがある場合に便利です。ElevenLabsの社内ベンチマークによると、再生成により品質上の問題のおよそ半分は解決され、残りの問題は通常、トレーニングデータの品質不足に起因します。

対話内の話者数に制限はありません。

モデルは非決定的です。一貫性を高めるには、任意のseed パラメータを使用してください。ただし、わずかな 差異が生じる場合があります。

安定した生成のため、1リクエストあたりのすべてのinputs[].text値の合計文字数は2,000文字以下にしてください。長いテキストはチャンクに分割し、生成されたオーディオをアプリケーション内で連結してください。

主なポイント

  • モデル:Eleven v3でのみ利用可能
  • 話者:対話あたりの話者数に制限なし
  • リクエストサイズ:1リクエストあたりのすべてのinputs[].text値の合計文字数を2,000文字以下にする
  • 決定性:出力は非決定的です。一貫性を高めるにはseedパラメータを使用してください
  • 無料再生成:生成ごとに最大2回まで無料再生成可能(同一コンテンツ、同一パラメータ、ダッシュボードのみ)
  • 所有権:生成したオーディオの所有権は保持されます。商用利用には有料プランが必要です