ボイスデザイン
ボイスデザイン
テキストプロンプトからボイスを作るためのガイド。
概要
ボイスデザインは、求めている声がボイスライブラリにない場合に、その不足を補うための機能です。プロジェクトに合うボイスが見つからなければ、自分で作成できます。ボイスデザインは迅速な探索と反復に最適で、出力品質はプロンプトやユースケースによって異なります。最も一貫性が高く、本番環境に対応できる品質が必要な場合は、現在プラットフォームで最高品質のボイスであるプロフェッショナルボイスクローン(PVC)をおすすめします。ライブラリ内にニーズに合うPVCがある場合は、そちらを使用してください。
ボイスデザインには、ElevenLabsアプリでVoices -> My Voices -> Add a new voice -> Voice Designの順に進むか、APIからアクセスできます。
生成を実行すると、3つのボイス候補が生成されます。ボイスデザインの利用料金は、プレビューテキストの生成に必要なクレジットのみです。3つのサンプルが生成されますが、課金は1回だけです。差し引かれる文字数は、「Text to preview」テキストボックスで確認できます。
生成後は、候補の1つを選んで保存できます。保存したボイスはボイススロットを1つ使用します。
プロンプトガイド
プロンプトはボイスの基盤です。アクセントやキャラクターのタイプから、性別や雰囲気まで、作成したいボイスの種類をモデルに伝えます。丁寧に作られたプロンプトは、一般的なボイスと、イメージに本当に合うボイスを分ける決め手になります。一般に、より具体的で細かなプロンプトほど、正確でニュアンス豊かな結果が得られやすくなります。年齢、性別、トーン、アクセント、ペース、感情、スタイルなど、詳細を多く指定するほど、モデルは意図に沿ったカスタマイズされたボイスをより正確に解釈・生成できます。
ただし、よりニュートラルで幅広く使えるボイスを目指す場合は、短くシンプルなプロンプトでも機能することがあります。たとえば、「穏やかな男性ナレーター」だけで、細かく説明しなくても必要なボイスが得られるかもしれません。特に、非常に具体的なキャラクターやスタイルを作ろうとしていない場合に有効です。適切な詳細度はユースケースによって異なります。ファンタジーのキャラクター、バーチャルアシスタント、辛口なユーモアを持つ60代の疲れたニューヨーカーを作っていますか?プロンプトでより明確に定義するほど、出力はイメージに近づきます。
推奨プロンプト形式
一貫した結果を得るには、以下の形式でプロンプトを構成してください。
例:
ネイティブのスペイン語、ヨーロッパ系スペイン語(ラテンアメリカ系スペイン語の特徴なし)。女性、35〜40歳。品質は標準。ペルソナ:信頼できるサポートオペレーター。感情:安心感があり、注意深く、自信に満ちている。やさしい抑揚、前に出た近接感、ノイズのない信号を備えた、滑らかで自然な音色。役立つ情報を明確に強調しながら、ゆったりしたペースで最新情報を伝え、共感とプロ意識を表現する。
避けるべきよくある落とし穴
- イントネーションを指す場合は「アクセント」を使わない — 意図しない方言の変化を引き起こす可能性があります。代わりに、イントネーション、強調、話し方のパターンを説明してください。
- FX関連の単語は避ける — 「リバーブ」、「エコー」、「電話」、「テープ」などの用語は、出力品質に悪影響を与えることがあります。
- 言語と方言を明確に指定する — ずれを防ぐため、最初の文で必ず言語と地域バリエーションを指定してください。
オーディオ品質
オーディオ品質とは、生成された音声の明瞭さ、クリーンさ、全体的な忠実度を指します。デフォルトでは、ElevenLabsはクリーンで自然な音声の生成を目指します。ただし、プロジェクトで特定の品質レベルが必要な場合は、プロンプトに明記するのが最適です。
高品質な結果を得るには、音声の説明に「完璧なオーディオ品質」や「スタジオ品質の録音」といったフレーズを追加して、モデルを導くことができます。これにより、最大限の明瞭さ、最小限の歪み、洗練された仕上がりで音声が生成されやすくなります。
一貫した結果を得られる、次のような具体的な品質表現も使えます:
- まあまあの品質
- 良い品質
- とても良い品質
- 優れた品質
- スタジオ品質
- 放送品質
これらの表現をプロンプトに含めると、最高のオーディオ品質を実現しやすくなります。
音声が非常に具体的またはニッチな場合、こうしたフレーズを含めると、 プロンプト全体の精度が下がることがあります。
電話通話、古いラジオ放送、拾得映像を再現する場合など、あえて低いオーディオ品質にしたいクリエイティブなケースもあります。その場合は、品質表現を完全に省くか、次のようなフレーズを明示的に含めてください:
- 「低忠実度のオーディオ」
- 「低いオーディオ品質」
- 「留守番電話のような音」
- 「古いテープレコーダーのように、こもって遠い音」
このフレーズをプロンプトのどこに置くかは柔軟に決められます。冒頭でも末尾でも構いませんが、どちらでもうまく機能することがわかっています。
年齢、トーン/音色、性別
この3つの特性は音声デザインの基盤であり、声の全体的な個性と感情的な響きを形作ります。詳細を多く指定するほど、AIはクリエイティブなビジョンに合う音声を生成しやすくなります。説得力のあるキャラクター、魅力的なナレーター、バーチャルアシスタントを作る場合にも有効です。
年齢
声から感じられる年齢を説明すると、成熟度、声の質感、エネルギーを定義できます。適切な声質にAIを導くため、具体的な用語を使ってください。
役立つ表現:
- 「思春期の男性」/「思春期の女性」
- 「若い成人」/「20代」/「30代前半」
- 「中年男性」/「40代の女性」
- 「高齢男性」/「年配の女性」/「80代の男性」
トーン/音色
ピッチ、共鳴、声の質感によって形作られる、声の物理的な特質を指します。感情的な話し方や態度とは異なります。
一般的なトーン/音色の表現:
- 「深い」/「低音の」
- 「滑らかな」/「豊かな」
- 「しゃがれた」/「かすれた」
- 「鼻にかかった」/「甲高い」
- 「軽やかな」/「息混じりの」
- 「響き渡る」/「共鳴する」
- 「軽い」/「細い」
- 「温かい」/「まろやかな」
- 「金属的な」/「メタリックな」
性別
性別はピッチ、声の重み、トーンの存在感に影響を与えることが多いですが、アイデンティティではなく音の特徴を説明すれば、単純なカテゴリを超えた表現もできます。
例:
- 「低めでハスキーな女性の声」
- 「男性的な男性の声。深く響きがある」
- 「中性的な性別。柔らかく中程度のピッチ」
アクセント
アクセントは、音声の地域的、文化的、感情的なアイデンティティを定義するうえで重要な役割を果たします。リアリズムに基づく場合でも、キャラクター向けに様式化する場合でも、プロジェクトで本物らしい音が必要なら、求めるアクセントを明確かつ意図的に指定することが不可欠です。
フレーズの選び方は重要です。特定の用語ほど一貫した結果が出やすい傾向があります。たとえば、アクセントの強さを説明する際は、「strong」よりも「thick」のほうが良い結果になることがよくあります。試行錯誤の余地は大きいため、表現をいろいろ試し、できるだけ創造的かつ具体的に説明することをおすすめします。
「accent」という単語を使う際は注意してください。地域の方言ではなく、イントネーションや 強調パターンを意味する場合は、代わりにそれらの用語を使ってください。イントネーションの意味で 「accent」を使うと、意図しない方言の変化を引き起こす可能性があります。
- 明確なアクセントプロンプトの例:
- 「濃いフランス訛りの中年男性」
- 「わずかに南部訛りのある若い女性」
- 「強い東ヨーロッパ訛りの老人」
- 「はっきりしたイギリス訛りで話す陽気な女性」
- 「柔らかなアイルランド訛りの若い男性」
- 「ニュートラルなアメリカ訛りの威厳ある声」
- 「地域色のあるオーストラリア訛りで、のんびりと鼻にかかった男性」
「外国風」や「エキゾチック」といった曖昧すぎる表現は避けてください。不正確で、一貫しない結果になることがあります。
トーン、年齢、話すペースなどの特性とアクセントを組み合わせると、より細かく制御できます。例:「濃いニューヨーク訛りでゆっくり話す、皮肉っぽい老婦人」
ファンタジーや架空の声では、現実世界のアクセントを参考として提示できます:
- 「きちんとした濃いイギリス訛りのエルフ。威厳があり、抒情的。」
- 「かすれた東ヨーロッパ訛りのゴブリン。」
話すペース
話すペースとは、音声が話す速さとリズムを指します。声の個性、感情的なトーン、明瞭さを形作る重要な要素です。特にストーリーテリング、広告、キャラクターの会話、教材コンテンツなど、特定の用途向けに音声をデザインする場合は、ペースを明確に指定することが欠かせません。
音声の話す速さや遅さを、明確な言葉で説明してください。また、一定、不規則、慎重、軽快など、ペースの印象を説明することもできます。ペースが変化する場合は、どこで、なぜ変わるかも必ず示してください。
話すペースの表現例:
- 「速く話す」/「速いペースで」
- 「通常のペースで」/「普通に話す」
- 「ゆっくり話す」/「ゆっくりしたリズムで」
- 「慎重で計ったペース」
- 「一語一語を味わうように、引き延ばして」
- 「急いでいるかのような、せわしない調子で」
- 「リラックスした会話的なペース」
- 「リズミカルで音楽的なペース」
- 「唐突な間と勢いのある部分を伴う、不規則なペース」
- 「単語間のタイミングが一貫した、均等なペース」
- 「スタッカート調の話し方」
プレビュー用テキスト
効果的な音声プロンプトを書いたら、その音声をプレビューするために使うテキストが、実際の聞こえ方を形作るうえで重要な役割を果たします。プレビューテキストは演技用の台本のようなもので、音声が合わせようとするトーン、ペース、感情表現を設定します。
最良の結果を得るには、プレビューテキストは音声の説明を補完するものであり、矛盾してはいけません。たとえば、プロンプトで「わずかに日本語アクセントのある、落ち着いて内省的な若い女性の声」と説明しているのに、「ねえ! あなたがこのひどい場所にしたこと、我慢できないわ!!!」のような文を使うと、意図と衝突します。モデルはその不一致を解消しようとするため、不自然だったり一貫性がなかったりする結果になりがちです。
代わりに、音声が意図する個性や感情的なトーンを反映するサンプルテキストを使ってください。上記の例では、「最近は静かね…考える時間があったし、たぶんそれが一番必要だったのかも。」のような文であれば、プロンプトを補完し、より自然で一貫性のある音声を生成できます。
さらに、長めのプレビューテキストほど、安定して表現力豊かな結果になる傾向があります。特にトーンやペースのような繊細な特性をテストする場合、短いフレーズは唐突だったり、一貫性がなかったりすることがあります。完全な文、あるいは短い段落など、より多くの文脈をモデルに与えることで、より滑らかで正確な音声表現を実現できます。
パラメーター
音量
テキストからプレビュー生成の音量と、最終的に保存後の音声の音量を制御します。
ガイダンススケール
プロンプトへの忠実度を決定します。値を高くするとプロンプトにより厳密に従いますが、プロンプトが非常にニッチな場合はオーディオ品質が低下する可能性があります。一方、値を低くすると、プロンプトの精度は下がる代わりに、モデルがより創造的になります。プロンプトを完璧に再現することよりも、全体的な演技やオーディオ品質が重要な場合は低い値を使ってください。アクセントやトーンの正確さが最優先の場合は、高い値をおすすめします。
属性と例
こうした表現の書き方を試してみてください。たとえば、「完璧なオーディオ品質」は 「オーディオ品質は完璧」と書くこともできます。異なる結果になることがあります!