ボイスデザイン

テキストプロンプトからボイスを作るためのガイド。

ボイスデザイン

概要

ボイスデザインは、求めている声がボイスライブラリにない場合に、その不足を補うための機能です。プロジェクトに合うボイスが見つからなければ、自分で作成できます。ボイスデザインは迅速な探索と反復に最適で、出力品質はプロンプトやユースケースによって異なります。最も一貫性が高く、本番環境に対応できる品質が必要な場合は、現在プラットフォームで最高品質のボイスであるプロフェッショナルボイスクローン(PVC)をおすすめします。ライブラリ内にニーズに合うPVCがある場合は、そちらを使用してください。

ボイスデザインには、ElevenLabsアプリでVoices -> My Voices -> Add a new voice -> Voice Designの順に進むか、APIからアクセスできます。

生成を実行すると、3つのボイス候補が生成されます。ボイスデザインの利用料金は、プレビューテキストの生成に必要なクレジットのみです。3つのサンプルが生成されますが、課金は1回だけです。差し引かれる文字数は、「Text to preview」テキストボックスで確認できます。

生成後は、候補の1つを選んで保存できます。保存したボイスはボイススロットを1つ使用します。

プロンプトガイド

プロンプトはボイスの基盤です。アクセントやキャラクターのタイプから、性別や雰囲気まで、作成したいボイスの種類をモデルに伝えます。丁寧に作られたプロンプトは、一般的なボイスと、イメージに本当に合うボイスを分ける決め手になります。一般に、より具体的で細かなプロンプトほど、正確でニュアンス豊かな結果が得られやすくなります。年齢、性別、トーン、アクセント、ペース、感情、スタイルなど、詳細を多く指定するほど、モデルは意図に沿ったカスタマイズされたボイスをより正確に解釈・生成できます。

ただし、よりニュートラルで幅広く使えるボイスを目指す場合は、短くシンプルなプロンプトでも機能することがあります。たとえば、「穏やかな男性ナレーター」だけで、細かく説明しなくても必要なボイスが得られるかもしれません。特に、非常に具体的なキャラクターやスタイルを作ろうとしていない場合に有効です。適切な詳細度はユースケースによって異なります。ファンタジーのキャラクター、バーチャルアシスタント、辛口なユーモアを持つ60代の疲れたニューヨーカーを作っていますか?プロンプトでより明確に定義するほど、出力はイメージに近づきます。

推奨プロンプト形式

一貫した結果を得るには、以下の形式でプロンプトを構成してください。

Native <Language>. <Gender>, <Age range>. <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>

例:

ネイティブのスペイン語、ヨーロッパ系スペイン語(ラテンアメリカ系スペイン語の特徴なし)。女性、35〜40歳。品質は標準。ペルソナ:信頼できるサポートオペレーター。感情:安心感があり、注意深く、自信に満ちている。やさしい抑揚、前に出た近接感、ノイズのない信号を備えた、滑らかで自然な音色。役立つ情報を明確に強調しながら、ゆったりしたペースで最新情報を伝え、共感とプロ意識を表現する。

避けるべきよくある落とし穴

  • イントネーションを指す場合は「アクセント」を使わない — 意図しない方言の変化を引き起こす可能性があります。代わりに、イントネーション、強調、話し方のパターンを説明してください。
  • FX関連の単語は避ける — 「リバーブ」、「エコー」、「電話」、「テープ」などの用語は、出力品質に悪影響を与えることがあります。
  • 言語と方言を明確に指定する — ずれを防ぐため、最初の文で必ず言語と地域バリエーションを指定してください。

オーディオ品質

オーディオ品質とは、生成された音声の明瞭さ、クリーンさ、全体的な忠実度を指します。デフォルトでは、ElevenLabsはクリーンで自然な音声の生成を目指します。ただし、プロジェクトで特定の品質レベルが必要な場合は、プロンプトに明記するのが最適です。

高品質な結果を得るには、音声の説明に「完璧なオーディオ品質」や「スタジオ品質の録音」といったフレーズを追加して、モデルを導くことができます。これにより、最大限の明瞭さ、最小限の歪み、洗練された仕上がりで音声が生成されやすくなります。

一貫した結果を得られる、次のような具体的な品質表現も使えます:

  • まあまあの品質
  • 良い品質
  • とても良い品質
  • 優れた品質
  • スタジオ品質
  • 放送品質

これらの表現をプロンプトに含めると、最高のオーディオ品質を実現しやすくなります。

音声が非常に具体的またはニッチな場合、こうしたフレーズを含めると、 プロンプト全体の精度が下がることがあります。

電話通話、古いラジオ放送、拾得映像を再現する場合など、あえて低いオーディオ品質にしたいクリエイティブなケースもあります。その場合は、品質表現を完全に省くか、次のようなフレーズを明示的に含めてください:

  • 「低忠実度のオーディオ」
  • 「低いオーディオ品質」
  • 「留守番電話のような音」
  • 「古いテープレコーダーのように、こもって遠い音」

このフレーズをプロンプトのどこに置くかは柔軟に決められます。冒頭でも末尾でも構いませんが、どちらでもうまく機能することがわかっています。

年齢、トーン/音色、性別

この3つの特性は音声デザインの基盤であり、声の全体的な個性と感情的な響きを形作ります。詳細を多く指定するほど、AIはクリエイティブなビジョンに合う音声を生成しやすくなります。説得力のあるキャラクター、魅力的なナレーター、バーチャルアシスタントを作る場合にも有効です。

年齢

声から感じられる年齢を説明すると、成熟度、声の質感、エネルギーを定義できます。適切な声質にAIを導くため、具体的な用語を使ってください。

役立つ表現:

  • 「思春期の男性」/「思春期の女性」
  • 「若い成人」/「20代」/「30代前半」
  • 「中年男性」/「40代の女性」
  • 「高齢男性」/「年配の女性」/「80代の男性」

トーン/音色

ピッチ、共鳴、声の質感によって形作られる、声の物理的な特質を指します。感情的な話し方や態度とは異なります。

一般的なトーン/音色の表現:

  • 「深い」/「低音の」
  • 「滑らかな」/「豊かな」
  • 「しゃがれた」/「かすれた」
  • 「鼻にかかった」/「甲高い」
  • 「軽やかな」/「息混じりの」
  • 「響き渡る」/「共鳴する」
  • 「軽い」/「細い」
  • 「温かい」/「まろやかな」
  • 「金属的な」/「メタリックな」

性別

性別はピッチ、声の重み、トーンの存在感に影響を与えることが多いですが、アイデンティティではなく音の特徴を説明すれば、単純なカテゴリを超えた表現もできます。

例:

  • 「低めでハスキーな女性の声」
  • 「男性的な男性の声。深く響きがある」
  • 「中性的な性別。柔らかく中程度のピッチ」

アクセント

アクセントは、音声の地域的、文化的、感情的なアイデンティティを定義するうえで重要な役割を果たします。リアリズムに基づく場合でも、キャラクター向けに様式化する場合でも、プロジェクトで本物らしい音が必要なら、求めるアクセントを明確かつ意図的に指定することが不可欠です。

フレーズの選び方は重要です。特定の用語ほど一貫した結果が出やすい傾向があります。たとえば、アクセントの強さを説明する際は、「strong」よりも「thick」のほうが良い結果になることがよくあります。試行錯誤の余地は大きいため、表現をいろいろ試し、できるだけ創造的かつ具体的に説明することをおすすめします。

「accent」という単語を使う際は注意してください。地域の方言ではなく、イントネーションや 強調パターンを意味する場合は、代わりにそれらの用語を使ってください。イントネーションの意味で 「accent」を使うと、意図しない方言の変化を引き起こす可能性があります。

  • 明確なアクセントプロンプトの例:
    • 「濃いフランス訛りの中年男性」
    • 「わずかに南部訛りのある若い女性」
    • 「強い東ヨーロッパ訛りの老人」
    • 「はっきりしたイギリス訛りで話す陽気な女性」
    • 「柔らかなアイルランド訛りの若い男性」
    • 「ニュートラルなアメリカ訛りの威厳ある声」
    • 「地域色のあるオーストラリア訛りで、のんびりと鼻にかかった男性」

「外国風」や「エキゾチック」といった曖昧すぎる表現は避けてください。不正確で、一貫しない結果になることがあります。

トーン、年齢、話すペースなどの特性とアクセントを組み合わせると、より細かく制御できます。例:「濃いニューヨーク訛りでゆっくり話す、皮肉っぽい老婦人」

ファンタジーや架空の声では、現実世界のアクセントを参考として提示できます:

  • 「きちんとした濃いイギリス訛りのエルフ。威厳があり、抒情的。」
  • 「かすれた東ヨーロッパ訛りのゴブリン。」

話すペース

話すペースとは、音声が話す速さとリズムを指します。声の個性、感情的なトーン、明瞭さを形作る重要な要素です。特にストーリーテリング、広告、キャラクターの会話、教材コンテンツなど、特定の用途向けに音声をデザインする場合は、ペースを明確に指定することが欠かせません。

音声の話す速さや遅さを、明確な言葉で説明してください。また、一定、不規則、慎重、軽快など、ペースの印象を説明することもできます。ペースが変化する場合は、どこで、なぜ変わるかも必ず示してください。

話すペースの表現例:

  • 「速く話す」/「速いペースで」
  • 「通常のペースで」/「普通に話す」
  • 「ゆっくり話す」/「ゆっくりしたリズムで」
  • 「慎重で計ったペース」
  • 「一語一語を味わうように、引き延ばして」
  • 「急いでいるかのような、せわしない調子で」
  • 「リラックスした会話的なペース」
  • 「リズミカルで音楽的なペース」
  • 「唐突な間と勢いのある部分を伴う、不規則なペース」
  • 「単語間のタイミングが一貫した、均等なペース」
  • 「スタッカート調の話し方」

プレビュー用テキスト

効果的な音声プロンプトを書いたら、その音声をプレビューするために使うテキストが、実際の聞こえ方を形作るうえで重要な役割を果たします。プレビューテキストは演技用の台本のようなもので、音声が合わせようとするトーン、ペース、感情表現を設定します。

最良の結果を得るには、プレビューテキストは音声の説明を補完するものであり、矛盾してはいけません。たとえば、プロンプトで「わずかに日本語アクセントのある、落ち着いて内省的な若い女性の声」と説明しているのに、「ねえ! あなたがこのひどい場所にしたこと、我慢できないわ!!!」のような文を使うと、意図と衝突します。モデルはその不一致を解消しようとするため、不自然だったり一貫性がなかったりする結果になりがちです。

代わりに、音声が意図する個性や感情的なトーンを反映するサンプルテキストを使ってください。上記の例では、「最近は静かね…考える時間があったし、たぶんそれが一番必要だったのかも。」のような文であれば、プロンプトを補完し、より自然で一貫性のある音声を生成できます。

さらに、長めのプレビューテキストほど、安定して表現力豊かな結果になる傾向があります。特にトーンやペースのような繊細な特性をテストする場合、短いフレーズは唐突だったり、一貫性がなかったりすることがあります。完全な文、あるいは短い段落など、より多くの文脈をモデルに与えることで、より滑らかで正確な音声表現を実現できます。

パラメーター

音量

テキストからプレビュー生成の音量と、最終的に保存後の音声の音量を制御します。

ガイダンススケール

プロンプトへの忠実度を決定します。値を高くするとプロンプトにより厳密に従いますが、プロンプトが非常にニッチな場合はオーディオ品質が低下する可能性があります。一方、値を低くすると、プロンプトの精度は下がる代わりに、モデルがより創造的になります。プロンプトを完璧に再現することよりも、全体的な演技やオーディオ品質が重要な場合は低い値を使ってください。アクセントやトーンの正確さが最優先の場合は、高い値をおすすめします。

属性と例

こうした表現の書き方を試してみてください。たとえば、「完璧なオーディオ品質」は 「オーディオ品質は完璧」と書くこともできます。異なる結果になることがあります!

属性例
年齢若い、より若い、成人、老年、高齢、40代の男性/女性
アクセント「濃い」スコットランド訛り、「わずかな」アジア系アメリカ人訛り、アメリカ南部訛り
性別男性、女性、ジェンダーニュートラル、曖昧な性別
トーン/音色/ピッチ深い、温かい、しゃがれた、滑らかな、甲高い、バターのように滑らかな、かすれた、鼻にかかった、喉声の、粗い、ロボットのような、幻想的な
話すペース通常の話すリズム、速いペース、速く、ゆっくり、引き延ばした、落ち着いたペース、自然な/会話的なペース
オーディオ品質完璧なオーディオ品質、オーディオ品質は「まあまあ」、低いオーディオ品質
キャラクター/職業海賊、ビジネスマン、農家、政治家、セラピスト、オーガ、神のような存在、テレビアナウンサー
感情エネルギッシュな、興奮した、悲しい、感情的な、皮肉っぽい、淡々とした
ピッチ低いピッチ、高いピッチ、通常のピッチ

プロンプトとテキストプレビューの例

音声タイププロンプト/説明テキストプレビューガイダンススケール
女性スポーツ実況者濃いイギリス英語アクセントで、サッカーの試合を非常に速いテンポで情熱的に実況する、エネルギッシュな女性スポーツ実況者。声は生き生きとして熱意にあふれ、試合展開に完全に没入しています。なんということだ――なんてゴールだ! ハーフウェーラインを少し越えたところでボールを受けると、まるでそこにいないかのように2人のディフェンダーをかわし、トップコーナーへ思い切り叩き込んだ! ゴールキーパーにはまったくチャンスがなかった! 若きフォワードによるワールドクラスのプレーだ、観客は総立ちだ! この試合は一気に盛り上がり、流れが変わっていくのを感じられる!25%
鬼軍曹部隊の兵士たちを怒鳴りつける陸軍の鬼軍曹。怒っており、速いペースで話します。よく聞け、この情けない連中め! 俺は子守をしに来たんじゃない――兵士を鍛えに来たんだ! 俺が動けと言ったら動け、息をしろと言ったら息をしろ! 10秒以内に整列しろ、さもなければ後悔するぞ!!25%
邪悪なオーガ速いペースで話す、巨大で邪悪なオーガ。おどけた響きのある口調です。“お前たちの武器など、私には爪楊枝同然だ。[laughs] 今すぐ降伏すれば、楽に終わらせてやるかもしれん。私は王国を倒し、軍勢を食らってきた。お前たちに私へ立ち向かう希望などあるのか?“30%
親しみやすいイギリス人起業家優れたオーディオ品質。30代から40代前半の男性で、濃いイギリス英語アクセント。友人と話すような自然なペースで話します。[laughs] ほら、そこなんだよ。君には会社が見える。でも僕には……[lip smacks] 僕には約束が見えるんだ、わかるだろ? [exhales] 利益のためだけに作るんじゃない、僕たちは、その、より良くするために作るんだ! 僕たちのテクノロジーが、この世界を今より優しく、賢く、つながりのある場所にしないなら……[sighs] ここでいったい何をしてるんだ?40%
南部出身の女性濃い南部アクセントの年配女性。優しく、皮肉の効いた話し方です。“まあねえ、肩書きやトロフィーばかり追いかけていたら、いちばん大事なことを見失っちゃうわ。[light chuckle] みんなの暮らしを少しでも楽にできるものを作りたいの――ヒールを履いて、笑顔と少しの生意気さを添えてできるなら、なおさら素敵ね。“35%
映画予告編のナレーションドラマチックな声。映画予告編で期待感を高めるために使われ、通常はアクションやスリラー作品と関連付けられます。“混沌の瀬戸際にある世界で、一人のヒーローが立ち上がる。壮大な物語に備えよ。まもなく劇場公開。“20%
甲高いネズミかわいらしい、小さくて甲高い声のネズミ”小さいからって、気迫まで小さいと思わないで! [giggles] 気をつけてよ、大きな足さん。さもないと、忘れられないくらいつま先をかじってあげる!“20%
怒れる海賊怒りっぽい年老いた海賊。大声で豪放な話し方です。“お前の髪を真っ白にするような嵐も、膝を震わせるような海の怪物も見てきた。キャプテン・ブラックハートに逆らって、生きてその話をできると思っているのか?“30%
ニューヨーカー太くしわがれた濃いニューヨークアクセント。タフで世慣れており、しばしば冷笑的です。“坊や、俺はお前が想像するよりずっと長くこの街を歩いてきた。もうお前が何を言おうと何をしようと、驚きはしない。“40%
スペイン語サポート担当者ネイティブスペイン語、ヨーロッパスペイン語(ラテンアメリカ系スペイン語の特徴なし)。女性、35~40歳。品質は標準的。ペルソナ:信頼できるサポート担当者。感情:安心感があり、丁寧で、自信に満ちています。滑らかで自然な音色に穏やかなイントネーション。近接感のある、ノイズのない信号です。役立つ情報を明確に強調しながら、ゆったりとしたペースで最新情報を伝え、共感とプロフェッショナリズムを表現します。30%
アラビア語カスタマーサービスネイティブアラビア語。穏やかな湾岸(UAE)アクセントの影響。女性、30~40歳。優れた品質。ペルソナ:プロフェッショナルなカスタマーサービス担当者。感情:温かく、自信があり、礼儀正しい。落ち着いた口調、抑えたペース、穏やかなイントネーションを持つ、なめらかな音色。高忠実度でノイズのない信号のため、マイクに近い距離感を維持します。明瞭な存在感と顧客向けフレーズへのやさしい強調により、理解しやすくします。35%
ポーランド人クリエイティブナレーターネイティブポーランド語。男性、48~58歳。優れた品質。ペルソナ:創造的な夢想家。感情:好奇心にあふれ、穏やかで、親しみやすい。声は滑らかでノイズがなく、温かく引き込まれる質感と安定したペースを備え、自然な近接感で届けられます。明るいイントネーションと的確な強調で、聞き手を物語へと導きます。32%
マッドサイエンティスト興奮するにつれて加速する、速く不規則な話し方をする風変わりな科学の天才の声。動揺するとドイツ語なまりがより強くなります。思索的なつぶやきから狂気じみた叫びまでピッチが大きく変化し、頻繁に狂気の笑い声を上げます。“私はハインリヒ博士、視野の狭い科学界に拒絶された革命的天才だ! ふん! 奴らは私の理論を不可能だと、私の手法を非倫理的だと言った――だが今笑っているのは誰だ? (狂気じみた笑い)20年もの間、この山中の研究所で我が創造物を完成させてきた。人間の理解を超えたエネルギーを操りながらな! アカデミーの愚か者どもは、我が量子不安定化装置がマルチバースを明らかにしたとき、嘲笑したことを後悔するだろう。あるいは新たな生命体か……実験には予測不能な変数がいくつかある……実に興味深い変数がな!“38%

よくある質問

ボイスデザインでは、テキストプロンプトから独自の音声を作成できます。

ボイスライブラリで必要な音声が見つからない場合に役立つよう設計されています。既存のオプションから選ぶ代わりに、自分の言葉で説明してカスタム音声を生成できます。

まずは、希望する音声を説明するプロンプトを入力してください。アクセント、性別、話すペース、トーン、話し方などの詳細を含めることができます。プロンプトが具体的であるほど、音声は意図により近づきます。ただし、迷う場合は「落ち着いた男性ナレーター」のようなシンプルなプロンプトでも機能します。

Voice Design v3で作成した音声は、最新モデルのEleven v3と完全に互換性があり、最も表現力豊かな音声のためのオーディオタグをサポートしています。また後方互換性もあるため、ほかのすべてのモデルでも使用できます。

効果的なプロンプトの書き方については、ボイスデザインガイド。をご覧ください。

注:ボイスデザインはまだ実験段階です。プロフェッショナルボイスクローンは、 最も高い品質と一貫性を提供します。ニーズに合うPVCが見つかった場合は、その使用をおすすめします。 ただし、v3モデルは現在プロフェッショナルボイスクローンをサポートしていません。

ボイスデザインでは、リアルで人間らしい音声から、よりクリエイティブなキャラクター風の音声まで、幅広い音声を生成できます。

何から始めればよいかわからない場合は、「中年の女性ニュースキャスター」のようなシンプルなプロンプトを試してください。ただし、より詳細なプロンプトほど、通常は正確でニュアンスに富んだ結果が得られます。

プロンプトには、次のようなさまざまな特性を含めることができます。

  • 年齢
  • 性別
  • アクセント
  • トーン
  • 話すペース
  • 感情
  • 話し方
  • オーディオ品質

出力を調整するための追加コントロールは2つあります。

  • Loudnessでは、プレビューと保存済み音声の両方の音量を調整します。
  • Guidance scaleでは、生成される音声がプロンプトにどれだけ忠実に従うかを決定します。

プロンプト作成についてさらに詳しくは、ボイスデザインガイドをご覧ください。

ボイスデザインでクレジットが消費されるのは、音声を生成するときだけです。

Generate voiceをクリックするたびに、プロンプトに基づく3つの音声オプションが作成されます。プレビューテキストの文字数に応じて課金されます。

独自のプレビューテキストを入力するか、Auto-generateボタンを使用して自動生成できます。自動生成されたプレビューには、関連するオーディオタグが含まれます。

詳細は、ボイスデザインガイド。をご覧ください。

No results