コンテンツへ移動

Dust、ElevenLabsを活用してAI主導のエンタープライズワークフローに多言語音声を追加

公開日

聴くこの記事を聴く

Dustは、AIネイティブ企業向けのオペレーティングシステムです。現在はElevenLabsを活用し、多言語の音声入力・出力を提供しています。日常業務にモデルを組み込むために設計されたDustには、低レイテンシーかつ高いリアリティで、言語、デバイス、利用シーンを問わず機能する音声機能が必要でした。

これは実験的な取り組みではありません。顧客からの繰り返しの要望を受け、音声はプロダクトの優先事項になりました。その結果、通勤中のハンズフリーなエージェント操作、グローバルチーム間での多言語コラボレーション、非同期ワークフロー向けのプロフェッショナルなオーディオ出力を支えるシステムが実現しました。

エンタープライズで音声が重要な理由

Dustは、業務における音声に必要な4つの重要要件を特定しました。

  • 厳しい評価にも耐える自然な品質:音声出力はプロフェッショナルで人間らしく、顧客向けメール、ポッドキャスト、製品デモでの共有に適している必要があります。
  • 標準で多言語対応:チームは世界中の拠点と言語をまたいで業務を進めます。1つのセッション内でフランス語、英語、ドイツ語を切り替えることは、例外的なケースであってはなりません。
  • 低レイテンシー:入力・出力のどちらでも、応答速度は思考や会話のテンポに合う必要があります。
  • エンタープライズグレードのデータ処理:データを保持しないこと、リージョンベースのルーティング、SOC2およびGDPRへの準拠は、譲れない要件でした。

DustがElevenLabsを選んだ理由

OpenAI、Google、Deepgram、AssemblyAIを含むプロバイダーを評価した結果、Dustは優れた品質と導入のしやすさからElevenLabsを選びました。

  • テキスト読み上げの音声は、幅広い感情表現と一貫して高いリアリティを実現。DustのSpeech GeneratorとSound Studioツールにとって不可欠でした。
  • スピーチtoテキストは99の文字起こし言語に対応し、言語をまたいでも高い忠実度を実現しました。
  • Zero Data Retentionとマルチリージョンルーティングにより、追加設定なしでエンタープライズのコンプライアンス要件に対応できます。
  • 本番環境対応のSDKとAPIにより、迅速なインテグレーションとプラットフォーム間で一貫したパフォーマンスを実現しました。

Dustによる音声の統合方法

Dustは、2つの主要なワークフローに音声機能を組み込みました。

1. 音声入力:エージェントに話しかける

ElevenLabsのscribe_v1モデルにより、ユーザーはマイクを使ってエージェントに話しかけられるようになりました。システムは話された言語を自動で検出して文字起こしし、リクエストを適切にルーティングします。自然な発話からエージェント名を推測することもできます。

音声入力はモバイルでも利用でき、入力が最も不便な場面に対応します。

2. 音声出力:エージェントが生成するオーディオ

Speech Generatorを通じて、DustのエージェントはElevenLabsのeleven_multilingual_v2およびeleven_v3モデルを使用し、オーディオコンテンツを作成できます。出力にはポッドキャスト、ブリーフィング、ナラティブ形式のオーディオコンテンツが含まれ、社内利用と社外共有の両方に活用されています。

SFX生成を活用したSound Studioは、トレーニングやコンテンツのユースケースに非言語のオーディオレイヤーを加えます。

Dustが得た学び

  • リージョンルーティングが重要:EU/米国のリージョン選択により、レイテンシーを削減し、コンプライアンスに関する協議を円滑にしました。
  • 多さより厳選:厳選した12種類の音声で、主要なニーズをすべてカバーしながら、選択疲れを軽減できます。
  • 品質>速度:より高速なモデルも利用できる中で、ユーザーは本番コンテンツには一貫して高忠実度の音声を選びました。

これにより実現すること

  • モバイルファーストの生産性:移動中でもアイデアを記録し、コラボレーションできます。
  • 多言語コラボレーション:自分の言語で自然に話すだけで、あとはエージェントが対応します。
    アクセスしやすい非同期ワークフロー:リサーチをオーディオに変換し、入力の障壁を下げ、多様な働き方を支援します。

今後の展開

Dustは現在、リアルタイムの会話型音声エージェント、文字起こしを超えたより深いオーディオ理解、会議やプレゼンテーションのような長時間入力への対応を検討しています。ElevenLabsの統合により、Dustは音声をエンタープライズAIのシームレスな一部にしています。

関連記事

最高品質のAIオーディオで創造する