
トニー・ロビンズがSteno.aiとElevenLabsで自身の声によるリアルタイムAIコーチングを開始
- カテゴリ
- カスタマーストーリー
- 日付
Speech Engineのご紹介
たった1つのプロンプトで、既存のチャットエージェントに人間らしい音声を追加できます。音声部分はElevenLabsが担当します。エージェントのLLM、RAG、アーキテクチャには一切手を加えません。
Speech Engineは、既存のスタックにそのまま組み込めます。再設計は不要で、テキストベースのエージェントもそのまま使えます。

Speech Engineは、最先端の音声・文字起こし・音声オーケストレーションモデルを1つのパイプラインに統合。すべてが連携するようにカスタム設計されています。
音声は情報をやり取りする最速かつ最も豊かな方法であり、プロダクトやサービスをより多くのお客様に届けます。
ElevenLabsの音声モデルは会話向けに最適化されており、実環境でも超低遅延で動作します。
専用モデルが重なった発話や途中の話題変更にも対応。カスタムロジックは不要です。
幅広い言語に対応し、感情豊かな人間らしい音声を生成できます。
すべてのコンポーネントが最適化され、連携して最高のパフォーマンスを発揮します。
会話の正確さに特化した文字起こしモデルで、ユーザーの音声を超低遅延の80msで文字起こしします。
70以上の言語で表現力豊かな人間らしい音声。11,000以上のボイスライブラリから選ぶか、ボイスクローンで自作も可能です。
ユーザーが話し終えたか一時停止かを判別し、トランスクリプトをLLMに送るタイミングを正確に制御します。
エージェントが話している間もユーザーの発話を監視。割り込みがあれば即座に再生を停止し、会話を再開します。
入力段階でバックグラウンドノイズを除去し、クリーンな音声だけを文字起こしモデルに渡します。
ユーザー音声の取得からエージェントの応答まで、音声の全ライフサイクルを管理します。
スキルを使ってコマンド一つでインストールできます。必要な設定はすべてスキルが行うので、チャットから音声への切り替えも簡単です。
Speech Engineをサーバーに接続。トランスクリプトを受け取り、LLMに渡して応答を返すまで、数行で実装できます。

ブラウザやモバイルアプリから3行で会話セッションを開始。同じクライアント連携なので、後からElevenAgentsへアップグレードしても変更不要です。
当プラットフォームは大規模展開を想定し、エンタープライズレベルのデータ保護(SOC2、HIPAA、GDPR対応)を実現。EUデータレジデンシーやゼロリテンションモードも利用可能です。

