サーバーサイドストリーミング
サーバーサイドストリーミング
このガイドでは、ElevenLabsを使用してサーバーサイドで音声をリアルタイムに文字起こしする方法を紹介します。
ハウツーガイド · スピーチtoテキスト クイックスタートを完了していることを前提としています。
概要
ElevenLabs Realtime Speech to Text APIでは、Scribe Realtime v2モデルを使用して、超低レイテンシーで音声ストリームをリアルタイムに文字起こしできます。音声アシスタント、文字起こしサービス、ライブ音声認識が必要なあらゆるアプリケーションの構築において、このWebSocketベースのAPIは、話している間は部分的な文字起こしを、音声セグメントが完了すると確定した文字起こしを提供します。
Scribe v2 Realtimeは、URL、ファイル、または独自の音声ストリームを介して、サーバーサイドでリアルタイムに音声を文字起こしできます。
サーバーサイドの実装は、クライアントサイドとはいくつかの点で異なります。
- 単回使用トークンではなくElevenLabs APIキーを使用します。
- 音声を手動でチャンク化することなく、URLから直接ストリーミングできます。
マイクから直接音声をストリーミングする場合は、クライアントサイドストリーミングガイドを参照してください。
クイックスタート
このガイドでは、APIキーとSDKのセットアップが完了していることを前提としています。まだの場合は、先にクイックスタートを完了してください。
SDKを設定する
SDKでは、リアルタイムでオーディオを書き起こす方法を2つ提供しています。URLからストリーミングする方法と、ファイルまたは独自のオーディオストリームからオーディオを手動でチャンク化する方法です。
APIでサポートされているパラメーターとオプションの一覧は、APIリファレンスをご覧ください。
URLからストリーミング
オーディオを手動でチャンク化
この例では、公式SDKを使ってURLからオーディオファイルをストリーミングする方法を示します。
URLからストリーミングするには、ffmpegツールが必要です。インストール手順は公式サイトをご覧ください。
使用する言語に応じて、example.pyまたはexample.mtsという新しいファイルを作成し、次のコードを追加します。