キータームプロンプティング
キータームプロンプティング
このガイドでは、スピーチtoテキストAPIでキータームプロンプティングを使用する方法を説明します。
ハウツーガイド · スピーチtoテキストのクイックスタートを完了していることを前提としています。
概要
キータームプロンプティングはScribe v2、Scribe v2 Medical(バッチ)、Scribe v2 Realtimeで利用でき、追加料金がかかります。詳しい料金については、API料金ページ をご覧ください。
キータームプロンプティングは、単語やフレーズを指定して、モデルがそれらを文字起こししやすくする機能です。プロダクト名、人名、その他の固有用語など、オーディオ内であまり一般的ではない特定の単語や文を文字起こしする際に役立ちます。キータームは、他のモデルで提供されるバイアス付きキーワードやカスタム語彙よりも強力です。コンテキストに基づいて、その用語を文字起こしすべきかどうかを判断するためです。
たとえば、会社名が一般的なフレーズではない場合や、独自のスペルや発音がある場合は、キータームを使用してモデルが正しく文字起こしできるようにします。次のオーディオを例にします。
キータームプロンプティングを使用しない場合、モデルは上記を次のように文字起こしする可能性があります。
この表記では会社名のスタイルが誤っています。キータームプロンプティングを使用すると、モデルが正しいスペルとスタイルで文字起こしするようにできます。
コンテキスト
モデルはコンテキストを利用して、用語を文字起こしすべきかどうかを判断できます。キータームとして「ElevenLabs」を指定すると、上記のオーディオは想定どおりに文字起こしされます。一方で、モデルはコンテキストに基づき、次の内容も正しく文字起こしできます。
出力される文字起こしは次のとおりです。
バッチ文字起こし
キータームプロンプティングは、convertメソッドにkeytermsパラメータを渡すことで、バッチのスピーチtoテキストAPIに統合できます。
リアルタイムストリーミング
キータームプロンプティングは、リアルタイムスピーチtoテキストWebSocket APIでも利用できます。接続時にkeytermsパラメータを渡してください。
WebSocket APIを直接使用する場合は、キータームをクエリパラメータとして渡します。