オーディオまたはビデオファイルを文字起こしします。webhookがtrueに設定されている場合、リクエストは非同期で処理され、結果は設定済みのWebhookに送信されます。use_multi_channelがtrueで、提供されたオーディオに複数のチャンネルがある場合、各チャンネルの個別の文字起こしを含む'transcripts'オブジェクトが返されます。代わりに、multichannel_output_style='combined'を設定すると、すべてのチャンネルを統合して時刻順に並べた単一の文字起こしを取得できます。それ以外の場合は、単一の文字起こしが返されます。任意のwebhook_metadataパラメータを使用すると、リクエストの関連付けや追跡のために、Webhook応答に含まれるカスタムデータを添付できます。
リクエスト This endpoint expects a multipart form containing an optional file.
file file オプション
文字起こしするファイル(音声の長さは100ms以上)。主要な音声・ビデオ形式に対応しています。fileまたはcloud_storage_urlパラメータのいずれか一方を必ず指定してください。ファイルサイズは5.0GB未満である必要があります。
language_code string or null オプション
オーディオファイルの言語に対応するISO-639-1またはISO-639-3のlanguage_codeです。事前に判明している場合、トランスクリプションのパフォーマンスが向上することがあります。デフォルトはnullで、この場合は言語が自動的に推定されます。
transcript_edit string or null オプション
Natural-language instruction applied to the final transcript (max 2000 characters). The edited text is returned in 'edited_transcript' alongside the original transcript. Cannot be combined with entity_detection, entity_redaction or use_multi_channel. Usage of this parameter will incur an additional 30% surcharge on the base transcription cost, billed for at least 10 seconds of audio.
tag_audio_events boolean オプション デフォルト値 true
文字起こし内で(笑い声)、(足音)などのオーディオイベントにタグ付けするかどうか。
num_speakers integer or null オプション 1-32
アップロードしたファイル内で話している話者の最大数。誰がいつ話しているかの予測に役立ちます。予測できる話者数の上限は32です。デフォルトはnullで、この場合はモデルがサポートする最大値に設定されます。
timestamps_granularity enum オプション デフォルト値 word
文字起こし内のタイムスタンプの粒度。‘word’では単語単位のタイムスタンプ、‘character’では単語ごとの文字単位のタイムスタンプを提供します。
許可された値: none word character
diarize boolean オプション デフォルト値 false
アップロードされたファイルで現在話している話者を注釈付けするかどうか。
diarization_threshold double or null オプション 0.1-0.4
話者ダイアライゼーション時に適用するしきい値です。値を高くすると、1人の話者を2人の異なる話者として識別する可能性は低くなりますが、2人の異なる話者を1人として識別する可能性は高くなります(予測される話者総数は少なくなります)。値を低くすると、1人の話者を2人の異なる話者として識別する可能性は高くなりますが、2人の異なる話者を1人として識別する可能性は低くなります(予測される話者総数は多くなります)。diarize=Trueかつnum_speakers=Noneの場合にのみ設定できます。デフォルトはNoneで、その場合はmodel_idに基づいてしきい値を選択します(通常は0.22)。
additional_formats list of objects オプション
文字起こしのエクスポート先となる追加形式のリストです。
file_format enum オプション デフォルト値 other
入力オーディオの形式。'pcm_s16le_16'または'other'を指定できます。`pcm_s16le_16`の場合、入力オーディオは16kHzサンプルレート、シングルチャンネル(モノラル)、リトルエンディアンの16ビットPCMである必要があります。エンコード済み波形を渡す場合よりレイテンシーが低くなります。
許可された値: pcm_s16le_16 other
cloud_storage_url string or null オプション Deprecated
[Deprecated] このパラメーターは非推奨であり、将来削除されます。代わりに'source_url'を使用してください。文字起こしするファイルのHTTPS URLです。fileまたはcloud_storage_urlパラメーターのいずれか一方のみを指定する必要があります。ファイルはHTTPS経由でアクセス可能で、ファイルサイズは2GB未満である必要があります。クラウドストレージプロバイダー(AWS S3、Google Cloud Storage、Cloudflare R2など)、CDN、その他のHTTPSソースのURLを含む、有効なHTTPS URLを使用できます。URLは事前署名済みでも、クエリパラメーターに認証トークンを含めてもかまいません。
source_url string or null オプション
文字起こしするオーディオまたはビデオファイルのURLです。ホストされたビデオまたはオーディオファイル、YouTubeビデオURL、TikTokビデオURL、その他のビデオホスティングサービスに対応しています。
webhook boolean オプション デフォルト値 false
文字起こし結果を設定済みのスピーチtoテキストWebhookに送信するかどうか。設定すると、リクエストは文字起こし結果を含まずに早期に返され、結果は後でWebhook経由で配信されます。
webhook_id string or null オプション
文字起こし結果の送信先となる任意の特定Webhook ID。webhookがtrueに設定されている場合にのみ有効です。指定しない場合、文字起こしは設定済みのすべてのスピーチtoテキストWebhookに送信されます。
temperature double or null オプション 0-2
文字起こし出力のランダム性を制御します。0.0から2.0までの値を指定でき、値が高いほど多様で決定性の低い結果になります。省略した場合、選択したモデルに基づくtemperatureを使用します。通常は0です。
seed integer or null オプション 0-2147483647
指定すると、同じシードとパラメータでリクエストを繰り返した場合に同じ結果が返るよう、システムは決定論的サンプリングを最大限試みます。決定性は保証されません。0から2147483647までの整数である必要があります。
use_multi_channel boolean オプション デフォルト値 false
オーディオファイルに複数のチャンネルが含まれ、各チャンネルに1人の話者が含まれるかどうか。有効にすると、各チャンネルは個別に文字起こしされます。デフォルトではチャンネルごとに個別の文字起こしが返されます。代わりに、すべてのチャンネルを統合して時刻順に並べた単一の文字起こしを受け取るには、multichannel_output_style='combined'に設定します。レスポンス内の各単語には、どのチャンネルで発話されたかを示す'channel_index'フィールドが含まれます。最大5チャンネルをサポートします。各チャンネルはオーディオの全長に対して個別に課金されるため、コストはチャンネル数に比例して増加します。
multichannel_output_style enum オプション デフォルト値 separate
use_multi_channelが有効な場合の応答形式を制御します。'separate'(デフォルト)は、'transcripts'配下にチャンネルごとに1つの文字起こしを返します。'combined'はすべてのチャンネルを1つの文字起こしに統合し、単語を開始時刻順に並べ、それぞれに'channel_index'を付与します。これは単一チャンネルの応答形式と一致します。'combined'にはタイムスタンプが必要です(timestamps_granularityは'none'以外である必要があります)。また、エンティティ検出と編集はサポートされません。
許可された値: separate combined
webhook_metadata string or map from strings to any or null オプション
Webhook応答に含める任意のメタデータです。最大深度2階層、最大サイズ16KBのオブジェクトを表すJSON文字列にしてください。内部ID、ジョブ参照、その他のコンテキスト情報の追跡に役立ちます。
entity_detection string or list of strings or null オプション
文字起こし内のエンティティを検出します。すべてのエンティティを検出する'all'、単一のエンティティタイプまたはカテゴリ文字列、あるいはエンティティタイプ/カテゴリのリストを指定できます。カテゴリには'pii'、'phi'、'pci'、'other'、'offensive_language'があります。有効にすると、検出されたエンティティはテキスト、タイプ、文字位置とともに'entities'フィールドで返されます。このパラメータの使用には、基本文字起こし料金の30%の追加料金がかかります。
no_verbatim boolean オプション デフォルト値 false
trueの場合、文字起こしからフィラー、言い直し、非音声が除去されます。scribe_v2モデルでのみサポートされています。
use_speaker_library boolean オプション デフォルト値 false
話者分離中に既知の話者を識別するため、話者ライブラリを使用するかどうか。有効でdiarizeがtrueの場合、検出された話者はワークスペースの話者ライブラリに登録されている話者と照合されます。
detect_speaker_roles boolean オプション デフォルト値 false
話者の役割(エージェントまたは顧客)を検出するかどうか。diarize=trueが必要です。use_multi_channel=trueとは併用できません。有効にすると、speaker_idの値は「speaker_0」「speaker_1」などではなく、「agent」と「customer」になります。使用すると、基本文字起こし料金に10%の追加料金がかかります。
entity_redaction string or list of strings or null オプション
文字起こしテキストからエンティティを編集します。entity_detectionと同じ形式、すなわち'all'、カテゴリ('pii'、'phi')、または特定のエンティティタイプを指定できます。entity_detectionのサブセットである必要があります。編集を有効にすると、entitiesフィールドは返されません。このパラメータを使用すると、基本文字起こし料金に30%の追加料金がかかります。
entity_redaction_mode string オプション デフォルト値 enumerated_entity_type
編集済みエンティティの形式を指定します。'redacted'は{REDACTED}に、'entity_type'は{ENTITY_TYPE}に、'enumerated_entity_type'は出現ごとにNを連番とする{ENTITY_TYPE_N}に置き換えます。entity_redactionが設定されている場合にのみ使用されます。
keyterms list of strings オプション デフォルト値 []
文字起こし結果を特定のキータームに寄せるためのリストです。キータームには、モデルにより正確に認識させたい単語またはフレーズを指定します。キータームは1,000件まで指定できます。各キータームは50文字未満にする必要があります。キータームには(正規化後で)最大5語まで含められます。例: ["hello", "world", "technical term"]。次の文字はサポートされていません: `<`, `>`, `{`, `}`, `[`, `]`, `\`。このパラメータを使用すると、基本の文字起こし料金に20%の追加料金が発生します。100件を超えるキータームを指定した場合、リクエストごとに最低20秒分の課金対象時間が適用されます。
SpeechToTextChunkResponseModel object
タイミング情報を含む、文字起こしのチャンクレベルの詳細。
MultichannelSpeechToTextResponseModel object
マルチチャンネルのスピーチtoテキスト文字起こしのレスポンスモデル。
SpeechToTextWebhookResponseModel object