プロフェッショナルボイスクローン(PVC)
- PVC API:プロフェッショナルボイスクローン(PVC)を管理する包括的なAPIエンドポイント群を導入しました。プログラムで音声を作成し、オーディオサンプルの追加、管理、削除、オーディオ/波形の取得、話者分離の管理、検証の処理、トレーニングの開始を行えるようになりました。新しいエンドポイントの一覧は以下のAPI変更サマリー、またはこちらのPVC APIリファレンスをご覧ください。
スピーチtoテキスト
- エクスポートオプションの強化:API経由でスピーチtoテキストの結果をセグメント化JSON形式でエクスポートする際、タイムスタンプと話者IDを含めるか除外するかを選択できるオプションを追加しました。
Agents Platform
- 新しいLLMモデル:新しいGPT-4.1モデル
gpt-4.1、gpt-4.1-mini、gpt-4.1-nanoをサポートしました。こちら - VADスコア:VADスコアをクライアントに送信する新しいクライアントイベントを追加しました。リファレンスはこちら
API
APIの変更を見る
新しいエンドポイント
- 新たに16のエンドポイントを追加:
- PVC音声を作成 - 新しいPVC音声を作成します。
- PVC音声を編集 - PVC音声のメタデータを編集します。
- PVC音声にサンプルを追加 - PVC音声にオーディオサンプルを追加します。
- PVC音声サンプルを更新 - PVC音声サンプルを更新します(ノイズ除去、話者選択、トリミング)。
- PVC音声サンプルを削除 - PVC音声からサンプルを削除します。
- 音声サンプルのオーディオを取得 - PVC音声サンプルのオーディオを取得します。
- 音声サンプルの視覚的波形を取得 - PVC音声サンプルの視覚的な波形を取得します。
- 話者分離ステータスを取得 - サンプルの話者分離ステータスを取得します。
- 話者分離を開始 - サンプルの話者分離を開始します。
- 分離された話者のオーディオを取得 - 特定の分離済み話者のオーディオを取得します。
- PVC音声Captchaを取得 - PVC音声検証用のCaptchaを取得します。
- PVC音声Captchaを検証 - PVC音声のCaptcha検証を送信します。
- PVCトレーニングを実行 - PVC音声のトレーニングプロセスを開始します。
- 手動検証をリクエスト - PVC音声の手動検証をリクエストします。
更新されたエンドポイント
スピーチtoテキスト
- 以下の変更を含むエンドポイントを更新:
- 強制アラインメントタスクを作成 - 大きなファイルのストリーミングを可能にする
enabled_spooled_fileパラメーターを追加(POST /v1/forced-alignment)。
- 強制アラインメントタスクを作成 - 大きなファイルのストリーミングを可能にする
スキーマの変更
Agents Platform
GET conversation details:has_audio、has_user_audio、has_response_audioのブールフィールドを追加。こちら
吹き替え
GET dubbing resource:各レンダーにstatusフィールドを追加。こちら