音声
- 新しいPVCフロー:プロフェッショナルボイスクローン作成用の新しいフローを追加しました。こちらでお試しください。
Agents Platform
- **エージェント間転送:**新しいシステムツールを通じたエージェント間転送をサポートし、より複雑な会話フローを実現しました。詳細はエージェント転送ツールのドキュメントをご覧ください。
- **ツールデバッグの強化:**デバッグを容易にするため、会話履歴でのツール実行詳細の表示方法を改善しました。
- **言語検出の修正:**言語検出ツールが強制的に呼び出される問題を解決しました。
吹き替え
- **レンダーエンドポイント:**吹き替えプロジェクト内の特定言語について、オーディオまたはビデオのレンダーを再生成する新しいエンドポイントを導入しました。不足しているトランスクリプションや翻訳は自動で処理されます。吹き替えレンダーエンドポイントをご覧ください。
- **サイズ制限の引き上げ:**吹き替えプロジェクトで許可される最大ファイルサイズを1GiBに引き上げました。
API
APIの変更を見る
新しいエンドポイント
- 吹き替えレンダーエンドポイントを追加 - 特定言語の吹き替えを再生成します。
更新されたエンドポイント
発音辞書
GET /v1/pronunciation-dictionaries/{pronunciation_dictionary_id}/エンドポイントと関連コンポーネントのレスポンスを更新し、permission_on_resourceフィールドを含めるようにしました。
スピーチtoテキスト
- スピーチtoテキストエンドポイント(
POST /v1/speech-to-text)を更新:- 公開S3またはGCS URLから直接トランスクリプションできる
cloud_storage_urlパラメーターを追加(最大2GB)。 fileパラメーターを任意に変更。現在はfileまたはcloud_storage_urlのいずれか一方を必ず指定する必要があります。
- 公開S3またはGCS URLから直接トランスクリプションできる
スピーチtoスピーチ
POST /v1/speech-to-speech/{voice_id}に、PCM入力時のレイテンシーを低減する任意のfile_formatパラメーター(pcm_s16le_16またはother)を追加
Agents Platform
- エージェント間転送ツールをサポートするようコンポーネントを更新
音声
GET /v1/voices/{voice_id}のsamplesフィールドを更新し、任意のtrim_startおよびtrim_endパラメーターを含めるようにしました。
AudioNative
Get /v1/audio-native/{project_id}/settingsを更新し、statusフィールド(processingまたはready)を含めるようにしました。