Scribe v2

新しい最先端の文字起こしモデル、Scribe v2をリリースしました。ドキュメントでScribe v2の詳細を見る。

Agents Platform

  • バッチ通話スケジューリングのタイムゾーンサポート:バッチ通話のスケジューリング時にタイムゾーンを選択できるようになりました。予約時刻は、選択したタイムゾーンに基づいてUTCに変換されます。デフォルトではブラウザーのタイムゾーンが自動選択され、選択したタイムゾーンですでに過ぎた時刻には通話を予約できないよう検証されます。これにより、受信者のタイムゾーンに合わせて適切な時間に発信通話を予約しやすくなります。
  • ナレッジベースのソースファイルURL:ナレッジベースドキュメントの元のソースファイルURLを取得する新しいエンドポイントを追加し、アップロード済みファイルへ直接アクセスできるようになりました。
  • LLMフォールバックカスケードのタイムアウト:エージェントのバックアップLLM設定にcascade_timeout_seconds設定オプションを追加し、次のLLMへカスケードするまでの待機時間を制御できるようになりました。デフォルトは8秒で、許容範囲は2~15秒です。
  • ソフトタイムアウト時のLLM生成メッセージ:ソフトタイムアウト設定にuse_llm_generated_messageオプションを追加しました。有効にすると、ソフトタイムアウト発生時に、事前定義されたメッセージの代わりにエージェントがLLMを使用して文脈に応じたメッセージを生成します。
  • ナレッジベースのフォルダーナビゲーション:ナレッジベースドキュメントのレスポンスに、ルートから親フォルダーまでのパスセグメントを示すfolder_pathフィールドが含まれるようになり、ドキュメント階層を把握しやすくなりました。
  • 開始元による会話フィルタリング:会話を取得エンドポイントで、conversation_initiation_sourceクエリパラメーターによるフィルタリングをサポートするようになりました。

吹き替え

  • 新しい文字起こし形式エンドポイント:srt、webvtt、jsonの出力形式をサポートするGET /v1/dubbing/{dubbing_id}/transcripts/{language_code}/format/{format_type}エンドポイントを追加しました。従来のGET /v1/dubbing/{dubbing_id}/transcript/{language_code}エンドポイントは非推奨になりました。
  • 吹き替えファイルの必須ファイル名:ナレッジベースファイルモデルでfilenameフィールドが必須になりました。

スピーチtoテキスト

  • エンティティ検出:スピーチtoテキストリクエストにentity_detectionオプションを追加しました。'all'、特定のエンティティタイプ文字列、またはエンティティタイプの配列を指定できます。検出されたエンティティは、DetectedEntityスキーマを使用する新しいentitiesレスポンスフィールドで返されます。
  • キータームプロンプト:特定の用語やフレーズに文字起こし結果を寄せるため、スピーチtoテキストリクエストにkeyterms配列パラメーターを追加しました。

SDKリリース

Python SDK

  • v2.29.0 - スピーチtoテキストのエンティティ検出とキータームプロンプト、LLMカスケードタイムアウト設定、ソフトタイムアウト時のLLMメッセージ生成、バッチ通話のタイムゾーンサポートを追加
  • v2.28.0 - エージェントのバージョニングフィールド、音声コレクションID、バッチ通話の機能強化、電話番号ラベルを追加

JavaScript SDK

  • v2.30.0 - スピーチtoテキストのエンティティ検出とキータームプロンプト、LLMカスケードタイムアウト設定、ソフトタイムアウト時のLLMメッセージ生成、バッチ通話のタイムゾーンサポートを追加
  • v2.29.0 - エージェントのバージョニングフィールド、音声コレクションID、バッチ通話の機能強化、電話番号ラベルを追加

MCP Server

  • v0.9.1 - Gemini Extensionサポートを追加し、絶対パスでないoutput_directoryおよび欠落したbase_pathのパス処理を修正

API

新しいエンドポイント

非推奨のエンドポイント

  • GET /v1/dubbing/{dubbing_id}/transcript/{language_code} - 新しい形式別エンドポイントを使用してください

更新されたエンドポイント

Agents Platform

ナレッジベース

  • ナレッジベースドキュメントの一覧
    • 非推奨のuse_typesenseクエリパラメーターを削除
    • ドキュメントレスポンスモデルにfolder_path(パスセグメントの配列)を追加
    • ナレッジベースファイルモデルにfilename(文字列、必須)を追加

スピーチtoテキスト

  • 音声を書き起こす
    • 特定の用語に文字起こし結果を寄せるためのkeyterms(文字列の配列、任意)を追加
    • 書き起こしテキスト内のエンティティを検出するためのentity_detection(文字列、配列、または'all'、任意)を追加
    • レスポンスモデルにentities(DetectedEntityの配列、任意)を追加

吹き替え