Scribe v2
新しい最先端の文字起こしモデル、Scribe v2をリリースしました。ドキュメントでScribe v2の詳細を見る。
Agents Platform
- バッチ通話スケジューリングのタイムゾーンサポート:バッチ通話のスケジューリング時にタイムゾーンを選択できるようになりました。予約時刻は、選択したタイムゾーンに基づいてUTCに変換されます。デフォルトではブラウザーのタイムゾーンが自動選択され、選択したタイムゾーンですでに過ぎた時刻には通話を予約できないよう検証されます。これにより、受信者のタイムゾーンに合わせて適切な時間に発信通話を予約しやすくなります。
- ナレッジベースのソースファイルURL:ナレッジベースドキュメントの元のソースファイルURLを取得する新しいエンドポイントを追加し、アップロード済みファイルへ直接アクセスできるようになりました。
- LLMフォールバックカスケードのタイムアウト:エージェントのバックアップLLM設定に
cascade_timeout_seconds設定オプションを追加し、次のLLMへカスケードするまでの待機時間を制御できるようになりました。デフォルトは8秒で、許容範囲は2~15秒です。 - ソフトタイムアウト時のLLM生成メッセージ:ソフトタイムアウト設定に
use_llm_generated_messageオプションを追加しました。有効にすると、ソフトタイムアウト発生時に、事前定義されたメッセージの代わりにエージェントがLLMを使用して文脈に応じたメッセージを生成します。 - ナレッジベースのフォルダーナビゲーション:ナレッジベースドキュメントのレスポンスに、ルートから親フォルダーまでのパスセグメントを示す
folder_pathフィールドが含まれるようになり、ドキュメント階層を把握しやすくなりました。 - 開始元による会話フィルタリング:会話を取得エンドポイントで、
conversation_initiation_sourceクエリパラメーターによるフィルタリングをサポートするようになりました。
吹き替え
- 新しい文字起こし形式エンドポイント:
srt、webvtt、jsonの出力形式をサポートするGET /v1/dubbing/{dubbing_id}/transcripts/{language_code}/format/{format_type}エンドポイントを追加しました。従来のGET /v1/dubbing/{dubbing_id}/transcript/{language_code}エンドポイントは非推奨になりました。 - 吹き替えファイルの必須ファイル名:ナレッジベースファイルモデルで
filenameフィールドが必須になりました。
スピーチtoテキスト
- エンティティ検出:スピーチtoテキストリクエストに
entity_detectionオプションを追加しました。'all'、特定のエンティティタイプ文字列、またはエンティティタイプの配列を指定できます。検出されたエンティティは、DetectedEntityスキーマを使用する新しいentitiesレスポンスフィールドで返されます。 - キータームプロンプト:特定の用語やフレーズに文字起こし結果を寄せるため、スピーチtoテキストリクエストに
keyterms配列パラメーターを追加しました。
SDKリリース
Python SDK
- v2.29.0 - スピーチtoテキストのエンティティ検出とキータームプロンプト、LLMカスケードタイムアウト設定、ソフトタイムアウト時のLLMメッセージ生成、バッチ通話のタイムゾーンサポートを追加
- v2.28.0 - エージェントのバージョニングフィールド、音声コレクションID、バッチ通話の機能強化、電話番号ラベルを追加
JavaScript SDK
- v2.30.0 - スピーチtoテキストのエンティティ検出とキータームプロンプト、LLMカスケードタイムアウト設定、ソフトタイムアウト時のLLMメッセージ生成、バッチ通話のタイムゾーンサポートを追加
- v2.29.0 - エージェントのバージョニングフィールド、音声コレクションID、バッチ通話の機能強化、電話番号ラベルを追加
MCP Server
- v0.9.1 - Gemini Extensionサポートを追加し、絶対パスでない
output_directoryおよび欠落したbase_pathのパス処理を修正
API
APIの変更を表示
新しいエンドポイント
- 形式を指定して吹き替え文字起こしを取得 -
GET /v1/dubbing/{dubbing_id}/transcripts/{language_code}/format/{format_type}- SRT、WebVTT、またはJSON形式で吹き替え文字起こしを取得 - ナレッジベースのソースファイルURLを取得 -
GET /v1/convai/knowledge-base/{documentation_id}/source-file-url- ナレッジベースドキュメントの元のソースファイルURLを取得
非推奨のエンドポイント
GET /v1/dubbing/{dubbing_id}/transcript/{language_code}- 新しい形式別エンドポイントを使用してください
更新されたエンドポイント
Agents Platform
- バッチ通話を送信
- タイムゾーン対応のスケジューリング用に、リクエスト本文へ
timezone(文字列、任意)を追加 scheduled_time_unixのISO文字列代替としてscheduled_time(文字列、任意)を追加
- タイムゾーン対応のスケジューリング用に、リクエスト本文へ
- バッチ通話を取得、バッチ通話をキャンセル、バッチ通話を再試行
- バッチ通話レスポンスモデルに
timezone(文字列、必須)を追加
- バッチ通話レスポンスモデルに
- エージェントを作成、エージェントを更新、エージェントを取得
- バックアップLLM設定に
cascade_timeout_seconds(整数、デフォルト8、範囲2~15、null許容)を追加 - ソフトタイムアウト設定に
use_llm_generated_message(ブール値、デフォルトfalse)を追加
- バックアップLLM設定に
- 会話を取得
- 開始元で会話をフィルタリングするための
conversation_initiation_source(文字列、任意)クエリパラメーターを追加
- 開始元で会話をフィルタリングするための
- 会話をシミュレート、会話ストリームをシミュレート
entity_detectionがブール値ではなく、'all'、文字列、または文字列配列を受け取るよう更新
ナレッジベース
- ナレッジベースドキュメントの一覧
- 非推奨の
use_typesenseクエリパラメーターを削除 - ドキュメントレスポンスモデルに
folder_path(パスセグメントの配列)を追加 - ナレッジベースファイルモデルに
filename(文字列、必須)を追加
- 非推奨の
スピーチtoテキスト
- 音声を書き起こす
- 特定の用語に文字起こし結果を寄せるための
keyterms(文字列の配列、任意)を追加 - 書き起こしテキスト内のエンティティを検出するための
entity_detection(文字列、配列、または'all'、任意)を追加 - レスポンスモデルに
entities(DetectedEntityの配列、任意)を追加
- 特定の用語に文字起こし結果を寄せるための
吹き替え
- 吹き替えプロジェクトを作成
manualモードは実験的であり、本番環境での使用は推奨されないことを明記するようmodeの説明を更新