Scribe v2がアップグレードされました
- 執筆者
- Joe Reeve
- 公開日
聴くこの記事を聴く
組み込みのエンティティ編集、Indic-English文字起こしの改善、新しいNo Verbatimモード、最大1,000語まで拡張されたキータームプロンプティングを導入します。
これらの改善により、デベロッパーはプライバシー、多言語での精度、文字起こし品質、分野別の精度をより細かく制御できます。
Scribe v2の新しいエンティティ編集機能
Scribe v2では、名前、クレジットカード番号、社会保障番号、その他の個人を特定できる情報を含む、文字起こし内の機密エンティティを自動的に検出して編集できるようになりました。
編集は文字起こし中に行われます。機密データは、ストレージやダウンストリームシステムに届く前に削除されます。
- 完全編集:エンティティを[REDACTED]に置き換えます。
- カテゴリ別:エンティティタイプに置き換えます。例:[CREDIT_CARD]。
- 番号付き:カテゴリと番号を含むラベルに置き換えます。例:[CREDIT_CARD_1]。
これにより、医療、金融、カスタマーサポートなどの部門にまたがるデータ処理ワークフローを支援しながら、チームは文字起こしをより簡単に共有できます。
注:編集は自動で行われるため、すべての機密情報を特定または削除できない場合があります。出力を利用する前に確認してください。
正確なIndic-Englishコードスイッチング
インドでは、英語とヒンディー語、テルグ語、カンナダ語などのインド系言語を混ぜて話すことがよくあります。多くの文字起こしシステムでは英単語をインド系文字に音写するため、実際のコミュニケーションを反映しない文字起こしになってしまいます。
Scribe v2は、周囲の言語にかかわらず、英単語を英語で文字起こしします。言語設定は不要で、自動的に機能します。英語、ヒンディー語、または言語コードなしで指定しても、英単語はラテン文字のまま保持されます。
これはヒンディー語と英語の組み合わせに限らず、インド系言語全般に対応します。話者がテルグ語と英語、またはカンナダ語と英語を切り替える場合でも、英語部分は正確に文字起こしされます。
読みやすい文字起こしのためのNo Verbatimモード
「um」や「uh」などのフィラーワードに加え、繰り返しのフレーズやどもりを自動的に削除する文字起こし設定、No Verbatimモードを導入します。
手作業での編集や後処理なしで、読みやすく整った文字起こしが得られます。
No Verbatimモードは、会議メモ、字幕、すべての音をそのまま記録するのではなく、洗練された文章記録を目的とするあらゆるワークフローに適しています。
キータームプロンプティングを1,000語まで拡張
キータームプロンプティングは、文字起こし1件あたり最大1,000語またはフレーズをサポートするようになりました。従来の上限は100語でした。
大規模な技術用語集、プロダクトカタログ、分野固有の用語を扱うチームは、より正確な文字起こしへとモデルを導くための余地を得られます。
キータームプロンプティングは引き続きコンテキストを考慮します。モデルは用語を無作為に挿入するのではなく、周囲のオーディオを用いてキータームが該当するか判断します。1,000語では、従来の10倍の容量になります。
注:キータームが100語を超えるリクエストには、20秒の最小課金単位が適用されます。
本日より利用可能
これらの機能は、本日からScribe v2のAPIとUIで利用できます。
ドキュメントを読む:
https://elevenlabs.io/docs/cookbooks/speech-to-text/quickstart


.jpg&w=3840&q=80)
.jpg&w=3840&q=80)
