コンテンツへ移動

Eleven v3が正式リリース

執筆者
Joe Reeve
公開日

聴くこの記事を聴く

最も高度なテキスト読み上げモデル、Eleven v3がAlphaを終了し、正式リリースされました。

Alphaリリース以降も、モデルの改良を続けてきました。主な改善点は2つです。

より安定。 テストでは、従来のAlphaリリースと比べて、ユーザーの72%が新バージョンを好みました。

より正確。 数字、記号、専門的な表記を各言語で処理する精度を大幅に向上させました。

精度の向上

テキスト読み上げモデルは、書かれた内容を解釈し、どのように発話するかを判断する必要があります。同じ記号でも、文脈によって意味が異なる場合があります。

電話番号を例に見てみましょう:「+49 170 9876543」

場合によっては、モデルがこれを「プラス49、170、987万6,543」と読み上げ、数字の並びではなく大きな数として解釈していました。正しくは「プラス4 9、1 7 0、9 8 7 6 5 4 3」と読みます。

こうしたエラーは、スポーツのスコア、化学式、通貨、座標など、モデルが記号を解釈して読み上げ方を判断するあらゆる場面で見られました。

8言語・27カテゴリを対象とした社内ベンチマークでテストしました。

全体では: エラーを68%削減。エラー率は15.3%から4.9%に低下しました。

カテゴリ別エラー率:

改善前
化学式
45.6%
電話番号
16.9%
URL/メールアドレス
45.6%
ISBN
17.9%
ナンバープレート
14.4%
数式
23.8%
地理座標
46.2%
改善後
化学式
0.6%
電話番号
0.6%
URL/メールアドレス
3.9%
ISBN
0.0%
ナンバープレート
1.2%
数式
6.9%
地理座標
17.5%
エラー削減率
化学式
99%
電話番号
99%
URL/メールアドレス
91%
ISBN
100%
ナンバープレート
91%
数式
71%
地理座標
62%

改善が特に大きいのは、文脈によって解釈が決まるカテゴリです。たとえばコロンは、周囲のテキストによってスポーツのスコア、時刻、アスペクト比のいずれかを表します。

通貨 — 金額の桁を正確に認識:

入力: ¥250,000

改善前:2万5,000円

改善後: 25万円

化学式 — 記号を正しく保持:

入力: SO₂

改善前:「硫黄ダブル」(不正確)

改善後: 「S O 2」

スポーツのスコア — 文脈に応じた解釈:

入力: 最終スコア:102-98

改善前:「102引く98」

改善後: 「102対98」

提供状況

Eleven v3は現在、すべてのプラットフォームで正式に利用できます。

関連記事

最高品質のAIオーディオで創造する