コンテンツへ移動

Eleven v3を正式リリース

執筆者
Joe Reeve
公開日

聴くこの記事を聴く

最先端のテキスト読み上げモデル、Eleven v3がAlpha版を終了し、正式リリースされました。

Alpha版のリリース以降も、モデルの改良を続けてきました。主な改善点は2つです。

より安定。 テストでは、従来のAlpha版と比べて72%のユーザーが新バージョンを選びました。

より高精度。 数字、記号、専門表記を各言語で処理する精度が大幅に向上しました。

精度の向上

テキスト読み上げモデルは、入力された文章を解釈し、どう発音するかを判断する必要があります。同じ記号でも、文脈によって意味が異なる場合があります。

電話番号を例に考えてみましょう:「+49 170 9876543」

一部のケースでは、数字列ではなく大きな数として解釈し、「プラス49、170、987万6,543」のように読み上げることがありました。正しい読み方は、「プラス4、9、1、7、0、9、8、7、6、5、4、3」です。

こうしたエラーは、スポーツのスコア、化学式、通貨、座標など、モデルが記号を解釈して発音を決める必要がある幅広いカテゴリで発生していました。

8言語・27カテゴリを対象とした社内ベンチマークでテストを実施しました。

全体: エラーを68%削減。エラー率は15.3%から4.9%に低下しました。

カテゴリ別エラー率:

改善前
化学式
45.6%
電話番号
16.9%
URL/メールアドレス
45.6%
ISBN
17.9%
ナンバープレート
14.4%
数式
23.8%
地理座標
46.2%
改善後
化学式
0.6%
電話番号
0.6%
URL/メールアドレス
3.9%
ISBN
0.0%
ナンバープレート
1.2%
数式
6.9%
地理座標
17.5%
エラー削減率
化学式
99%
電話番号
99%
URL/メールアドレス
91%
ISBN
100%
ナンバープレート
91%
数式
71%
地理座標
62%

改善が特に大きいのは、文脈によって解釈が決まるカテゴリです。たとえばコロンは、前後のテキストに応じてスポーツのスコア、時刻、アスペクト比を表すことがあります。

通貨 — 金額を正確に読み上げ:

入力:¥250,000

改善前:25,000円

改善後:250,000円

化学式 — 記号を正しく保持:

入力:SO₂

改善前:「sulfur double」(不明瞭な読み上げ)

改善後:「S O two」

スポーツのスコア — 文脈を考慮した解釈:

入力:最終スコア:102-98

改善前:「102引く98」

改善後:「102対98」

提供状況

Eleven v3は、すべてのプラットフォームで正式に利用可能です。

関連記事

最高品質のAIオーディオで創造する