Ir al contenido

Eleven v3 ya está disponible de forma general

Escrito por
Joe Reeve
Publicado

EscucharEscucha este artículo

Eleven v3, nuestro modelo de Texto a Voz más avanzado, ya ha salido de la fase Alpha y está disponible de forma general.

Desde el lanzamiento de Alpha, hemos seguido perfeccionando el modelo. Dos mejoras clave:

Más estable. En las pruebas, usuarios prefirieron la nueva versión el 72 % de las veces frente a la versión Alpha anterior.

Más preciso. Hemos mejorado significativamente cómo el modelo gestiona números, símbolos y notación especializada en distintos idiomas.

Mejoras de precisión

Los modelos de Texto a Voz deben interpretar lo que escribes y decidir cómo decirlo. Los mismos símbolos pueden tener significados distintos según el contexto.

Pensemos en un número de teléfono: "+49 170 9876543"

En algunos casos, nuestros modelos lo leían como «más cuarenta y nueve, ciento setenta, nueve millones ochocientos setenta y seis mil quinientos cuarenta y tres», interpretando los dígitos como números grandes en lugar de como una secuencia de dígitos. La lectura correcta es «más cuatro nueve, uno siete cero, nueve ocho siete seis cinco cuatro tres».

Este tipo de errores aparecía en distintas categorías —resultados deportivos, fórmulas químicas, monedas, coordenadas—, en cualquier caso en el que los modelos tuvieran que interpretar símbolos y decidir cómo pronunciarlos.

Realizamos pruebas con un benchmark interno que abarca 27 categorías en 8 idiomas.

En total: reducción de errores del 68 %. La tasa de error bajó del 15,3 % al 4,9 %.

Tasa de error por categoría:

Antes
Fórmulas químicas
45.6%
Números de teléfono
16.9%
URL / correos electrónicos
45.6%
ISBN
17.9%
Matrículas
14.4%
Expresiones matemáticas
23.8%
Coordenadas geográficas
46.2%
Después
Fórmulas químicas
0.6%
Números de teléfono
0.6%
URL / correos electrónicos
3.9%
ISBN
0.0%
Matrículas
1.2%
Expresiones matemáticas
6.9%
Coordenadas geográficas
17.5%
Reducción de errores
Fórmulas químicas
99%
Números de teléfono
99%
URL / correos electrónicos
91%
ISBN
100%
Matrículas
91%
Expresiones matemáticas
71%
Coordenadas geográficas
62%

Las mejoras son más notables en las categorías en las que el contexto determina la interpretación, donde dos puntos pueden indicar un resultado deportivo, una hora o una relación de aspecto según el texto que los rodea.

Ejemplos

Monedas — magnitud correcta:

Entrada:  ¥250,000

Antes: 25,000 yenes

Después:  250,000 yenes

Fórmulas químicas — símbolos conservados correctamente:

Entrada:  SO₂

Antes: «azufre doble» (incorrecto)

Después:  «S O dos»

Resultados deportivos — interpretación según el contexto:

Entrada:  Resultado final: 102-98

Antes: «ciento dos menos noventa y ocho»

Después:  «ciento dos a noventa y ocho»

Disponibilidad

Eleven v3 ya está disponible de forma general en todas las plataformas.

Artículos relacionados

Crea con el audio IA de la más alta calidad