Cómo elegir el modelo adecuado

Esta guía te muestra cómo elegir el modelo de ElevenLabs adecuado para tu caso de uso.

ElevenLabs ofrece una gama de modelos optimizados para distintos requisitos. La elección adecuada depende de tu caso de uso, tus requisitos de latencia y tus expectativas de calidad. Consulta la referencia de modelos para ver las especificaciones completas.

Según el requisito

Calidad

Usa eleven_v4

El modelo insignia, con la máxima fidelidad, la expresión emocional más rica y la compatibilidad lingüística más amplia.

Latencia baja

Usa eleven_v4_turbo

Optimizado para aplicaciones en tiempo real con una latencia de aproximadamente 100 ms.

Según el caso de uso

Creación de contenido

Usa eleven_v4

Ideal para contenido profesional, audiolibros y narración de vídeo.

Agentes conversacionales

Usa eleven_v4_turbo para la entonación más expresiva, o eleven_flash_v2_5 y eleven_flash_v2 para la menor latencia.

Usa el modelo 2.5 para compatibilidad con idiomas distintos del inglés.

Optimizado para aplicaciones conversacionales en tiempo real.

Transcripción

Usa scribe_v2 para transcripción por lotes, scribe_v2_medical para audio médico y clínico, o scribe_v2_realtime para transcripción en tiempo real.

Precisión puntera en más de 90 idiomas, con diarización de hablantes y marcas de tiempo a nivel de palabra.

Cambiador de voz

Usa eleven_multilingual_sts_v2

Especializado en conversión de voz a voz.

Próximos pasos