Introducing Eleven v4Introducing Eleven v4, our fastest and most emotive voice model

Ir al contenido

Nuestros modelos más expresivos hasta la fecha

Descubre Eleven v4
y v4 Turbo

Crea voz expresiva y controlable con emoción, eventos de audio y paisajes sonoros envolventes.

Eleven v4

Nuestro modelo de voz más rápido y emotivomodelo de voz

Eleven v4 se basa en una arquitectura completamente nueva que interpreta un guion como lo haría un actor de doblaje. Sabe quién habla, qué acaba de pasar y cómo debe sonar cada frase.

Un abanico de emociones y sonidos

Voz en más de 90 idiomas y con una extraordinaria gama emocional, varios hablantes y efectos de sonido integrados para crear la escena.

Demo 1 de 4

Basado en una nueva arquitectura

Añade indicaciones al guion

Añade indicaciones como [laughs], [whispers] y [door slams] directamente al guion. Eleven v4 sigue las secuencias de etiquetas con más fiabilidad que v3, incluidos los efectos de sonido.

Une audio de larga duración sin cortes

La unión por contexto mantiene el ritmo y la entonación en un guion de cualquier longitud. Un audiolibro completo suena como una única toma, de la primera página a la última.

Regenera sin que cambie la voz

Repite una frase una o cincuenta veces y seguirá hablando la misma persona. La estabilidad del hablante se mantiene en diálogos, narraciones y todo lo demás.

Usa un Clon de Voz Profesional

Los Clones de Voz Profesionales no eran compatibles con v3. En Eleven v4 vuelven y aprovechan toda la gama emocional del modelo en todos los idiomas que hablan.

Eleven v4 Turbo

Presentamos Eleven v4 Turbopara tiempo real y agentes

Nuestro modelo de voz en tiempo real más rápido, con la gama expresiva de Eleven v4, disponible a través de la API y ElevenAgents. Eleven v4 Turbo tiene una latencia de inferencia mediana de ~150 ms y mantiene la coherencia en interacciones largas.

Tiempos de respuesta que pasan desapercibidos

Con una mediana de 150 ms hasta la primera voz, la latencia desaparece y la conversación fluye con naturalidad.

Eleven v4 Turbo
150ms101234567891501234567895001234567890ms
Cartesia Sonic 3.6
262ms201234567892601234567896201234567892ms
OpenAI GPT-4o mini TTS
814ms801234567898101234567891401234567894ms
Tiempo mediano hasta la primera voz

Escúchalo en una llamada real

Descubre más sobre Eleven v4 Turbo con un agente impulsado por este modelo.

Optimizado para conversaciones en directo

Texto en streaming, audio en streaming

Envía texto a medida que lo genera tu LLM y el audio empieza a llegar antes de que termine la frase. Streaming bidireccional, diseñado para los bucles de agentes.

Expresividad a velocidad conversacional

Turbo conserva toda la gama expresiva de Eleven v4. Confirmaciones, escalados y esperas suenan de forma distinta, en lugar de leerse igual.

Una voz en cada turno

Los Clones de Voz Profesionales funcionan igual en ambos modelos, por lo que una misma voz de marca se mantiene coherente desde el primer turno de una llamada hasta el último.

Habla el idioma como un nativo

Úsalo con texto en japonés, español o portugués y la voz lo hablará con fluidez y acento nativo.

Elige entre más de 17.500 voces

Voces de narración Un espacio para narradores. Voces cálidas, con autoridad y coherentes en cada proyecto.

Voces conversacionales Para las conversaciones del día a día necesitas una voz natural y cercana. Nuestras voces conversacionales están creadas para diálogos y podcasts que suenan improvisados.

Voces para redes sociales Voces que cobran vida en contenido breve. Capta la energía y personalidad necesarias para que alguien vea tu TikTok o Reel hasta el final.

Voces de personajes Un catálogo de voces para tu mundo de ficción. Elige entre un reparto dinámico que da vida a tu juego, audiolibro o animación.

Voces educativas Voces fiables y pacientes que guían a estudiantes por temas complejos. Ideales para cursos, tutoriales, simulaciones de formación y guías de cualquier nivel.

Voces para publicidad Voces pulidas y llenas de confianza para impulsar la venta de tu próximo producto. Perfectas para anuncios digitales o locuciones de televisión y radio.

Voces de entretenimiento Desde potentes tráilers de cine hasta voces cómicas pensadas para interpretar, estas voces desbordan personalidad. Para contenido en el que la entonación importa tanto como el mensaje.

Voces multilingües Voces creadas para contenido global. Ritmo natural, expresiones idiomáticas y acentos que conectan con audiencias en todos los mercados.

Hemos ampliado la adopción de Agentforce Voice mediante un control determinista, y nuestros clientes nos dicen de forma constante que confían en él porque cada acción de un agente se basa en información fundamentada y está gobernada, en vez de improvisarse. Una parte clave de esta estrategia es equilibrar ese determinismo con modelos de voz de gran calidad y alta inteligencia emocional. Ahí es precisamente donde vemos que Eleven v4 Turbo eleva el listón, con respuestas más rápidas y naturales que cumplen el nivel que esperan nuestros clientes y les permiten llevar Agentforce Voice a aún más casos de uso.

Ryan Peterson, Vicepresidente sénior de Producto para Agentforce Voice, Salesforce

Al trabajar con cientos de medios para llevar su periodismo al audio, vemos de primera mano cuánto importa la calidad de la voz. Desde que colaboramos con ElevenLabs, muchos de nuestros medios han logrado mayor interacción y tiempos de escucha más largos. Eleven v4 ofrece a los medios más formas de garantizar que esas voces resulten atractivas, familiares e inconfundiblemente propias.

Patrick O'Flaherty, Cofundador de BeyondWords

ElevenLabs v4 aporta un nuevo nivel de naturalidad a las conversaciones por voz. Las voces no solo son más expresivas, sino también más controlables, lo que nos permite crear experiencias de voz más ricas e inmersivas.

Chrys Bader, Cofundador y CEO

La primera vez que lo usé (Eleven v4), era tan limpio y realista que parecía que estaba dirigiendo una sesión con talento en la cabina.

Kyle Gudmundson, Responsable de Música y Audio, Accenture Accelerate

Buscábamos un modelo de voz lo bastante rápido como para sentirse como una conversación real sin sacrificar calidad, y Eleven v4 Turbo es el primero que consigue ambas cosas. Para los workflows de ventas automatizados, este es el momento en que crear deja de parecer un experimento.

Oscar Daniels, Responsable de productos de creación de crédito, Spring Financial

Elige cómo suenaantes de decir una palabra

Cada generación comienza con una voz. Clona una que ya tengas, diseña una a partir de una descripción o corrige cómo se dicen palabras concretas con compatibilidad con IPA.

Smiling person in an orange pleated garment and patterned scarf.
Glowing orange sphere with bright curved streaks against a textured orange background.

Clonar Voz IA

Clona una voz a partir de diez segundos de audio o entrena un Clon de Voz Profesional para lograr una coincidencia casi perfecta.

“Una mujer de unos 28 años, con una voz conversacional brillante y acento estadounidense. Tono amable, juguetón y relajado.”

Diseño de voz

Describe una voz en una frase y genérala, sin sesiones de grabación ni procesos de casting.

OAuthou-auth
Hülkenbergjul-ken-berg
Reykjavikreik-ia-vik
YAMLiam-ul

Diccionario de pronunciación

Define cómo se pronuncian nombres, acrónimos y términos técnicos. Configúralo una vez y todas las generaciones lo usarán.

Empieza a crear gratisCambia a un plan superior cuando necesites más

  • Empieza ahora

    0 $/mes

    Empieza gratis

    El plan gratuito incluye:

    • 10.000 créditos al mes
    • Uso personal
    • No necesitas tarjeta de crédito
  • Planes Premium

    6 $/mes

    Ver planes

    Los planes de pago incluyen:

    • Más de 30.000 créditos al mes
    • Clonación de voz profesional
    • Límites más altos y generación más rápida
  • Enterprise

    Precios personalizados

    Contacta con nosotros

    El plan Enterprise incluye:

    • Mayor volumen
    • SSO personalizado
    • Soporte prioritario

Disponible a través de la APILleva Eleven v4 a tu app

Crea experiencias en tiempo real y agentes de voz con Eleven v4 Turbo, todo a través de ElevenAPI.

Accede a la API de Eleven v4 y Eleven v4 Turbo

Añade voz expresiva a cualquier producto con nuestra API REST, rutas de streaming o SDK para TypeScript y Python.

  • Cambia de modelo con un único model_id
  • Envía texto por streaming y recibe audio en tiempo real
  • Mantén la continuidad en generaciones de larga duración
import { ElevenLabsClient, play } from '@elevenlabs/elevenlabs-js';
import 'dotenv/config';

const elevenlabs = new ElevenLabsClient({
  apiKey: process.env.ELEVENLABS_API_KEY
});
const audio = await elevenlabs.textToSpeech.convert(
  's3TPKV1kjDlVtZbl4Ksh', // "George" - browse voices at elevenlabs.io/app/voice-library
  {
    text: 'The first move is what sets everything in motion.',
    modelId: 'eleven_v4',
  }
);
play(audio);

Preguntas frecuentes

Crea con el audio IA de la más alta calidad