Modelos
Descubre cómo elegir el modelo adecuado para tu caso de uso
ElevenAgents ofrece una interfaz unificada para conectar tu agente a varios modelos y proveedores, con flexibilidad, fiabilidad y optimización de costes.
Características principales
- Acceso unificado: Cambia entre proveedores y modelos con cambios mínimos en el código
- Alta fiabilidad: Cambia automáticamente de un proveedor a otro si uno falla
- Control del gasto: Supervisa tus gastos en los distintos modelos
Modelos compatibles
Actualmente, los siguientes modelos son compatibles de forma nativa y se pueden configurar en los ajustes del agente:
Los precios suelen indicarse en USD por 1 millón de tokens, salvo que se especifique lo contrario. Un token es una unidad fundamental de datos de texto para los LLM, aproximadamente equivalente a 4 caracteres de media.
LLM personalizado
Puedes usar tu propio LLM personalizado especificando la ruta de API a la que debemos enviar solicitudes y proporcionando credenciales mediante nuestro almacenamiento seguro de secretos. Más información sobre la integración de LLM personalizados.
Algunos modelos no están disponibles cuando la residencia de datos en la UE está activada. Consulta RGPD y residencia de datos para conocer los detalles de disponibilidad.
Elegir un modelo
Para seleccionar el LLM más adecuado para tu aplicación, debes tener en cuenta varios factores:
- Complejidad de la tarea: Evalúa los modelos con tareas representativas de tu aplicación
- Requisitos de latencia: Para conversaciones de voz en directo, elige un modelo de baja latencia y mide el tiempo de respuesta con tus prompts y herramientas
- Tamaño de la ventana de contexto: Si tu aplicación necesita procesar, comprender o recordar información de conversaciones largas o documentos extensos, selecciona modelos con ventanas de contexto más grandes
- Rentabilidad: Equilibra el rendimiento y las funciones deseadas con tu presupuesto. Los precios de los LLM pueden variar considerablemente, así que analiza la estructura de precios (tokens de entrada, salida y caché) en relación con tus patrones de uso previstos
- Cumplimiento de HIPAA: Si tu aplicación incluye información sanitaria protegida (PHI), es fundamental usar un LLM designado como compatible con HIPAA y asegurarte de que todo tu proceso de gestión de datos cumpla las normas reguladoras
El tamaño máximo del prompt del sistema es de 2 MB e incluye las instrucciones de tu agente, el contenido de la base de conocimientos y otro contexto a nivel de sistema.
Configuración del modelo
Temperatura
La temperatura controla la aleatoriedad de las respuestas del modelo. Los valores más bajos producen resultados más coherentes y centrados, mientras que los valores más altos aumentan la creatividad y la variación.
- Baja (0.0-0.3): Respuestas deterministas y coherentes para interacciones estructuradas
- Media (0.4-0.7): Equilibrio entre creatividad y coherencia
- Alta (0.8-1.0): Respuestas creativas y variadas para conversaciones dinámicas
Configuración de LLM de respaldo
Configura LLM de respaldo para garantizar la continuidad de la conversación cuando el LLM principal falle o deje de estar disponible.
Opciones de configuración:
- Predeterminada: Usa la secuencia de respaldo recomendada por ElevenLabs
- Personalizada: Define tu propia secuencia en cascada de modelos de respaldo
- Desactivada: Sin respaldo (muy desaconsejado para producción)
Desactivar los LLM de respaldo significa que las conversaciones terminarán abruptamente si tu LLM principal falla o deja de estar disponible. Esto está muy desaconsejado para uso en producción.
Más información sobre las cascadas de LLM.
Razonamiento
El razonamiento ayuda a los agentes a gestionar decisiones complejas, como elegir entre herramientas, aplicar políticas o completar workflows de varios pasos. Según el modelo, puedes controlar cuánto razonamiento realiza mediante un presupuesto de pensamiento o un nivel de esfuerzo de razonamiento.
Presupuesto de pensamiento
Establece el número máximo de tokens de razonamiento con el control deslizante numérico. Los presupuestos más altos pueden aumentar el tiempo de respuesta. Establece el presupuesto en 0 para desactivar el pensamiento cuando el modelo lo permita.
Esfuerzo de razonamiento
El esfuerzo de razonamiento controla cuánto razonamiento realiza el modelo antes de responder. Los niveles disponibles dependen del modelo seleccionado.
Empieza con un presupuesto o esfuerzo más bajo para agentes de voz en directo, ya que pensar más puede retrasar los turnos de conversación. Auméntalo en pasos del workflow que requieran decisiones más complejas.
Resumen de razonamiento
Activa el resumen de razonamiento para registrar el razonamiento devuelto por el modelo al depurar respuestas, llamadas a herramientas o rutas del workflow. Activa Resumen de razonamiento en los ajustes de LLM del agente o configura enable_reasoning_summary mediante la API. Esta opción está desactivada de forma predeterminada.
Para rutas de API personalizadas, consulta cómo solicita y almacena ElevenLabs el razonamiento.
El contenido de razonamiento está sujeto a los ajustes de retención y eliminación de PII. Puedes acceder a él mediante los siguientes canales:
Con el modo de retención cero, ElevenLabs **no almacena contenido de razonamiento **. Se entrega únicamente a clientes de chat y webhooks posteriores a la llamada.
Limitaciones
- Solicitar un resumen de razonamiento puede aumentar la latencia de respuesta. Pruébalo antes de activarlo en agentes de voz sensibles a la latencia.
- Los proveedores pueden devolver un resumen, texto de pensamiento, deltas de razonamiento sin procesar o contenido no mostrable.
Entender los precios
- Tokens: El uso de LLM suele facturarse según el número de tokens procesados. Como referencia general para texto en inglés, 100 tokens equivalen aproximadamente a 75 palabras
- Precios de entrada frente a salida: Los proveedores suelen diferenciar los precios de los tokens de entrada (los datos que envías al modelo) y los tokens de salida (los datos que genera el modelo como respuesta)
- Precios de caché:
input_cache_read: Se refiere al coste asociado a recuperar de una caché datos de entrada procesados previamente. Usar datos en caché puede reducir costes si se procesan varias veces entradas idénticasinput_cache_write: Es el coste asociado a almacenar datos de entrada en una caché. Algunos proveedores de LLM pueden cobrar por esta operación
- Los precios indicados en este documento son por 1 millón de tokens y se basan en la información disponible en el momento de redactarlo. Los proveedores de LLM pueden modificar estos precios
Para conocer las capacidades actuales de los modelos, los precios y las condiciones de servicio, consulta la documentación del proveedor.
Cumplimiento de HIPAA
Algunos LLM disponibles en nuestra plataforma pueden ser adecuados para su uso en entornos que requieren cumplimiento de HIPAA. Consulta la documentación sobre cumplimiento de HIPAA para obtener más información.
Recursos relacionados
Modelos alojados por ElevenLabs
ElevenLabs ofrece acceso a diversos modelos de IA, incluidos determinados modelos de terceros alojados por ElevenLabs.
Cuando un modelo se designa como «Alojado por ElevenLabs», se implementa y opera en infraestructura gestionada por ElevenLabs. Actualmente, estos modelos están alojados en Estados Unidos o en la región de tu implementación empresarial.
Cómo identificar modelos alojados por ElevenLabs
Los modelos alojados por ElevenLabs están claramente etiquetados en la interfaz de ElevenLabs. Busca la designación «Alojado por ElevenLabs» al explorar o seleccionar modelos.
Cómo se gestionan tus datos
En el caso de los modelos alojados por ElevenLabs, las solicitudes se procesan en infraestructura gestionada por ElevenLabs. Esto significa que el proveedor original del modelo no recibe, accede ni procesa las entradas y salidas enviadas a través de ElevenLabs.
Al alojar estos modelos, ElevenLabs puede ofrecer una experiencia coherente y mantener el control sobre la infraestructura utilizada para atender las solicitudes de los modelos.
Preguntas frecuentes
¿Dónde se alojan los modelos autoalojados?
Los modelos alojados por ElevenLabs se alojan actualmente en infraestructura situada en Estados Unidos o en la región de tu implementación empresarial.
¿El proveedor original del modelo accede a mis datos o a los metadatos de mi uso?
En los modelos alojados por ElevenLabs, el desarrollador original del modelo nunca recibe tus entradas ni salidas y no tiene acceso a los datos de la implementación que las procesa.
¿Cómo sé si un modelo está alojado por ElevenLabs?
Los modelos alojados por ElevenLabs se identifican claramente en la interfaz de ElevenLabs con la designación «Alojado por ElevenLabs».