Presentamos Music v2

Music v2 ya está disponible a través de la API de ElevenLabs. Establece model_id en music_v2 en Generar música, Transmitir música, Generar música detallada y Subir música para usar el nuevo modelo. Music v2 introduce planes de composición basados en bloques creados a partir de segmentos GenerationChunk y AudioRefChunk, lo que te ofrece un control más preciso de la estructura, el ritmo y los arreglos que el flujo music_v1 basado en prompts.

Usa planes de composición music_v2 en solicitudes de generación y subida, o genera primero un plan mediante la ruta de planes de composición. Los cuerpos de solicitud y respuesta aceptan formatos de plan v1 y v2, así que puedes migrar ruta por ruta. MusicPrompt sigue disponible solo para music_v1.

  • Marcas de tiempo de subida: Subir música acepta with_timestamps opcional; las respuestas pueden incluir words_timestamps.

ElevenAgents

  • Ejecutar evaluación de conversación: Se añadió la ruta Ejecutar evaluación de conversación (POST /v1/convai/conversations/{conversation_id}/analysis/evaluations/run) para volver a ejecutar un único criterio de evaluación en una conversación completada mediante RunConversationEvaluationsRequest.
  • Comportamiento de entrada del workflow: Los nodos de agente de anulación del workflow añaden entry_behavior opcional (generate_immediately, wait_for_user, auto) para controlar si el subagente habla primero o espera la entrada del usuario.
  • Herramienta de sistema para finalizar procedimientos: Se añadió la configuración de herramienta de sistema end_procedure con los estados de error correspondientes. La herramienta start_procedure añade already_active a sus estados de error.
  • Anulaciones de TTS en transferencias: AgentTransfer, los nodos de agente independiente del workflow y los resultados correctos de la herramienta transfer_to_agent añaden preserve_client_tts_overrides opcional (booleano) para conservar las anulaciones de TTS del cliente tras una transferencia.
  • Enumeración de presupuesto de interacción: InteractionBudget elimina async y añade 5_minutes, 10_minutes y 1_hour. Actualiza cualquier configuración o enumeración de SDK que siga haciendo referencia a async.
  • Selección de modelo de medidas de seguridad personalizadas: La configuración de medidas de seguridad personalizadas añade model opcional con variantes de Gemini, Claude y GPT. La configuración también añade history_message_count opcional (entero).
  • Filtros de lista de números de teléfono: Listar números de teléfono añade los parámetros de consulta opcionales provider, agent_id y branch_id para filtrar números importados.
  • Filtrado de cuentas de WhatsApp: Listar cuentas de WhatsApp añade el parámetro de consulta opcional agent_id para filtrar cuentas por agente asignado.
  • Filtros de intervalo temporal de temas: Obtener temas de conversaciones del agente añade los parámetros de consulta opcionales from_unix_secs y to_unix_secs para delimitar los resultados de descubrimiento de temas.
  • Configuración de códecs SIP: Los modelos de solicitud y respuesta de troncales SIP salientes añaden enabled_codecs opcional (enumeración MediaCodec).
  • Tipos de herramienta de memoria: Se añadieron los esquemas LoadableMemoryEntry y LoadMemoryEntryToolErrorStatus para la gestión de errores de herramientas de memoria.
  • Límites de lotes de pruebas de agentes: Los esquemas de solicitud para adjuntar, ejecutar y reenviar pruebas de agentes elevan el máximo de pruebas adjuntas de 1000 a 5000.
  • Compatibilidad con etiquetas de fonemas: La configuración de TTS de agentes añade enable_phoneme_tags opcional (booleano) para activar de forma opcional el manejo de fonemas SSML V3.
  • Anulaciones de omisión del esquema de matrices: Las propiedades del esquema JSON de matrices añaden is_omitted opcional (mutuamente excluyente con otras fuentes de valores). ConstantSchemaOverride puede usar valores constantes de matriz.
  • Contexto de error de transferencia: Las cargas útiles de error de transferencia a número pueden incluir agent_message opcional (cadena).

Espacios de trabajo

  • Actualizaciones de claves de API de cuentas de servicio: Actualizar clave de API de cuenta de servicio ya no requiere un cuerpo de solicitud. Los campos editables admiten actualizaciones parciales mediante no_update y name que admite valores nulos, incluidos permissions y character_limit.
  • Agrupación de uso por zona horaria: Las solicitudes de uso del espacio de trabajo por producto a lo largo del tiempo añaden time_zone opcional (cadena de zona horaria IANA) con reglas aclaradas para los bloques de interval_seconds.
  • Filtro de origen del historial: Los filtros source de lista y detalle del historial añaden Flows.

ElevenCreative Studio

  • Referencias de voz del proyecto: Los modelos de proyecto, los nodos TTS de capítulos, las listas de voces y las estadísticas de voz pasan a usar project_voice_ref_id como campo canónico de voz. Los anteriores campos voice_id permanecen en las respuestas como réplicas de solo lectura obsoletas por compatibilidad.

Voz a Texto

  • Diarización con biblioteca de hablantes: Convertir voz a texto añade use_speaker_library opcional (booleano, false de forma predeterminada) para la diarización de transcripciones por lotes.

Voces

  • Ordenación de voces compartidas: El parámetro de consulta sort de Listar voces compartidas incorpora una enumeración explícita, el valor predeterminado created_date y una descripción actualizada.

Lanzamientos de SDK

SDK de JavaScript

  • v2.53.0 - Regenerado a partir del esquema OpenAPI más reciente con compatibilidad para volver a ejecutar evaluaciones de conversación, uniones de planes de composición de music v2, entry_behavior de workflow, filtros de lista de números de teléfono y WhatsApp, parámetros de intervalo temporal de temas, actualizaciones del esquema de alertas, campos project_voice_ref_id de Studio y límites ampliados para lotes de pruebas de agentes.

SDK de Python

  • v2.53.0 - Regenerado a partir del esquema OpenAPI más reciente con compatibilidad para volver a ejecutar evaluaciones de conversación, planes de composición de music v2, comportamiento de entrada de workflow y herramientas para finalizar procedimientos, parámetros de filtrado de telefonía, modelos de actualización parcial de alertas y cuentas de servicio, y campos de referencia de voz de Studio.

Paquetes

SDK de iOS

  • v3.2.1 - Se añadió compatibilidad con residencia de datos en Singapur y se habilitó singlePeerConnection para sesiones WebRTC.

API

Nuevas rutas

ElevenAgents

  • Ejecutar evaluación de conversación - POST /v1/convai/conversations/{conversation_id}/analysis/evaluations/run
    • El cuerpo de la solicitud usa RunConversationEvaluationsRequest para volver a ejecutar un único criterio de evaluación

Rutas actualizadas

ElevenAgents

Música

Voz a Texto

  • Convertir voz a texto - POST /v1/speech-to-text
    • Se añadió el parámetro de consulta opcional use_speaker_library (booleano, false de forma predeterminada)

Voces

  • Listar voces compartidas - GET /v1/shared-voices
    • El parámetro de consulta sort ahora usa una enumeración explícita con created_date como valor predeterminado

Cambios en los esquemas

ElevenAgents

  • Nodos de agente de anulación del workflow
    • Se añadió la enumeración opcional entry_behavior (generate_immediately, wait_for_user, auto)
  • Herramientas de sistema
    • Se añadieron la configuración de herramienta end_procedure y estados de error
  • Esquemas de transferencia e interacción
    • Se añadió preserve_client_tts_overrides opcional en las transferencias y resultados de herramientas de transferencia
    • InteractionBudget elimina async; añade 5_minutes, 10_minutes, 1_hour
  • Medidas de seguridad y TTS
    • Las medidas de seguridad personalizadas añaden model e history_message_count opcionales
    • La configuración de TTS de agentes añade enable_phoneme_tags opcional
  • Telefonía
    • Los modelos de troncales SIP añaden enabled_codecs opcional (enumeración MediaCodec)
  • Herramientas de memoria y código
    • Se añadieron LoadableMemoryEntry y LoadMemoryEntryToolErrorStatus
  • Pruebas de agentes
    • Se elevaron los límites de pruebas adjuntas de 1000 a 5000 en las solicitudes de ejecución y reenvío
  • Propiedades del esquema JSON de herramientas
    • Las propiedades de matriz añaden is_omitted opcional

Espacios de trabajo

  • Cuentas de servicio
    • PATCH de clave de API admite actualizaciones parciales con valores centinela no_update
  • Uso e historial
    • El uso por producto a lo largo del tiempo añade time_zone opcional
    • Los filtros source del historial añaden Flows

Música

  • Planes de composición
    • Se añadieron CompositionPlan, GenerationChunk y AudioRefChunk basados en bloques para music_v2
    • Los cuerpos de solicitud y respuesta aceptan formatos de plan v1 o v2 mediante anyOf

ElevenCreative Studio

  • Modelos de voz de proyecto
    • Se añadió project_voice_ref_id como referencia de voz canónica
    • Se conservan en las respuestas las réplicas voice_id obsoletas de solo lectura