Apresentamos o Music v2

O Music v2 agora está disponível pela API da ElevenLabs. Defina model_id como music_v2 em Gerar música, Transmitir música, Gerar música detalhada e Fazer upload de música para usar o novo modelo. O Music v2 apresenta planos de composição baseados em chunks, criados a partir dos segmentos GenerationChunk e AudioRefChunk, proporcionando controle mais preciso sobre estrutura, ritmo e arranjo do que o fluxo music_v1 baseado em prompt.

Use planos de composição music_v2 em solicitações de geração e upload ou gere primeiro um plano pelo endpoint de plano de composição. Os corpos de solicitação e resposta aceitam formatos de plano v1 ou v2, para que você possa migrar endpoint por endpoint. MusicPrompt continua disponível apenas para music_v1.

  • Timestamps no upload: Fazer upload de música aceita with_timestamps opcional; as respostas podem incluir words_timestamps.

ElevenAgents

  • Executar avaliação de conversa: Adicionado o endpoint Executar avaliação de conversa (POST /v1/convai/conversations/{conversation_id}/analysis/evaluations/run) para executar novamente um único critério de avaliação em uma conversa concluída usando RunConversationEvaluationsRequest.
  • Comportamento de entrada no workflow: Os nós de agente substituto do workflow adicionam entry_behavior opcional (generate_immediately, wait_for_user, auto) para controlar se o subagente fala primeiro ou aguarda a entrada do usuário.
  • Ferramenta de sistema para encerrar procedimento: Adicionada a configuração da ferramenta de sistema end_procedure com status de erro correspondentes. A ferramenta start_procedure adiciona already_active aos seus status de erro.
  • Substituições de TTS na transferência: AgentTransfer, nós de agente independente do workflow e resultados bem-sucedidos da ferramenta transfer_to_agent adicionam preserve_client_tts_overrides opcional (booleano) para manter as substituições de TTS no cliente após uma transferência.
  • Enum de orçamento de interação: InteractionBudget remove async e adiciona 5_minutes, 10_minutes e 1_hour. Atualize configurações ou enums de SDK que ainda façam referência a async.
  • Seleção de modelo de guardrail personalizado: A configuração de guardrail personalizado adiciona model opcional com variantes Gemini, Claude e GPT. A configuração de guardrail também adiciona history_message_count opcional (inteiro).
  • Filtros de lista de números de telefone: Listar números de telefone adiciona os parâmetros de consulta provider, agent_id e branch_id opcionais para filtrar números importados.
  • Filtragem de contas do WhatsApp: Listar contas do WhatsApp adiciona o parâmetro de consulta agent_id opcional para filtrar contas por agente atribuído.
  • Filtros de intervalo de tempo de tópicos: Obter tópicos de conversa do agente adiciona os parâmetros de consulta from_unix_secs e to_unix_secs opcionais para delimitar os resultados de descoberta de tópicos.
  • Configuração de codec SIP: Os modelos de solicitação e resposta do tronco SIP de saída adicionam enabled_codecs opcional (enum MediaCodec).
  • Tipos de ferramenta de memória: Adicionados os schemas LoadableMemoryEntry e LoadMemoryEntryToolErrorStatus para tratamento de erros da ferramenta de memória.
  • Limites de lote de testes de agente: Os schemas de solicitação para anexar, executar e reenviar testes de agente aumentam o máximo de testes anexados de 1000 para 5000.
  • Suporte a tags de fonemas: As configurações de TTS do agente adicionam enable_phoneme_tags opcional (booleano) para ativar o tratamento de fonemas SSML do V3.
  • Substituições de omissão no schema de arrays: As propriedades do schema JSON de array adicionam is_omitted opcional (mutuamente exclusivo com outras fontes de valor). ConstantSchemaOverride pode usar valores constantes de array.
  • Contexto de erro de transferência: As cargas úteis de erro de transferência para número podem incluir agent_message opcional (string).

Workspaces

  • Atualizações de chave de API de conta de serviço: Atualizar chave de API de conta de serviço não exige mais um corpo de solicitação. Os campos de edição oferecem suporte a atualizações parciais por meio de no_update e name que aceita nulo, incluindo permissions e character_limit.
  • Agrupamento por fuso horário de uso: As solicitações de uso do workspace por produto ao longo do tempo adicionam time_zone opcional (string de fuso horário IANA) com regras esclarecidas para os buckets de interval_seconds.
  • Filtro de origem do histórico: Os filtros source de lista e detalhes do histórico adicionam Flows.

ElevenCreative Studio

  • Referências de voz do projeto: Modelos de projeto, nós de TTS de capítulo, listas de vozes e estatísticas de voz passam a usar project_voice_ref_id como o campo de voz canônico. Os antigos campos voice_id permanecem nas respostas como espelhos obsoletos e somente leitura, para compatibilidade.

Speech to Text

  • Diarização com biblioteca de locutores: Converter fala em texto adiciona use_speaker_library opcional (booleano, padrão false) para diarização de transcrições em lote.

Vozes

  • Ordenação de vozes compartilhadas: O parâmetro de consulta sort de Listar vozes compartilhadas recebe um enum explícito, o padrão created_date e uma descrição atualizada.

Lançamentos de SDKs

SDK JavaScript

  • v2.53.0 - Regenerado a partir do schema OpenAPI mais recente, com suporte para reexecução de avaliação de conversa, uniões de plano de composição do music v2, entry_behavior de workflow, filtros de lista de números de telefone e WhatsApp, parâmetros de intervalo de tempo de tópicos, atualizações de schema de alertas, campos project_voice_ref_id do Studio e limites expandidos de lotes de testes de agentes.

SDK Python

  • v2.53.0 - Regenerado a partir do schema OpenAPI mais recente, com suporte para reexecução de avaliação de conversa, planos de composição do music v2, comportamento de entrada no workflow e ferramentas de encerramento de procedimento, parâmetros de filtro de telefonia, modelos de atualização parcial de alertas e contas de serviço e campos de referência de voz do Studio.

Pacotes

SDK iOS

  • v3.2.1 - Adicionado suporte à residência de dados em Singapura e ativado singlePeerConnection para sessões WebRTC.

API

Novos endpoints

ElevenAgents

  • Executar avaliação de conversa - POST /v1/convai/conversations/{conversation_id}/analysis/evaluations/run
    • O corpo da solicitação usa RunConversationEvaluationsRequest para executar novamente um único critério de avaliação

Endpoints atualizados

ElevenAgents

Música

Speech to Text

  • Converter fala em texto - POST /v1/speech-to-text
    • Adicionado o parâmetro de consulta use_speaker_library opcional (booleano, padrão false)

Vozes

  • Listar vozes compartilhadas - GET /v1/shared-voices
    • O parâmetro de consulta sort agora usa um enum explícito com created_date como padrão

Alterações no schema

ElevenAgents

  • Nós de agente substituto do workflow
    • Adicionado enum entry_behavior opcional (generate_immediately, wait_for_user, auto)
  • Ferramentas de sistema
    • Adicionada configuração da ferramenta end_procedure e status de erro
  • Schemas de transferência e interação
    • Adicionado preserve_client_tts_overrides opcional em transferências e resultados da ferramenta de transferência
    • InteractionBudget remove async; adiciona 5_minutes, 10_minutes, 1_hour
  • Guardrails e TTS
    • Guardrails personalizados adicionam model e history_message_count opcionais
    • As configurações de TTS do agente adicionam enable_phoneme_tags opcional
  • Telefonia
    • Os modelos de tronco SIP adicionam enabled_codecs opcional (enum MediaCodec)
  • Ferramentas de memória e código
    • Adicionados LoadableMemoryEntry e LoadMemoryEntryToolErrorStatus
  • Testes de agentes
    • Aumentados os limites de testes anexados de 1000 para 5000 em solicitações de execução e reenvio
  • Propriedades do schema JSON de ferramentas
    • As propriedades de array adicionam is_omitted opcional

Workspaces

  • Contas de serviço
    • PATCH de chave de API oferece suporte a atualizações parciais com sentinelas no_update
  • Uso e histórico
    • Uso por produto ao longo do tempo adiciona time_zone opcional
    • Filtros source do histórico adicionam Flows

Música

  • Planos de composição
    • Adicionados CompositionPlan, GenerationChunk e AudioRefChunk baseados em chunks para music_v2
    • Os corpos de solicitação e resposta aceitam formatos de plano v1 ou v2 via anyOf

ElevenCreative Studio

  • Modelos de voz do projeto
    • Adicionado project_voice_ref_id como referência de voz canônica
    • Espelhos voice_id obsoletos e somente leitura são mantidos nas respostas