API de Dubbing v2

O Dubbing v2 já está disponível pela API. Ele traduz áudio e vídeo para mais de 90 idiomas, preservando a voz, o tom e o ritmo de cada pessoa que fala.

A nova API baseada em projetos mantém transcrições e traduções de origem como JSON editável. Crie um projeto a partir de um arquivo ou URL, adicione um ou mais idiomas de destino, edite segmentos individuais da transcrição ou traduções e, depois, gere novamente apenas as regiões que foram alteradas. Siga o guia rápido de Dubbing para criar sua primeira dublagem.

ElevenAgents

  • Filtros de guardrails de conversa: Listar conversas adiciona os parâmetros de consulta opcionais guardrail_types (GuardrailType[]) e custom_guardrail_names (matriz de strings). A hierarquia de conversas existente agora pode ser filtrada com o parâmetro opcional parent_conversation_id (string).
  • Status de divergência de ramificação: Listar ramificações do agente adiciona o parâmetro opcional include_commit_status (booleano, padrão false). Quando ativado, os resumos das ramificações incluem os campos anuláveis commits_ahead, commits_behind e merged_into_branch_id.
  • Controles de conversa e ferramentas: As substituições de cliente agora oferecem suporte a max_duration_seconds e pronunciation_dictionary_locators. A configuração do servidor MCP adiciona request_meta para transmitir valores MCP _meta a chamadas de ferramentas, e os tempos limite das ferramentas de webhook agora aceitam até 300 segundos.
  • Uso de análise pós-chamada: A cobrança de conversas adiciona uma divisão de analysis com totais acumulados por recurso e snapshots de execução. As mensagens da transcrição adicionam triggered_guardrails, e os turnos de conversa adicionam producing_llm opcional.

Vozes

  • Filtros de busca de vozes: Obter todas as vozes v2 adiciona os parâmetros de consulta opcionais gender, age, language, accent, use_cases, min_notice_period_days, include_custom_rates, include_live_moderated e high_quality.

Lançamentos de SDKs

SDK JavaScript

  • v2.63.0 - Adicionadas opções de Speech to Text em tempo real para idiomas secundários, detecção de idioma e entidades, filtragem de áudio de fundo, registros e autenticação com token de uso único. Adicionados eventos de transcrição final, entidade e solicitação inválida; corrigidos o envio de termos não aceitos, parâmetros audio_format duplicados e limites VAD inclusivos.
  • v2.62.0 - Adicionados métodos de atualização em massa de transcrições de Dubbing e DubbingRegenerateResponse; adicionados filtros de guardrail de conversa, status de commit de ramificações de agente, alertas de agente e suporte a MCP requestMeta. A criação de idioma de destino não aceita mais modelId.
  • v2.61.0 - Adicionados filtragem de hierarquia de conversas, cobrança de análise pós-chamada, metadados de guardrails acionados, detalhes de conflitos de mesclagem de ramificações, ocultação de entrada DTMF e uploads de transcrições de Dubbing. Removidos os tipos exportados de sessão em tempo real da OpenAI e as variantes de resultado de ferramenta run_subagent_*.

SDK Python

  • v2.63.0 - Adicionadas opções de Speech to Text em tempo real para idiomas secundários, detecção de idioma e entidades, filtragem de áudio de fundo, registros e autenticação com token de uso único. Adicionados eventos de transcrição final, entidade e solicitação inválida; corrigido o envio de termos não aceitos e agora são rejeitadas conexões sem uma chave de API ou token.
  • v2.62.0 - Adicionados métodos update_segments de Dubbing e DubbingRegenerateResponse; adicionados suporte a guardrail_types, custom_guardrail_names, include_commit_status e MCP request_meta. As atualizações de segmentos de Dubbing agora usam modelos de corpo de solicitação, e a criação de idioma de destino não aceita mais model_id.
  • v2.61.0 - Adicionados parent_conversation_id, cobrança de análise, metadados de guardrails acionados, conflitos de mesclagem de ramificações, ocultação de entrada DTMF e uploads de transcrições de Dubbing. Removidos os tipos de sessão em tempo real da OpenAI e os modelos de resultado run_subagent_*.

SDK Android

  • v0.12.1 - Corrigido o relato de desconexões intencionais de sessões apenas de texto como ConversationStatus.ERROR.
  • v0.12.0 - Adicionado ConversationConfig.useMediaStream para rotear o áudio da conversa pelo fluxo de mídia do Android. Fechamentos normais remotos de WebSocket agora informam DisconnectionDetails.Agent, enquanto fechamentos iniciados localmente informam DisconnectionDetails.User.

Servidor MCP

  • v0.12.2 - Corrigido um problema de travessia de caminho.

API

Novos endpoints

Dubbing

  • Atualizar segmentos de origem em lote - PATCH /v1/dubbing/project/{project_id}/transcript/segments
    • Requer DubbingBulkSegmentUpdateRequest
    • Atualiza atomicamente o texto, a pessoa que fala ou a temporização dos segmentos de origem
    • Retorna DubbingBulkSourceSegmentUpdateResponse com os segments e a revision atualizados
  • Atualizar segmentos de destino em lote - PATCH /v1/dubbing/project/{project_id}/language/{language_id}/transcript/segments
    • Requer DubbingBulkTargetSegmentUpdateRequest
    • Atualiza atomicamente as traduções de vários segmentos de destino
    • Retorna DubbingBulkTargetSegmentUpdateResponse com os segments e a revision atualizados

Endpoints atualizados

ElevenAgents

  • Listar conversas - GET /v1/convai/conversations
    • Adicionado parent_conversation_id opcional (string)
    • Adicionados guardrail_types repetível opcional (GuardrailType[]) e custom_guardrail_names opcional (matriz de strings)
  • Listar ramificações do agente - GET /v1/convai/agents/{agent_id}/branches
    • Adicionado include_commit_status opcional (booleano, padrão false)
    • Os resumos das ramificações adicionam commits_ahead (inteiro), commits_behind (inteiro) e merged_into_branch_id (string) anuláveis

Vozes

  • Obter todas as vozes v2 - GET /v2/voices
    • Adicionados filtros opcionais gender, age e accent (string)
    • Adicionados filtros opcionais language e use_cases (matriz de strings)
    • Adicionados filtros opcionais min_notice_period_days (inteiro), include_custom_rates, include_live_moderated e high_quality (booleano)

Alterações de esquema

ElevenAgents

  • Os esquemas de substituição do cliente adicionam max_duration_seconds (inteiro) e pronunciation_dictionary_locators (matriz)
  • Os esquemas de entrada e saída do servidor MCP adicionam mapas request_meta
  • As configurações da plataforma de agentes adicionam alerting; a detecção de idioma adiciona only_at_conversation_start (booleano)
  • AnalysisCharging.last_run agora é obrigatório e não anulável; os totais acumulados adicionam runs obrigatório (inteiro)
  • As respostas de blocos RAG agora exigem content_format e document_type