Scribe v2

Lançamos o Scribe v2, o novo modelo de transcrição de última geração. Saiba mais sobre o Scribe v2 na documentação.

Plataforma de agentes

  • Suporte a fuso horário para agendamento de chamadas em lote: Agora você pode selecionar um fuso horário ao agendar chamadas em lote. O horário agendado é convertido para UTC com base no fuso horário escolhido. Por padrão, o fuso horário do seu navegador é selecionado automaticamente, e a validação impede o agendamento de chamadas para horários que já passaram no fuso selecionado. Assim, fica mais fácil agendar chamadas de saída no horário certo para os fusos horários dos destinatários.
  • URL do arquivo de origem da Base de conhecimento: Adicionado um novo endpoint para recuperar a URL do arquivo de origem de documentos da base de conhecimento, permitindo acesso direto aos arquivos enviados.
  • Tempo limite da cascata de fallback de LLM: Adicionada a opção de configuração cascade_timeout_seconds para configurações de LLM de backup do agente, permitindo controlar quanto tempo aguardar antes de passar para a próxima LLM. O padrão é de 8 segundos, com intervalo permitido de 2 a 15 segundos.
  • Mensagens geradas por LLM em timeout suave: Adicionada a opção use_llm_generated_message à configuração de timeout suave. Quando ativada, o agente gerará uma mensagem contextual usando a LLM, em vez de usar uma mensagem predefinida quando o timeout suave for acionado.
  • Navegação por pastas da Base de conhecimento: As respostas de documentos da Base de conhecimento agora incluem o campo folder_path, que mostra os segmentos do caminho da raiz até a pasta pai, facilitando o entendimento da hierarquia de documentos.
  • Filtragem de conversas por origem de início: O endpoint Obter conversas agora aceita filtragem pelo parâmetro de consulta conversation_initiation_source.

Dublagem

  • Novo endpoint de formato de transcrição: Adicionado o endpoint GET /v1/dubbing/{dubbing_id}/transcripts/{language_code}/format/{format_type}, com suporte aos formatos de saída srt, webvtt e json. O endpoint anterior GET /v1/dubbing/{dubbing_id}/transcript/{language_code} foi descontinuado.
  • Nome de arquivo obrigatório para arquivos dublados: Os modelos de arquivo da Base de conhecimento agora exigem um campo filename.

Speech to Text

  • Detecção de entidades: Adicionada a opção entity_detection às solicitações de Speech-to-Text. Aceita 'all', strings de tipos de entidade específicos ou um array de tipos de entidade. As entidades detectadas são retornadas em um novo campo de resposta entities, usando o esquema DetectedEntity.
  • Prompting de termos-chave: Adicionado o parâmetro de array keyterms às solicitações de Speech-to-Text para orientar a transcrição em direção a termos ou frases específicos.

Lançamentos de SDKs

SDK Python

  • v2.29.0 - Adicionadas detecção de entidades e prompting de termos-chave para Speech-to-Text, configuração de timeout da cascata de LLM, geração de mensagens de LLM em timeout suave e suporte a fuso horário para chamadas em lote
  • v2.28.0 - Adicionados campos de versionamento de agentes, IDs de coleções de voz, melhorias em chamadas em lote e rótulos de números de telefone

SDK JavaScript

  • v2.30.0 - Adicionadas detecção de entidades e prompting de termos-chave para Speech-to-Text, configuração de timeout da cascata de LLM, geração de mensagens de LLM em timeout suave e suporte a fuso horário para chamadas em lote
  • v2.29.0 - Adicionados campos de versionamento de agentes, IDs de coleções de voz, melhorias em chamadas em lote e rótulos de números de telefone

Servidor MCP

  • v0.9.1 - Adicionado suporte à extensão Gemini, corrigido o tratamento de caminhos para output_directory não absoluto e base_path ausente

API

Novos endpoints

Endpoints descontinuados

  • GET /v1/dubbing/{dubbing_id}/transcript/{language_code} - Use o novo endpoint específico para formato

Endpoints atualizados

Plataforma de agentes

Base de conhecimento

  • Listar documentos da base de conhecimento
    • Removido o parâmetro de consulta descontinuado use_typesense
    • Adicionado folder_path (array de segmentos de caminho) aos modelos de resposta de documentos
    • Adicionado filename (string, obrigatório) aos modelos de arquivo da base de conhecimento

Speech to Text

  • Transcrever fala
    • Adicionado keyterms (array de strings, opcional) para orientar a transcrição em direção a termos específicos
    • Adicionado entity_detection (string, array ou 'all', opcional) para detectar entidades no texto transcrito
    • Adicionado entities (array de DetectedEntity, opcional) ao modelo de resposta

Dublagem

  • Criar projeto de dublagem
    • Atualizada a descrição de mode para indicar que o modo manual é experimental e não recomendado para uso em produção