Apresentamos o Eleven v4Conheça o Eleven v4, nosso modelo mais expressivo até agora. Com 3x mais créditos incluídos no Creator+ até 12 de outubro

Pular para o conteúdo

Como usar uma API de transcrição de reuniões: em tempo real e em lote com o Scribe v2

Escrito por
Jack Limebear
Publicado

OuvirOuça este artigo

Fazer anotações de reuniões manualmente é trabalhoso e sujeito a erros, especialmente quando uma reunião dura mais de uma hora. Isso desperdiça tempo e distrai os participantes da discussão. Mesmo com uma gravação de áudio, atribuir conversas específicas a cada locutor é desafiador. 


Uma API de transcrição de reuniões permite transformar reuniões ao vivo ou gravadas em texto com marcações de tempo e identificação de locutores dentro do seu produto. Você envia o áudio e recebe uma transcrição estruturada, sem precisar criar um modelo de fala por conta própria.

Este artigo explica como funciona uma API de transcrição de reuniões, compara a transcrição em tempo real e em lote e mostra como desenvolver com o Eleven Scribe v2 e o Eleven Scribe v2 Realtime.

Resumo

  • Uma API de transcrição de reuniões converte o áudio da reunião em transcrições com marcações de tempo e identificação de locutores.
  • Transcrição em tempo real oferece legendas de baixa latência durante a reunião, enquanto a transcrição em lote processa gravações de áudio após o término da reunião.
  • A precisão da transcrição de reuniões depende da qualidade do áudio, dos padrões vocais dos locutores e do modelo de voz usado. 
  • A ElevenLabs oferece os modelos Scribe v2 e Scribe v2 Realtime, que permitem que equipes de engenharia criem produtos de transcrição de reuniões altamente precisos. 

O que uma API de transcrição de reuniões faz e quem precisa dela

Uma API de transcrição de reuniões recebe o áudio da reunião como entrada e retorna texto. Ela lida com reconhecimento de fala, diarização de locutores e marcação de tempo, oferecendo um pacote completo para você usar. Em comparação com anotações manuais, o Speech to Text para reuniões oferece aos participantes um registro pesquisável que podem consultar novamente.

À medida que mais equipes adotam agentes de IA, os registros escritos das reuniões se tornam um contexto pesquisável. Um agente interno pesquisa detalhes nas transcrições e encontra informações que reduzem silos de dados e ampliam o acesso a informações entre equipes.

Muitas ferramentas comerciais oferecem transcrição, mas podem não atender totalmente às necessidades de uma organização.


Para equipes de engenharia de produto, criar um app de reuniões com Speech to Text ou adicionar esse recurso a uma ferramenta existente às vezes é mais viável. Com seu próprio software de transcrição de reuniões, você controla os seguintes aspectos:

  • Privacidade: a ElevenLabs oferece o Zero Retention Mode para usuários empresariais, atendendo ainda mais aos requisitos de privacidade em determinadas regiões. 
  • Vocabulário personalizado: você fornece contexto adicional ao modelo para que ele entenda e transcreva termos específicos da sua empresa, produto e setor. 
  • Workflow personalizado: em vez de ficar limitado a workflows específicos de fornecedores, você cria uma ferramenta de transcrição de reuniões que se conecta ao seu banco de dados interno, CRM e software empresarial. 


A ElevenLabs oferece modelos líderes de voz e áudio que ajudam você a criar um app de transcrição de reuniões. Ao usar nossa API de transcrição de reuniões, você pode registrar com precisão em notas textuais o que é dito em uma reunião. Nossos modelos oferecem suporte a mais de 90 idiomas, permitindo transcrever em inglês, francês, mandarim e dezenas de outros idiomas. 

Why teams build custom meeting transcription API: privacy, vocabulary, workflow, and searchable AI context.

Speech to Text para reuniões em tempo real ou em lote: como escolher 

A transcrição em tempo real captura fluxos de áudio à medida que são falados e os transforma em legendas ao vivo. Você usa a transcrição em tempo real para oferecer suporte textual durante a reunião ou acionar ações no meio da sessão com um bot ao vivo. Já as transcrições em lote processam toda a gravação após uma reunião para fornecer uma transcrição mais concisa e estruturada. A transcrição em lote ajuda a criar notas pós-reunião, manter registros e preservar documentos auditáveis. 

É importante entender as implicações técnicas e de custo ao escolher entre a transcrição de fala para texto em tempo real ou em lote. 

Veja uma comparação rápida entre as duas abordagens.

Características

Transcrição em tempo real

Transcrição em lote

Operações técnicas

Captura fluxos de áudio ao vivo enquanto são falados. Exige uma conexão ativa com o modelo de voz. 

Processa toda a gravação de áudio após uma reunião. Pode operar de forma assíncrona.  

Precisão 

Padrão. Processa o áudio em tempo real sem o contexto completo.

Maior. Tem tempo suficiente para analisar todo o contexto da conversa.

Casos de uso

Legenda ao vivo durante a reunião, bot de reunião. 

Notas pós-reunião, manutenção de registros.

Custo

Maior, pois exige uma conexão persistente.

Menor, graças à eficiência do processamento em massa. 

No fim, sua escolha depende das prioridades. Se você está criando um assistente de reuniões ao vivo, precisa transcrever em tempo real. Caso contrário, use a transcrição em lote, que oferece vantagens de custo e precisão. 

Como configurar uma API de transcrição de reuniões com o Scribe v2

ElevenLabs Speech to Text permite transcrever reuniões com o Scribe v2 Realtime e o Scribe v2. Ambos os modelos de voz são treinados para identificar locutores com precisão em diferentes sotaques, dialetos e níveis de qualidade de áudio. O Scribe v2 Realtime permite transcrever fala ao vivo instantaneamente, enquanto o Scribe v2 transforma gravações de áudio em transcrições altamente precisas. 

Você pode acessar ambos os modelos usando a API que fornecemos. A seguir, exploramos cada modelo em detalhes, destacando recursos importantes, a arquitetura da API e formas de integração com sua solução de transcrição. 

Opção 1: transcrição em tempo real (ao vivo) 

A transcrição em tempo real permite processar conversas durante uma reunião e convertê-las em texto enquanto os participantes falam. Há poucas ou nenhuma lacuna perceptível entre a fala audível e a fala transcrita. 

Para transcrever em tempo real, você usa o modelo Scribe v2 Realtime, que alcança baixa latência de 150 ms entre a entrada de áudio e a saída de texto (transcrições parciais quase instantâneas). Isso significa que você terá legendas contínuas ao integrar o modelo ao seu app de transcrição. 

Projetado para oferecer suporte a conversas ao vivo, o Scribe v2 Realtime é adequado para casos de uso que exigem legendas ao vivo, geração de notas de reunião em tempo real ou envio de texto ao vivo para um assistente de IA realizar ações secundárias. Além disso, o modelo oferece suporte a até 50 termos-chave para prompting. 

Como transcrever com o Scribe v2 Realtime


Para realizar transcrições ao vivo, conecte seu produto ao Scribe v2 Realtime usando a ElevenAPI. 

  1. Primeiro, abra um WebSocket para permitir que seu produto receba transcrições do modelo Scribe v2 Realtime. 
  2. Em seguida, envie fluxos de conversas de reuniões ao vivo para o modelo. 
  3. Por fim, receba transcrições parciais e finais em até 150 ms. 


No seu código, você cria manipuladores para eventos da API que ocorrem durante todo o processo de transcrição. Por exemplo, seu código lida com eventos ao enviar dados de áudio e receber uma transcrição confirmada. 

Live meeting transcription workflow: open WebSocket, stream audio, receive partial and final text.

Métodos de streaming ao vivo para o Scribe v2 Realtime

O exemplo abaixo cria um token de uso único no seu backend. Seu cliente pode transmitir o áudio da reunião para a API de transcrição de reuniões sem expor sua chave de API.

// Node.js server
import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";

const elevenlabs = new ElevenLabsClient({
  apiKey: process.env.ELEVENLABS_API_KEY,
});

app.get("/scribe-token", yourAuthMiddleware, async (req, res) => {
  const token = await elevenlabs.tokens.singleUse.create("realtime_scribe");

  res.json(token);
});

Dependendo da arquitetura do seu app, você pode transmitir conversas ao vivo com o Scribe v2 Realtime pelo app cliente ou pelo servidor de backend.

  • Streaming no lado do cliente: com esse método, você alimenta o modelo de áudio com a entrada de áudio diretamente do microfone ou por meio de divisão manual em blocos. Para se conectar à API, você valida com um token de uso único, evitando expor sua chave de API. 
  • Streaming no lado do servidor: esse método permite transmitir áudio diretamente de uma URL, de uploads de arquivos ou de um fluxo de áudio. Você usa sua chave de API da ElevenLabs em vez de um token de uso único. 

Como escolher uma estratégia de confirmação para o Scribe v2 Realtime

O exemplo abaixo configura a detecção de atividade de voz. A API confirmará um segmento da transcrição sempre que um locutor fizer uma pausa.

import { Scribe, AudioFormat, CommitStrategy } from "@elevenlabs/client";

const connection = Scribe.connect({
  token: "sutkn_1234567890",
  modelId: "scribe_v2_realtime",
  audioFormat: AudioFormat.PCM_16000,
  commitStrategy: CommitStrategy.VAD,
  vadSilenceThresholdSecs: 1.5,
  vadThreshold: 0.4,
  minSpeechDurationMs: 100,
  minSilenceDurationMs: 100,
});

A transcrição final fornece registros comprobatórios que capturam com precisão o que é dito na reunião. Há duas formas de confirmar as transcrições finais: manualmente ou com a Detecção de Atividade de Voz (VAD). 

  • Confirmação manual: por padrão, você precisa confirmar manualmente o segmento da transcrição no seu código. Recomendamos confirmar a cada 20 a 30 segundos para uma latência ideal. Se houver preocupação em perder contexto, você pode enviar o texto anterior junto com o segmento de áudio a ser processado.
  • Detecção de Atividade de Voz: como alternativa, você pode usar o VAD, que detecta silêncios no fluxo de áudio para iniciar a transcrição. 

Opção 2: transcrição em lote (pós-reunião) 

A transcrição em lote é uma forma eficaz de converter horas de gravações de reuniões em formato textual. Ela fornece transcrições concisas, contextualmente relevantes e com diarização em escala.

O Scribe v2 é um modelo de Speech to Text da ElevenLabs compatível com marcação dinâmica de áudio. Você pode extrair dados de conversas com precisão, além de eventos não relacionados à fala, como risadas e passos. 

Diferentemente da transcrição em tempo real, o Scribe v2 foi criado para notas de reunião após a gravação. Por exemplo, você grava reuniões em plataformas como Zoom, Teams e Google Meet. Depois, envia os arquivos de áudio ao Scribe v2 após a sessão para transcrição em lote. 

Batch transcription workflow: upload recording, receive webhook, and verify its HMAC signature.

Como transcrever em lote com o Scribe v2 

A transcrição com o Scribe v2 acontece de forma assíncrona por uma API REST. Você não precisa manter uma conexão ativa com o modelo de voz. Em vez disso, usa um webhook para ser avisado quando a transcrição estiver pronta.

Abaixo está o fluxo lógico que transforma gravações de áudio em uma transcrição.

Create webhook dialog configuring callback URL, HMAC authentication, and event subscriptions.

 

  1. Primeiro, você cria um WebHook no painel da ElevenLabs para receber os resultados da transcrição.
  2. Em seguida, crie manipuladores de eventos no seu código para processar a transcrição retornada. 
  3. Depois, envie os arquivos de áudio ao endpoint REST do Scribe v2. 


Quando a transcrição for concluída, o manipulador de eventos que você configurou será chamado. 

Prompting de palavras-chave para o Scribe v2

O Scribe v2 (em lote) oferece suporte a até 1.000 termos para prompting de palavras-chave. Ao enviar um arquivo de áudio para transcrição, você pode incluir os termos na chamada da API. Diferentemente de uma lista de vocabulário, o Scribe v2 compara os termos-chave com o contexto da conversa para determinar a transcrição adequada.


Isso permite que o modelo preste mais atenção quando alguém diz termos específicos e os transcreva com precisão. 

O exemplo abaixo envia termos da empresa e do produto com a solicitação, para que a API os transcreva corretamente no contexto. 

connection = await elevenlabs.speech_to_text.realtime.connect(RealtimeUrlOptions(
    model_id="scribe_v2_realtime",
    keyterms=["ElevenLabs"],
))

Por exemplo, ele transcreve “ElevenLabs” quando você pronuncia a palavra no contexto de uma marca ou empresa. 

Transcrição multicanal para o Scribe v2

Transcrição multicanal permite que o modelo Scribe v2 transcreva canais individuais em um arquivo de áudio com fala de locutores distintos. Esse recurso é útil ao criar uma ferramenta de transcrição para conferências, gravações judiciais ou podcasts. 

Cada canal receberá um identificador único que representa um locutor.

Desafios comuns da transcrição de reuniões e como a API lida com eles 

Ao transcrever reuniões, as equipes de engenharia costumam enfrentar vários desafios.

Slide outlines four meeting transcription challenges, API solutions, and keyterm limits.

Conversas sobrepostas 

Vários locutores falando ao mesmo tempo dificultam entender o que está sendo dito. Para diferenciar os locutores, use diarização ou transcrição multicanal, recursos oferecidos pelo Scribe v2. Assim, você recebe transcrições separadas identificadas pelos respectivos locutores.

Interpretações incorretas

Outro desafio das ferramentas de transcrição é detectar e interpretar com precisão produtos, marcas ou termos específicos do setor. Por exemplo, “DevOps”, um termo familiar para desenvolvedores de software, pode ser transcrito incorretamente como “dev ops”. Com a API de transcrição de reuniões da ElevenLabs, você pode orientar o modelo a interpretar corretamente usando prompting de termos-chave.

Locutores multilíngues

Algumas reuniões acontecem em diferentes idiomas, com locutores alternando entre dois ou mais idiomas nos quais são fluentes. Modelos de voz padrão têm dificuldade para interpretar o contexto e o conteúdo da fala, resultando em baixa qualidade de transcrição. O Scribe v2 permite transcrição multilíngue em mais de 90 idiomas, capturando com precisão as conversas à medida que acontecem. 

Legendas ao vivo e transcrição pós-gravação

Algumas equipes precisam projetar legendas ao vivo e gerar uma transcrição após a reunião. Infelizmente, nem toda ferramenta de transcrição pronta para uso oferece os dois recursos. A API da ElevenLabs permite fazer ambos com o Scribe v2 e o Scribe v2 Realtime. 

Comece a usar a API de transcrição de reuniões

ElevenAPI dá acesso a modelos líderes de Speech to Text para criar ferramentas de transcrição de reuniões. Configurar um ambiente de desenvolvimento é simples. Você obtém uma chave de API e instala o SDK para Python ou Node.js. Depois, integra o Scribe v2 ou o Scribe v2 Realtime ao seu produto usando a API fornecida. 

Acesse a ElevenLabs e envie sua primeira solicitação à API agora. 

Desenvolva em escala com a ElevenAPI

Precisa de outra coisa? Acesse nossa Central de ajuda

Perguntas frequentes 

Escrito por

Man smiling, wearing a checkered shirt against a plain background.

Jack Limebear

Growth Marketing

Jack Limebear faz parte do time de Growth, atuando como redator e estrategista de conteúdo no blog e nas páginas de insights. Antes da ElevenLabs, ele passou mais de dez anos liderando estratégias de conteúdo em organizações que vão de startups SaaS em rápido crescimento a empresas da Fortune 500. Ele é mestre em Literatura Inglesa pela Universidade de Cambridge.

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade