Apresentamos o Eleven v4Conheça o Eleven v4, nosso modelo mais expressivo até agora. Com 3x mais créditos incluídos no Creator+ até 12 de outubro

Pular para o conteúdo

Como funciona a transcrição de áudio com marcações de tempo e tags de eventos?

Escrito por
Jack Limebear
Publicado

OuvirOuça este artigo

Um modelo nativo de transcrição por palavra recebe uma gravação de áudio ou transmissão em tempo real como entrada e gera uma matriz estruturada de objetos de token com tags e marcações de tempo, que representam fala e sons não verbais. Cada token é de um entre três tipos: word, spacing ou audio_event. Os eventos de áudio podem ser risadas, aplausos ou outros sons de fundo.

Neste artigo, vamos explicar como funciona a transcrição de áudio com marcações de tempo e por que ela é uma forma de transcrição mais flexível e poderosa do que a transcrição convencional, que depende de alinhamento forçado.

Resumo

  • A transcrição por palavra gera diretamente matrizes estruturadas e com marcações de tempo de dados de fala e eventos de áudio não verbais.
  • Isso contrasta com os modelos convencionais de reconhecimento automático de fala, que geram blocos inteiros de texto. Para adicionar marcações de tempo ao áudio original, é preciso executar um segundo processo de alinhamento forçado, que demora mais e aumenta o uso de processamento.
  • As tags de eventos ajudam você a capturar conteúdo não verbal, como risadas ou aplausos. Como esses dados são pesquisáveis, você pode usá-los para identificar destaques ou momentos com potencial viral com base nas reações do público.
  • Você pode enviar os dados estruturados gerados para aplicativos em diversos casos de uso, incluindo legendagem de alta precisão, arquivos de áudio pesquisáveis e criação automatizada de clipes para redes sociais.
  • A transcrição por palavra do Scribe pode oferecer suporte a até cinco canais, cada um transcrito de forma independente.

O que é transcrição de áudio com marcações de tempo e tags de eventos?

A transcrição com marcações de tempo é uma forma de reconhecimento automático de fala (ASR) que acompanha os pontos exatos de início e fim das palavras e de outros eventos de áudio, como aplausos, durante a transcrição. O resultado são dados totalmente estruturados e navegáveis.

A transcrição convencional por ASR processa o áudio em grandes blocos de texto legível para humanos. Ela oferece legendas e uma transcrição para leitores humanos, mas não é muito útil como dado.

Se você quiser estruturá-la com marcações de tempo, precisará enviá-la novamente a um serviço secundário de machine learning para mapear o texto ao áudio. No fim, você poderá gerar um resultado semelhante, mas isso exige várias etapas de processamento em vez de vir nativamente da API, aumentando a latência e o uso de processamento.

Adicionando navegação ao áudio

A principal vantagem da transcrição com marcações de tempo e tags de eventos é ser legível tanto para pessoas quanto para máquinas. Isso tem aplicações comerciais importantes:

  • Auditoria de conformidade: você pode pesquisar palavras-chave em uma transcrição e obter marcações de tempo exatas para qualquer menção a dados sensíveis.
  • Produção e edição de vídeo: softwares de produção de vídeo podem sincronizar legendas com precisão de milissegundos ao que é dito na tela. Eles também podem identificar corretamente as reações do público.
  • Arquivos pesquisáveis: equipes de relações públicas, vendas e treinamento, entre outras, podem transcrever grandes volumes de entrevistas com clientes, palestras em feiras, webinars ou reuniões gerais e transformá-los em grandes arquivos pesquisáveis.
  • Análise de marketing e sentimento do cliente: as tags de eventos podem identificar reações do público que poderiam se perder em uma transcrição básica de texto.

Quais são as vantagens de obter marcações de tempo nativas por palavra?

Os modelos padrão de Speech to Text processam a fala em blocos, geralmente frases ou parágrafos inteiros. Se você quiser marcações de tempo palavra por palavra, precisará criar outra camada de processamento para realizar o chamado alinhamento forçado em uma segunda etapa. Isso adiciona infraestrutura e latência, além de criar mais possíveis pontos de falha. Por exemplo, as marcações podem se desalinhar ou falhar completamente ao processar fala rápida ou fala encoberta por ruído de fundo alto.

A transcrição com marcações de tempo, como a realizada pelo Scribe, evita esse problema ao transcrever em um nível mais granular, palavra por palavra. Ela faz isso em uma única chamada de API. Não é necessária infraestrutura nem scripts adicionais. O modelo calcula as marcações de tempo enquanto transcreve, para que os dados de fala sempre correspondam com precisão ao áudio.

Audio transcription with timestamps guide. Native transcription provides word timestamps in one API call, avoiding forced-alignment drift.

Como funciona a transcrição com marcações de tempo e tags de eventos?

Vamos usar o Scribe como exemplo.

Um modelo nativo de transcrição por palavra mapeia os sons da fala de um fluxo de áudio em uma matriz estruturada de objetos de token. Ele identifica cada token como um de três tipos: word, spacing ou audio_event.

  • word: Uma palavra falada individual reconhecida, com horários de início e fim e uma tag speaker_id.
  • spacing: Silêncio ou pausas no meio da fala identificados explicitamente com tags. É útil para ajudar serviços de legendagem a manter o ritmo correto. Não é usado em idiomas identificados que não utilizam espaços entre palavras, como japonês, mandarim, tailandês, lao, birmanês e cantonês.
  • audio_event: Áudio não verbal significativo, como risadas ou aplausos. O modelo sabe estruturá-los como um tipo de evento separado e não força o áudio a se tornar fala alucinada.
Timestamped token array separates speech, silence, and laughter across two speakers.

Parâmetros de streaming em tempo real

Os modelos de transcrição por palavra também podem incluir recursos especiais para oferecer suporte à transcrição de áudio ao vivo por WebSocket. Por exemplo:

  • include_timestamps=true: Esse parâmetro faz com que a conexão inclua marcações de tempo por palavra nas mensagens JSON committed_transcript_with_timestamps enviadas ao fim de cada bloco de áudio finalizado. Assim, você recebe as marcações enquanto a transmissão ainda está em andamento. Tags de eventos de áudio só são incluídas se tag_audio_events também estiver ativado.
  • include_language_detection=true: Esse parâmetro instrui a conexão a identificar os diferentes idiomas falados detectados, junto com a pontuação de confiança do modelo para a detecção. Isso ajuda você a executar legendagem multilíngue ao vivo.

Como um modelo de Speech to Text identifica eventos não relacionados à fala?

O Scribe identificará eventos de áudio quando o parâmetro tag_audio_events estiver ativado. Nesse caso, ele identificará e adicionará marcações de tempo específicas de início e fim, assim como faz com as palavras. Ele pode identificar diversos tipos de reações, sendo as mais comuns risadas e aplausos, além de outros sons ambientes que possam ser relevantes no contexto, como passos ou música de fundo.

De forma mais imediata, isso torna as transcrições e legendas mais completas ao adicionar contexto importante. Pode ser mais difícil para um leitor perceber sarcasmo ao ler um texto simples e direto. Uma tag [laughter] enriquece a transcrição e a torna mais expressiva emocionalmente.

Análises melhores

As tags de eventos também tornam mais claras as análises posteriores que você executa, pois essas ferramentas não precisam processar um único bloco de texto não estruturado. A transcrição nativa por palavra separa eventos de áudio como dados estruturados, para que suas ferramentas possam simplesmente filtrá-los quando apropriado e analisar apenas o conteúdo verbal.

Como os tokens spacing tornam as pausas visíveis, você pode analisá-las. Isso pode ser valioso para análises de sentimento e casos de uso de QA, como medir por quanto tempo um agente de atendimento ao cliente ficou em silêncio durante uma chamada.

Busca mais fácil por marcações de tempo

Ou você pode pesquisá-los especificamente. Se estiver fazendo análise de sentimento em uma entrevista de teste de produto, pode extrair reações emocionais relevantes. Se você gerencia uma conta nas redes sociais, pode pesquisar rapidamente por risadas em um discurso de uma hora para encontrar os clipes com maior chance de viralizar.

Integre STT aos seus aplicativos em escala

Precisa de outra coisa? Acesse nossa Central de ajuda

Quais são as aplicações práticas de transcrições estruturadas com marcações de tempo?

Obter dados estruturados nativamente nas transcrições tem vários casos de uso importantes.

Geração de legendas

Você pode exportar transcrições com marcações de tempo diretamente para formatos de legenda usados em produção, incluindo SRT e VTT, sem processamento intermediário. Sua ferramenta de edição de vídeo pode usar a temporização das palavras para destacá-las nas legendas à medida que são ditas.

O modelo de transcrição pode processar facilmente a fala rápida porque a analisa palavra por palavra. Enquanto um modelo convencional pode ter dificuldade com fala acelerada ou vozes sobrepostas, um modelo por palavra como o Scribe pode gerar uma transcrição estruturada e clara.

Busca de áudio e vídeo

A transcrição convencional permite encontrar palavras-chave no bloco de texto, mas, sem alinhamento forçado, você não consegue ir até o momento em que uma frase foi dita. Uma busca por palavra-chave em uma transcrição por palavra é totalmente indexada e leva você diretamente ao segundo em que uma frase foi pronunciada no áudio. Isso transforma seu arquivo de áudio em um catálogo de referência totalmente pesquisável. Esse recurso é especialmente útil para gerenciar grandes bibliotecas de mídia, redes de podcasts e arquivos corporativos.

Auditoria de conformidade e risco

Em muitos casos, você vai querer gravar áudios que contêm informações sensíveis, por exemplo, chamadas de atendimento ao cliente para QA. Essas chamadas podem ser as que têm maior probabilidade de conter informações pessoais sensíveis ou regulamentadas.

Para manter a conformidade e ainda ter dados de áudio para análise, você precisa de uma forma de ocultar dados sensíveis das transcrições em tempo real. A marcação de tempo nativa por palavra permite aproveitar recursos como Detecção de Entidades da ElevenLabs, que sinaliza entidades sensíveis, como números de cartão de crédito ou nomes, e retorna seus deslocamentos e marcações de tempo para que você possa ocultá-las nas transcrições à medida que chegam.

Por exemplo, você pode detectar e ocultar um número de cartão de crédito, nome de solteira da mãe, data de nascimento e nome do cliente conforme são mencionados em uma chamada de verificação de identidade.

Criação automatizada de clipes para redes sociais

Você também pode automatizar programaticamente buscas por palavras-chave para encontrar destaques em conteúdos mais longos. Por exemplo, pode destacar momentos importantes de um discurso de campanha ou seminário corporativo. Isso ajuda você a transformar conteúdos recentes em destaques editados profissionalmente para YouTube, LinkedIn ou TikTok.

Temporização multicanal e com vários falantes

O Scribe pode transcrever até cinco canais de forma independente e em paralelo. Cada um recebe um ID de falante e marcações de tempo. Isso é mais confiável do que a diarização de falantes acústica padrão, que geralmente tem dificuldade com diálogos de ida e volta. Em gravações multicanais, a atribuição de falantes do Scribe é totalmente determinística. Isso significa que o Canal 0 corresponde a speaker_0, o Canal 1 a speaker_1 e assim por diante.

Ele pode reconhecer falantes tentando falar ao mesmo tempo e ainda gerar marcações de tempo independentes para cada fala. Eles também podem estar falando em idiomas diferentes.

Multichannel transcription keeps five channels separate, mapping each to speaker 0–4.

Exporte dados com marcações de tempo no formato de que você precisa

Se quiser distribuir transcrições convencionais em vários formatos, provavelmente precisará escrever os scripts de análise por conta própria. O Scribe pode exportar transcrições em diversos formatos, dependendo de como você vai usá-las. Você pode encontrar definições completas de esquema na Referência da API Create Transcript da ElevenLabs.

Dados estruturados para desenvolvedores: JSON

O Scribe oferece suporte à exportação para JSON para desenvolvedores que desejam dados em um esquema que possam enviar a aplicativos posteriores. Por exemplo, desenvolvedores podem usar esses dados JSON para criar mídia interativa ou um banco de dados de busca semântica para sua organização. A matriz completa de tokens word, spacing e audio_event é gerada com deslocamentos de início e fim e IDs de falante.

Legendagem de mídia: SRT e VTT

O Scribe pode gerar transcrições em SRT e VTT que você pode inserir diretamente no Adobe Premiere ou em outros aplicativos de produção, sem sincronização manual.

Legível para humanos: TXT, DOCX e PDF

Ele também pode gerar transcrições em formatos fáceis de ler. Nesses formatos, o Scribe remove marcadores de tempo de baixo nível para tornar o texto mais legível e adequado à documentação jurídica ou de auditoria. Por exemplo, isso é útil quando você precisa distribuir com eficiência as atas de uma reunião do conselho logo após uma sessão, publicar transcrições de podcasts para SEO ou arquivar registros jurídicos.

Scribe exports one transcript as JSON, SRT/VTT, or TXT/DOCX/PDF for different uses.

Comece a usar as transcrições da ElevenLabs com marcações de tempo e tags de eventos

A transcrição nativa por palavra oferece rapidamente e com eficiência os dados estruturados de que você precisa para seus workflows.

Comece hoje a transcrever seu áudio com o Scribe na ElevenAPI ou saiba mais sobre transcrição por palavra.

Perguntas frequentes sobre marcações de tempo e transcrição com tags de eventos

Escrito por

Man smiling, wearing a checkered shirt against a plain background.

Jack Limebear

Growth Marketing

Jack Limebear faz parte do time de Growth, atuando como redator e estrategista de conteúdo no blog e nas páginas de insights. Antes da ElevenLabs, ele passou mais de dez anos liderando estratégias de conteúdo em organizações que vão de startups SaaS em rápido crescimento a empresas da Fortune 500. Ele é mestre em Literatura Inglesa pela Universidade de Cambridge.

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade