Pular para o conteúdo

API de Speech to Text

Transcreva áudios com o ElevenLabs Scribe v2

A maior precisão em Speech to Text para aplicações em grande escala. Detecta ênfases e efeitos sonoros, além de permitir direcionar a transcrição com palavras-chave.

Uh, hi! So, um, I was wondering if you wanted to meet up for coffee? Maybe tomorrow morning? [nervous laugh] Totally fine if not!

  • Lovable
  • Veed model
  • Synthesia
  • Stripe
  • Perplexity
  • Twilio

A API Speech to Text mais precisa para grandes volumes

Crie legendas, transcrições editáveis e arquivos de texto para podcasts, vídeos, entrevistas e outros conteúdos gravados – tudo com precisão líder do setor via API.

O Scribe v2 oferece precisão de transcrição líder do setor, gerando textos limpos e editáveis mesmo em condições de áudio desafiadoras ou com diversos sotaques.

Precisão de transcrição sem precedentes

O Scribe v2 oferece precisão de transcrição líder do setor, gerando textos limpos e editáveis mesmo em condições de áudio desafiadoras ou com diversos sotaques.

Uh, hi! So, um, I was wondering if you wanted to meet up for coffee? Maybe tomorrow morning? [nervous laugh] Totally fine if not!

Projetado para todos os cenários

Transcrição que funciona em ambientes barulhentos, com música de fundo, sotaques marcantes e áudio de baixa qualidade.

Controle detalhado de timing, locutores e eventos não verbais.

A API de Transcrição da ElevenLabs detecta risadas, emoções e efeitos sonoros. Use o keyterm prompting para orientar a transcrição com termos específicos do seu domínio.

Transcreva áudio e vídeo

Envie arquivos MP3, MP4, WAV, MOV e outros formatos comuns. O Scribe processa arquivos de até 10 horas de forma assíncrona e envia notificações por webhook para grandes lotes.
Transcription Formats

Transcrições limpas e editáveis

Receba textos com pontuação correta e estruturados em parágrafos, prontos para editar, publicar ou processar posteriormente. Sem necessidade de revisão.
Editable transcripts

Orientação por termos-chave

Aumente a precisão do reconhecimento de até 100 termos específicos do seu domínio. Nomes de produtos, jargões técnicos e vocabulário especializado transcritos corretamente já na primeira vez.
Keyterm Prompting

Marcação dinâmica de áudio

Capture eventos não verbais, como risadas, aplausos, música e ruído de fundo. As transcrições incluem todo o contexto do seu áudio, não apenas as palavras.

Diarização inteligente de locutores

Identifique e rotule automaticamente até 48 locutores. Atribuição clara de quem disse o quê, organizada em transcrições fáceis de ler.

Detecção de entidades

Identifique e marque automaticamente 56 tipos de entidades, incluindo nomes, datas, locais e organizações nas suas transcrições.

Transcreva áudio clínico com o Scribe v2 Medical

Um modelo de Speech to Text otimizado para transcrição médica e fluxos de trabalho clínicos, com reconhecimento aprimorado de nomes de medicamentos, termos de anatomia e patologia.

Medication renewal message flags metformin 500mg and asks about continued levothyroxine.

Transcreva fala clínica

Converta conversas entre profissionais de saúde e pacientes, ditados médicos e registros de admissão de pacientes em textos precisos, prontos para revisão clínica e uso em anotações, codificação e fluxos de documentação posteriores.

Maior precisão em termos médicos

Na métrica term-WER, o Scribe v2 Medical comete 15% menos erros que o Scribe v2 na divisão de teste Eka Medical ASR, com reconhecimento de voz médica aprimorado em todo o vocabulário clínico.

Abstract gray textured background with soft diagonal light and dark bands.

Scribe v2

A maior precisão, desenvolvido para cargas de trabalho em lote.

  • >95% de precisão
  • Mais de 90 idiomas
  • Detecção de eventos não verbais
  • Detecção de entidades
  • Keyterm prompting
Abstract grayscale bands of soft light and shadow sweeping diagonally.

Scribe v2 Realtime

A menor latência, para cargas de trabalho em tempo real.

  • Latência inferior a 150 ms
  • Mais de 90 idiomas
  • Streaming de transcrição
  • Detecção de atividade de voz
  • Reconhecimento automático de idioma
Abstract grayscale texture with diagonal streaks and a soft gradient from dark to light.

Scribe v2 Medical

Finetune médico para transcrição clínica.

  • Ajuste de vocabulário médico
  • Transcrição em mais de 90 idiomas
  • Mesmo desempenho do Scribe v2 em fala cotidiana
  • Reconhecimento aprimorado de nomes de medicamentos
  • Qualificado para HIPAA para clientes Enterprise

Transcreva fala em mais de 90 idiomas e uma ampla variedade de sotaques

Precisão excepcional em sotaques, dialetos e condições de gravação.

Altere o languageCode para visualizar os idiomas

import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";

const elevenlabs = new ElevenLabsClient({
	apiKey: "<your_api_key>"
});
const response = await fetch(
  "https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
);
const audioBlob = new Blob([await response.arrayBuffer()], { type: "audio/mp3" });

const transcription = await	elevenlabs
	.speechToText.convert({
	  file: audioBlob,
	  modelId: "scribe_v2",
	  tagAudioEvents: true,
	  languageCode: 
, // Definir idioma diarize: true }); console.log(transcription);
Flag for en
Inglês
Flag for zh
Chinês
Flag for es
Espanhol
Flag for fr
Francês
Flag for pt
Português
Flag for de
Alemão
Flag for ja
Japonês
Flag for it
Italiano
Flag for hi
Hindi
Flag for en
InglêsClique para visualizar

Impulsionando as principais empresas e marcas do mundo

  • Da dublagem de Reels em idiomas locais à geração de músicas e vozes de personagens no Horizon, a plataforma da ElevenLabs permite que criadores, empresas e organizações globais desenvolvam com voz, música e som em escala.
    Meta Color Logo
  • A precisão incomparável do Scribe em tantos idiomas permite que a Fieldy entenda cada conversa diária e se expanda facilmente por todos os continentes. A Fieldy aumentou a retenção de usuários em 50% após migrar para o ElevenLabs Scribe.
    Fieldy logo
  • A ElevenLabs facilitou a incorporação rápida de poderosos recursos de conversão de texto em voz ao nosso SDK, permitindo que os Agents respondam em tempo real às perguntas dos usuários com vozes expressivas ou forneçam feedback sobre o que estão vendo.
    Stream Color Logo
  • A Twilio integrou a tecnologia de voz IA generativa da ElevenLabs à sua CPaaS, aprimorando o ConversationRelay. Essa integração permite que empresas e desenvolvedores criem interações de voz com IA conversacional que soam humanas, são expressivas e respondem em tempo real diretamente pela plataforma CPaaS da Twilio. Na ElevenLabs, estamos animados que a Twilio tenha escolhido a ElevenLabs para aprimorar o ConversationRelay com as vozes mais expressivas e naturais disponíveis.
    Twilio logo

APIs prontas para produção

Enterprise data protection developers

Os dados são criptografados em trânsito e em repouso, com suporte à conformidade com SOC 2, HIPAA e LGPD. Os modos de residência de dados na UE e Zero Retention estão disponíveis para um controle de dados mais rigoroso.

Os dados são criptografados em trânsito e em repouso, com suporte à conformidade com SOC 2, HIPAA e LGPD. Os modos de residência de dados na UE e Zero Retention estão disponíveis para um controle de dados mais rigoroso.

SDKs

SDKs oficiais para Python e TypeScript com segurança de tipos, suporte a streaming e exemplos claros.

Nossa equipe garante um lançamento tranquilo e mantém suas operações funcionando de forma confiável, com desempenho consistente e tranquilidade.

Perguntas frequentes

Atualizações mais recentes

    A plataforma de áudio IA mais realista