API de Speech to Text
Transcreva áudios com o ElevenLabs Scribe v2
A maior precisão em Speech to Text para aplicações em grande escala. Detecta ênfases e efeitos sonoros, além de permitir direcionar a transcrição com palavras-chave.
- Lovable
- Veed model
- Synthesia
- Stripe
- Perplexity
- Twilio
A API Speech to Text mais precisa para grandes volumes
Crie legendas, transcrições editáveis e arquivos de texto para podcasts, vídeos, entrevistas e outros conteúdos gravados – tudo com precisão líder do setor via API.
Precisão de transcrição sem precedentes
O Scribe v2 oferece precisão de transcrição líder do setor, gerando textos limpos e editáveis mesmo em condições de áudio desafiadoras ou com diversos sotaques.
Projetado para todos os cenários
Transcrição que funciona em ambientes barulhentos, com música de fundo, sotaques marcantes e áudio de baixa qualidade.
Controle detalhado de timing, locutores e eventos não verbais.
A API de Transcrição da ElevenLabs detecta risadas, emoções e efeitos sonoros. Use o keyterm prompting para orientar a transcrição com termos específicos do seu domínio.
Transcreva áudio e vídeo
.webp&w=3840&q=95)
Transcrições limpas e editáveis
.webp&w=3840&q=95)
Orientação por termos-chave

Marcação dinâmica de áudio
Capture eventos não verbais, como risadas, aplausos, música e ruído de fundo. As transcrições incluem todo o contexto do seu áudio, não apenas as palavras.
Diarização inteligente de locutores
Identifique e rotule automaticamente até 48 locutores. Atribuição clara de quem disse o quê, organizada em transcrições fáceis de ler.
Detecção de entidades
Identifique e marque automaticamente 56 tipos de entidades, incluindo nomes, datas, locais e organizações nas suas transcrições.
Transcreva áudio clínico com o Scribe v2 Medical
Um modelo de Speech to Text otimizado para transcrição médica e fluxos de trabalho clínicos, com reconhecimento aprimorado de nomes de medicamentos, termos de anatomia e patologia.

Transcreva fala clínica
Converta conversas entre profissionais de saúde e pacientes, ditados médicos e registros de admissão de pacientes em textos precisos, prontos para revisão clínica e uso em anotações, codificação e fluxos de documentação posteriores.

Menos erros em termos médicos
Na métrica term-WER, o Scribe v2 Medical comete 15% menos erros que o Scribe v2 na divisão de teste Eka Medical ASR, com reconhecimento de voz médica aprimorado em todo o vocabulário clínico.

Scribe v2
A maior precisão, desenvolvido para cargas de trabalho em lote.
- >95% de precisão
- Mais de 90 idiomas
- Detecção de eventos não verbais
- Detecção de entidades
- Keyterm prompting

Scribe v2 Realtime
A menor latência, para cargas de trabalho em tempo real.
- Latência inferior a 150 ms
- Mais de 90 idiomas
- Streaming de transcrição
- Detecção de atividade de voz
- Reconhecimento automático de idioma

Scribe v2 Medical
Finetune médico para transcrição clínica.
- Ajuste de vocabulário médico
- Transcrição em mais de 90 idiomas
- Mesmo desempenho do Scribe v2 em fala cotidiana
- Reconhecimento aprimorado de nomes de medicamentos
- Qualificado para HIPAA para clientes Enterprise
Transcreva fala em mais de 90 idiomas e uma ampla variedade de sotaques
Precisão excepcional em sotaques, dialetos e condições de gravação.
Altere o languageCode para visualizar os idiomas
import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";
const elevenlabs = new ElevenLabsClient({
apiKey: "<your_api_key>"
});
const response = await fetch(
"https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
);
const audioBlob = new Blob([await response.arrayBuffer()], { type: "audio/mp3" });
const transcription = await elevenlabs
.speechToText.convert({
file: audioBlob,
modelId: "scribe_v2",
tagAudioEvents: true,
languageCode: , // Definir idioma
diarize: true
});
console.log(transcription);

