Speech-to-Text-API
Spracherkennung mit ElevenLabs Scribe v2
Höchste Genauigkeit bei Speech to Text für große Anwendungen. Erkennt Betonungen und Soundeffekte und ermöglicht gezielte Transkription mit Keyterm Prompting.
Äh, hi! Also, ähm, ich wollte fragen, ob du Lust hättest, einen Kaffee trinken zu gehen? Vielleicht morgen früh? [nervous laugh] Völlig okay, wenn nicht!
- Lovable
- Veed model
- Synthesia
- Stripe
- Perplexity
- Twilio
Präziseste Speech to Text API für Batch-Verarbeitung
Erstellen Sie Untertitel, Transkripte und bearbeitbare Mitschriften für Podcasts, Videos, Interviews und andere Aufnahmen – alles mit branchenführender Genauigkeit per API.
Transkriptionsgenauigkeit auf neuem Niveau
Scribe v2 erzielt branchenführende Transkriptionsgenauigkeit und liefert selbst bei schwierigen Audiobedingungen oder unterschiedlichen Akzenten sauberen, bearbeitbaren Text.
Für jedes Szenario entwickelt
Transkription für laute Umgebungen, Hintergrundmusik, starke Akzente und Audio in geringer Qualität.
Präzise Kontrolle über Timing, Sprecher und nichtsprachliche Ereignisse.
Die ElevenLabs Transcription API erkennt Lachen, Emotionen und Soundeffekte. Mit Keyterm Prompting steuern Sie die Transkription mit domänenspezifischen Begriffen.
Audio und Video transkribieren
.webp&w=3840&q=95)
Saubere, bearbeitbare Transkripte
.webp&w=3840&q=95)
Keyterm Prompting

Dynamische Audiokennzeichnung
Erfassen Sie nichtsprachliche Ereignisse wie Lachen, Applaus, Musik und Hintergrundgeräusche. Transkripte enthalten den vollständigen Kontext Ihres Audios, nicht nur die Wörter.
Intelligente Sprecherdiarisierung
Identifizieren und kennzeichnen Sie automatisch bis zu 48 Sprecher. Klare Zuordnung, wer was gesagt hat, in übersichtlichen Transkripten.
Entitätserkennung
Identifizieren und markieren Sie automatisch 56 Entitätstypen, darunter Namen, Daten, Orte und Organisationen, in Ihren Transkripten.
Klinische Audiodaten mit Scribe v2 Medical transkribieren
Ein Speech-to-Text-Modell für medizinische Transkription und klinische Workflows, mit verbesserter Erkennung von Medikamentennamen sowie anatomischen und pathologischen Begriffen.

Klinische Sprache transkribieren
Wandeln Sie Gespräche zwischen medizinischem Personal und Patienten, ärztliche Diktate und Patientenaufnahmen in präzisen Text um – bereit zur Prüfung durch Fachpersonal sowie für Notizen, Kodierung und nachgelagerte Dokumentationsworkflows.

Weniger Fehler bei medizinischen Fachbegriffen
Bei Term-WER macht Scribe v2 Medical im Eka Medical ASR-Testsplit 15 % weniger Fehler als Scribe v2 und verbessert die medizinische Spracherkennung für klinisches Vokabular.

Scribe v2
Höchste Genauigkeit, entwickelt für Batch-Workloads.
- >95 % Genauigkeit
- Über 90 Sprachen
- Erkennung nichtsprachlicher Ereignisse
- Entitätserkennung
- Keyterm-Prompting

Scribe v2 Realtime
Niedrigste Latenz für Echtzeit-Workloads.
- Unter 150 ms Latenz
- Über 90 Sprachen
- Transkriptions-Streaming
- Sprachaktivitätserkennung
- Automatische Spracherkennung

Scribe v2 Medical
Medizinisches Finetune für klinische Transkription.
- Optimiertes medizinisches Vokabular
- Transkription in über 90 Sprachen
- Wie Scribe v2 bei Alltagssprache
- Verbesserte Erkennung von Medikamentennamen
- HIPAA-geeignet für Enterprise-Kunden
Sprache in über 90 Sprachen und einer breiten Palette von Akzenten transkribieren
Hohe Genauigkeit bei Akzenten, Dialekten und verschiedenen Aufnahmebedingungen.
Ändern Sie languageCode, um Sprachen in der Vorschau anzuzeigen
import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";
const elevenlabs = new ElevenLabsClient({
apiKey: "<your_api_key>"
});
const response = await fetch(
"https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
);
const audioBlob = new Blob([await response.arrayBuffer()], { type: "audio/mp3" });
const transcription = await elevenlabs
.speechToText.convert({
file: audioBlob,
modelId: "scribe_v2",
tagAudioEvents: true,
languageCode: , // Sprache festlegen
diarize: true
});
console.log(transcription);

