Wir stellen Eleven v4 vorLernen Sie Eleven v4 kennen, unser bisher ausdrucksstärkstes Modell. Mit 3× Credits im Creator+-Tarif bis zum 12. Oktober

Zum Inhalt springen

Speech-to-Text-API

Spracherkennung mit ElevenLabs Scribe v2

Höchste Genauigkeit bei Speech to Text für große Anwendungen. Erkennt Betonungen und Soundeffekte und ermöglicht gezielte Transkription mit Keyterm Prompting.

Äh, hi! Also, ähm, ich wollte fragen, ob du Lust hättest, einen Kaffee trinken zu gehen? Vielleicht morgen früh? [nervous laugh] Völlig okay, wenn nicht!

Uh, hi! So, um, I was wondering if you wanted to meet up for coffee? Maybe tomorrow morning? [nervous laugh] Totally fine if not!

  • Lovable
  • Veed model
  • Synthesia
  • Stripe
  • Perplexity
  • Twilio

Präziseste Speech to Text API für Batch-Verarbeitung

Erstellen Sie Untertitel, Transkripte und bearbeitbare Mitschriften für Podcasts, Videos, Interviews und andere Aufnahmen – alles mit branchenführender Genauigkeit per API.

Scribe v2 erzielt branchenführende Transkriptionsgenauigkeit und liefert selbst bei schwierigen Audiobedingungen oder unterschiedlichen Akzenten sauberen, bearbeitbaren Text.

Transkriptionsgenauigkeit auf neuem Niveau

Scribe v2 erzielt branchenführende Transkriptionsgenauigkeit und liefert selbst bei schwierigen Audiobedingungen oder unterschiedlichen Akzenten sauberen, bearbeitbaren Text.

Uh, hi! So, um, I was wondering if you wanted to meet up for coffee? Maybe tomorrow morning? [nervous laugh] Totally fine if not!

Für jedes Szenario entwickelt

Transkription für laute Umgebungen, Hintergrundmusik, starke Akzente und Audio in geringer Qualität.

Präzise Kontrolle über Timing, Sprecher und nichtsprachliche Ereignisse.

Die ElevenLabs Transcription API erkennt Lachen, Emotionen und Soundeffekte. Mit Keyterm Prompting steuern Sie die Transkription mit domänenspezifischen Begriffen.

Audio und Video transkribieren

Laden Sie MP3, MP4, WAV, MOV und andere gängige Formate hoch. Scribe verarbeitet Dateien bis zu 10 Stunden mit asynchroner Verarbeitung und Webhook-Benachrichtigungen für große Batches.
Transcription Formats

Saubere, bearbeitbare Transkripte

Erhalten Sie korrekt punktierten, in Absätze gegliederten Text zur Bearbeitung, Veröffentlichung oder Weiterverarbeitung. Keine Nachbearbeitung nötig.
Editable transcripts

Keyterm Prompting

Steigern Sie die Erkennungsgenauigkeit für bis zu 100 domänenspezifische Begriffe. Produktnamen, Fachjargon und spezialisiertes Vokabular werden direkt beim ersten Mal korrekt transkribiert.
Keyterm Prompting

Dynamische Audiokennzeichnung

Erfassen Sie nichtsprachliche Ereignisse wie Lachen, Applaus, Musik und Hintergrundgeräusche. Transkripte enthalten den vollständigen Kontext Ihres Audios, nicht nur die Wörter.

Intelligente Sprecherdiarisierung

Identifizieren und kennzeichnen Sie automatisch bis zu 48 Sprecher. Klare Zuordnung, wer was gesagt hat, in übersichtlichen Transkripten.

Entitätserkennung

Identifizieren und markieren Sie automatisch 56 Entitätstypen, darunter Namen, Daten, Orte und Organisationen, in Ihren Transkripten.

Klinische Audiodaten mit Scribe v2 Medical transkribieren

Ein Speech-to-Text-Modell für medizinische Transkription und klinische Workflows, mit verbesserter Erkennung von Medikamentennamen sowie anatomischen und pathologischen Begriffen.

Medication renewal message flags metformin 500mg and asks about continued levothyroxine.

Klinische Sprache transkribieren

Wandeln Sie Gespräche zwischen medizinischem Personal und Patienten, ärztliche Diktate und Patientenaufnahmen in präzisen Text um – bereit zur Prüfung durch Fachpersonal sowie für Notizen, Kodierung und nachgelagerte Dokumentationsworkflows.

Weniger Fehler bei medizinischen Fachbegriffen

Bei Term-WER macht Scribe v2 Medical im Eka Medical ASR-Testsplit 15 % weniger Fehler als Scribe v2 und verbessert die medizinische Spracherkennung für klinisches Vokabular.

Abstract gray textured background with soft diagonal light and dark bands.

Scribe v2

Höchste Genauigkeit, entwickelt für Batch-Workloads.

  • >95 % Genauigkeit
  • Über 90 Sprachen
  • Erkennung nichtsprachlicher Ereignisse
  • Entitätserkennung
  • Keyterm-Prompting
Abstract grayscale bands of soft light and shadow sweeping diagonally.

Scribe v2 Realtime

Niedrigste Latenz für Echtzeit-Workloads.

  • Unter 150 ms Latenz
  • Über 90 Sprachen
  • Transkriptions-Streaming
  • Sprachaktivitätserkennung
  • Automatische Spracherkennung
Abstract grayscale texture with diagonal streaks and a soft gradient from dark to light.

Scribe v2 Medical

Medizinisches Finetune für klinische Transkription.

  • Optimiertes medizinisches Vokabular
  • Transkription in über 90 Sprachen
  • Wie Scribe v2 bei Alltagssprache
  • Verbesserte Erkennung von Medikamentennamen
  • HIPAA-geeignet für Enterprise-Kunden

Sprache in über 90 Sprachen und einer breiten Palette von Akzenten transkribieren

Hohe Genauigkeit bei Akzenten, Dialekten und verschiedenen Aufnahmebedingungen.

Ändern Sie languageCode, um Sprachen in der Vorschau anzuzeigen

import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";

const elevenlabs = new ElevenLabsClient({
	apiKey: "<your_api_key>"
});
const response = await fetch(
  "https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
);
const audioBlob = new Blob([await response.arrayBuffer()], { type: "audio/mp3" });

const transcription = await	elevenlabs
	.speechToText.convert({
	  file: audioBlob,
	  modelId: "scribe_v2",
	  tagAudioEvents: true,
	  languageCode: 
, // Sprache festlegen diarize: true }); console.log(transcription);
Flag for en
Englisch
Flag for zh
Chinesisch
Flag for es
Spanisch
Flag for fr
Französisch
Flag for pt
Portugiesisch
Flag for de
Deutsch
Flag for ja
Japanisch
Flag for it
Italienisch
Flag for hi
Hindi
Flag for en
EnglischZum Vorschau klicken

Für die weltweit führenden Unternehmen und Marken

  • “Von der Synchronisation von Reels in lokalen Sprachen bis zur Generierung von Musik und Charakterstimmen in Horizon: Die ElevenLabs-Plattform ermöglicht es Kreativen, Unternehmen und Konzernen weltweit, mit Stimme, Musik und Sound im großen Maßstab zu entwickeln.”
    Meta Color Logo
  • “Dank der unübertroffenen Genauigkeit von Scribe in so vielen Sprachen versteht Fieldy jedes tägliche Gespräch und kann einfach über Kontinente hinweg skalieren. Nach dem Wechsel zu ElevenLabs Scribe hat Fieldy die Nutzerbindung um 50 % gesteigert.”
    Fieldy logo
  • “ElevenLabs hat es uns leicht gemacht, leistungsstarke Text-to-Speech-Funktionen schnell in unser SDK zu integrieren. So können Agents in Echtzeit mit ausdrucksstarken Stimmen auf Nutzerfragen reagieren oder Feedback zu dem geben, was sie sehen.”
    Stream Color Logo
  • “Twilio hat die generative KI-Stimmtechnologie von ElevenLabs in seine CPaaS integriert und damit ConversationRelay erweitert. Diese Integration ermöglicht Unternehmen und Entwicklern, dialogbasierte KI-Sprachinteraktionen zu erstellen, die menschlich und ausdrucksstark klingen und direkt über die Twilio-CPaaS-Plattform in Echtzeit reagieren. Wir bei ElevenLabs freuen uns, dass Twilio ElevenLabs gewählt hat, um ConversationRelay mit den ausdrucksstärksten und natürlichsten verfügbaren Stimmen zu erweitern. ”
    Twilio logo

APIs für den Produktionseinsatz

Enterprise data protection developers

Daten werden bei der Übertragung und Speicherung verschlüsselt. SOC 2, HIPAA und DSGVO-Konformität werden unterstützt. Für strengere Datenkontrolle stehen EU-Datenresidenz und Zero-Retention-Modi zur Verfügung.

Daten werden bei der Übertragung und Speicherung verschlüsselt. SOC 2, HIPAA und DSGVO-Konformität werden unterstützt. Für strengere Datenkontrolle stehen EU-Datenresidenz und Zero-Retention-Modi zur Verfügung.

SDKs

Offizielle Python- und TypeScript-SDKs mit Typsicherheit, Streaming-Unterstützung und klaren Beispielen.

Unser Team sorgt für einen reibungslosen Start und einen zuverlässigen Betrieb. So erhalten Sie konstante Leistung und Sicherheit.

Häufig gestellte Fragen

Häufig gestellte Fragen

Neueste Updates

Neueste Updates

    Die realistischste Audio-KI-Plattform