Erzwungene Ausrichtung
Überblick
Die ElevenLabs-API für erzwungene Ausrichtung wandelt gesprochene Audiodaten und Text in ein zeitlich ausgerichtetes Transkript um. Das ist nützlich, wenn Sie über eine Audioaufnahme und ein Transkript verfügen, aber exakte Zeitstempel für jedes Wort oder jede Phrase im Transkript benötigen. Mögliche Einsatzbereiche:
- Untertitel mit einer Videoaufnahme abgleichen
- Zeitangaben für die Hörbuchaufnahme eines E-Books erstellen
Nutzung
Die API für erzwungene Ausrichtung kann durch direkte Anbindung an die ElevenLabs-API verwendet werden.
Unterstützte Sprachen
Unsere mehrsprachigen v2-Modelle unterstützen 29 Sprachen:
Englisch (USA, UK, Australien, Kanada), Japanisch, Chinesisch, Deutsch, Hindi, Französisch (Frankreich, Kanada), Koreanisch, Portugiesisch (Brasilien, Portugal), Italienisch, Spanisch (Spanien, Mexiko), Indonesisch, Niederländisch, Türkisch, Filipino, Polnisch, Schwedisch, Bulgarisch, Rumänisch, Arabisch (Saudi-Arabien, VAE), Tschechisch, Griechisch, Finnisch, Kroatisch, Malaiisch, Slowakisch, Dänisch, Tamil, Ukrainisch & Russisch.
Wichtige Fakten
- Eingabetextformat: Nur Klartextzeichenfolge — betten Sie Eingabetext nicht in JSON oder eine andere Struktur ein
- Sprechertrennung: Nicht unterstützt; die Eingabe von nach Sprecher:innen getrenntem Text führt zu unerwarteten Ergebnissen
- Preise: Derselbe Preis wie für die Speech to Text API
- Maximale Dateigröße: 3 GB
- Maximale Audiodauer: 10 Stunden
- Maximale Textlänge: 675.000 Zeichen