Direkt zum Inhalt

KI-Synchronisations-API: Audio und Video skalierbar synchronisieren

Verfasst von
Jack Limebear
Veröffentlicht

AnhörenArtikel anhören

Vor einigen Jahrzehnten bedeutete das Synchronisieren eines Videos, ein Studio zu buchen, Sprecher für die Zielsprache zu engagieren, jede Zeile aufzunehmen (und erneut aufzunehmen) und dann wochenlang auf die finale Lieferung zu warten.

Eine KI-Synchronisations-API reduziert diesen Prozess auf wenige REST-Aufrufe. Senden Sie Ihr Audio oder Video und erhalten Sie eine synchronisierte Version in neuen Sprachen – mit originalem Timing und erhaltenem emotionalen Ausdruck.

In diesem Leitfaden erklären wir, wie eine KI-Synchronisations-API funktioniert und was eine produktionsreife Lösung von einer zusammengebastelten Pipeline unterscheidet. Außerdem zeigen wir, wie Sie die neue Dubbing-API von ElevenLabs integrieren, die jetzt Dubbing v2, unser neuestes Synchronisationsmodell, in jeden Workflow bringt.

Zusammenfassung

  • Eine KI-Synchronisations-API nimmt Quell-Audio oder -Video und liefert synchronisierte Ausgaben in neuen Sprachen.
  • Dubbing v2 ist ein Audio-zu-Audio-Modell, das auf der Original-Performance basiert. Emotion, Ton und Vortrag werden in jede Synchronisation übertragen.
  • Die ElevenLabs Dubbing API unterstützt über 90 Sprachen mit synchronisationsbewusster Übersetzung.
  • Entwickler erstellen ein Synchronisationsprojekt, fügen Zielsprachen hinzu und laden fertige Synchronfassungen mit wenigen REST-Aufrufen herunter.
  • Enterprise-Kunden können Quelltranskripte und Übersetzungen bearbeiten und nur die geänderten Segmente neu generieren.

Was ist eine KI-Synchronisations-API?

Eine KI-Synchronisations-API ist eine programmatische Schnittstelle, die Audio oder Video in einer Sprache annimmt und synchronisiertes Audio in Zielsprache(n) zurückgibt. Sie automatisiert die gesamte Lokalisierungskette: Transkription der Quelle, Übersetzung des Dialogs, Klonen der Stimmen, Sprachausgabe in der Zielsprache und zeitliche Anpassung an das Original.

Während Entwickler bisher Speech to Text, maschinelle Übersetzung und Text to Speech zu improvisierten Synchronisations-Pipelines verbunden haben, sind diese für große Workloads nicht zuverlässig.

Die Sprecheridentität geht zwischen den Schritten verloren, das Timing kann abweichen und ein ursprünglich emotionales Skript wird monoton.

Eine speziell entwickelte Synchronisations-API bietet zusätzliche Funktionen, die diese Probleme lösen. Von Sprechertrennung und Stimmenerhalt bis zu interner Synchronisation und Stimmklonen sorgt eine hochwertige KI-Synchronisations-API dafür, dass das Ergebnis wie der Originalsprecher klingt – und nicht wie eine flache Übersetzung.

Dubbing v2 API logo on a gray textured background.

Wie KI-Synchronisation funktioniert: Audio zu Audio vs. Kaskadierte Pipelines

Die meisten automatisierten Synchronisationssysteme sind kaskadierte Pipelines. Sie transkribieren das Quell-Audio, übersetzen das Transkript und erzeugen daraus neue Sprache. Alles, was über das reine Transkript hinausgeht – wie Zögern, Spannung, Sarkasmus oder ein geflüstertes Wort – geht vor der Sprachausgabe verloren.

ElevenLabs Dubbing v2 verfolgt einen anderen Ansatz.

Dubbing v2 bietet ein Audio-zu-Audio-Modell, das die Ausgabe direkt auf der Originalaufnahme basiert – nicht auf einem Transkript. Ton, Emotion und Ausdruck werden übertragen, weil das Modell die Performance hört, statt nur eine Beschreibung zu lesen.

Comparison of audio-to-audio dubbing vs. cascaded dubbing, highlighting benefits of emotional tone, voice cloning, and timing in Dubbing v2, leading to dubs at 80-90% of human quality. AI Dubbing API

Wir schätzen, dass Dubbing v2 Synchronfassungen mit 80–90 % menschlicher Qualität erzeugt. Damit eignet sich KI-Synchronisation jetzt auch für filmische Inhalte.

Drei weitere Kernfunktionen runden Dubbing v2 ab:

  • Synchronisationsbewusste Übersetzung: Das Modell übersetzt mit Blick auf das Timing, sodass Start und Ende der synchronisierten Audiospur direkt mit dem Original übereinstimmen. Es ist keine Videobearbeitung oder Lippen-Synchronisation nötig. Das Audio landet exakt dort, wo der Originaldialog war.
  • Automatisches Stimmklonen: Jede Übersetzung wird in einer geklonten Stimme des Originalsprechers geliefert – ohne manuellen Klon-Schritt. Sprecheridentität, Tonhöhe und Klangfarbe bleiben in jeder unterstützten Sprache erhalten, auch bei mehreren Sprechern.
  • Lokale Genauigkeit: Dubbing v2 unterscheidet regionale Varianten, etwa lateinamerikanisches oder kastilisches Spanisch, mit Ländercodes wie pt-BR für brasilianisches Portugiesisch.

Worauf Sie bei einer KI-Synchronisations-API achten sollten

Bei der Auswahl einer KI-Synchronisations-API für Ihre Entwickler-Pipeline sollten Sie auf einige zentrale Kriterien achten.

Das sind die wichtigsten Funktionen der besten KI-Synchronisations-APIs:

  • Breite Sprach- und Lokalauswahl: Achten Sie auf eine große Abdeckung (90+ Sprachen) und die Möglichkeit, regionale Varianten gezielt anzusteuern.
  • Erhalt der Performance: Prüfen Sie, ob das System auf dem Quell-Audio oder dem Transkript basiert. Die Audio-zu-Audio-Architektur entscheidet, ob Emotionen erhalten bleiben.
  • Nahtlose Synchronisation: Synchronisiertes Audio, das vom Original-Timing abweicht, verursacht stundenlangen manuellen Nachbearbeitungsaufwand. Die Synchronisation muss standardmäßig funktionieren, um Nacharbeit zu vermeiden.
  • Mehrsprecher- und Hintergrundfähigkeiten: Eine KI-Synchronisations-API sollte überlappende Sprecher oder Soundeffekte problemlos verarbeiten. Auch Hintergrund-Musik oder Mischungen im Clip sollten erhalten bleiben.
  • Bearbeitung und Neugenerierung: Eine API, mit der Sie Transkripte korrigieren, Übersetzungen anpassen und nur betroffene Segmente neu generieren, erspart das erneute Synchronisieren ganzer Dateien.
  • Compliance: Für Enterprise-Workloads sind SOC 2-, DSGVO- und ISO 27001-Konformität erforderlich, bevor Inhalte verarbeitet werden.

Im Folgenden führen wir Sie durch die Dubbing API von ElevenLabs, die alle oben genannten Funktionen abdeckt.

Key criteria for choosing an AI dubbing API, highlighting ElevenAPI's features.

So synchronisieren Sie Audio und Video mit der ElevenLabs Dubbing API

Die Dubbing API ist projektbasiert aufgebaut. Jedes Projekt enthält eine Quelldatei und deren Transkript. Sie können für jede gewünschte Zielsprache eine Sprache hinzufügen – jede Sprache erhält ihre eigene Übersetzung und Ausgabe.

Der grundlegende Create-and-Fetch-Workflow steht allen Nutzern auf der ElevenAPI-Plattform zur Verfügung.

The dubbing process on ElevenAPI in four REST calls: create, poll, add languages, download.

1) Synchronisationsprojekt erstellen

Senden Sie Ihr Quellmedium als Datei-Upload oder öffentliche URL. Die Authentifizierung erfolgt über Ihren API-Schlüssel im xi-api-key-Header. Optional können Sie ein Referenzlabel zur Identifikation des Projekts sowie Schlüsselbegriffe angeben, um Transkription und Übersetzung auf Produkt- oder Markennamen auszurichten.

Aus einer URL erstellen

curl -X POST https://api.elevenlabs.io/v1/dubbing/project \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -F "source_url=https://example.com/promo.mp4" \
  -F "source_language=en" \
  -F "reference=Q3 marketing video"

Per Datei-Upload erstellen

curl -X POST https://api.elevenlabs.io/v1/dubbing/project \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -F "file=@promo.mp4" \
  -F "source_language=en" \
  -F "reference=Q3 marketing video"

Die Antwort liefert eine project_id mit dem Status queued. Wenn Sie source_language weglassen, erkennt das Modell die Sprache automatisch während der Transkription.

2) Warten, bis das Projekt bereit ist

Quellen werden asynchron transkribiert. Überprüfen Sie den Projektstatus, bis dieser auf ready steht.

curl https://api.elevenlabs.io/v1/dubbing/project/{project_id} \
  -H "xi-api-key: $ELEVENLABS_API_KEY"

Ein bereites Projekt hat das Quelltranskript erstellt und wartet darauf, dass Sie Zielsprachen hinzufügen. Der Fortschritt pro Sprache wird an den Sprachen selbst angezeigt, das Projekt bleibt ab diesem Punkt bereit.

3) Zielsprachen hinzufügen

Fügen Sie pro Ziel eine Sprache hinzu. Die Einstellung cloning_strength (0 bis 10, Standard 7) steuert das Verhältnis zwischen Ähnlichkeit zur Originalstimme und natürlicher Wiedergabe in der Zielsprache.

curl -X POST https://api.elevenlabs.io/v1/dubbing/project/{project_id}/language \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"target_language": "es", "voice_settings": {"cloning_strength": 7}}'

Jede Sprache durchläuft die Stati queued und processing bis completed.

Um in fünf Sprachen zu synchronisieren, führen Sie fünf Aufrufe für dasselbe Projekt aus. Die Quelle wird einmal transkribiert, jede Sprache übersetzt davon.

4) Synchronisierte Ausgabe herunterladen

Laden Sie die Sprache herunter, sobald ihr Status completed ist. Die Antwort enthält eine signierte Download-URL für das synchronisierte Audio.

curl https://api.elevenlabs.io/v1/dubbing/project/{project_id}/language/{language_id} \
  -H "xi-api-key: $ELEVENLABS_API_KEY"

Beachten Sie, dass Download-Links zeitlich begrenzt sind. Fordern Sie bei Bedarf einen neuen Link an.

Mit diesen vier Schritten haben Sie einen vollständig automatisierten Synchronisationsprozess: erstellen, abfragen, Sprachen hinzufügen, herunterladen.

Bearbeiten und Neugenerieren von Synchronfassungen per API

Automatisierte Ausgaben decken die meisten Anwendungsfälle ab. Für hochwertige Lokalisierung ist jedoch oft ein menschlicher Feinschliff nötig. Die Dubbing API bietet Enterprise-Kunden Segmentkontrolle auf beiden Seiten der Übersetzung.

Das Quelltranskript ist die einzige Grundlage für alle Übersetzungen und vollständig editierbar. Sie können falsch verstandene Zeilen korrigieren, Sprecherzuweisungen anpassen oder das Timing einzelner Segmente ändern:

curl -X PATCH https://api.elevenlabs.io/v1/dubbing/project/{project_id}/transcript/segment/{segment_id} \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"text": "Welcome to our latest product demo."}'

Jede Zielsprache hat ihr eigenes Transkript, das jedes Quellsegment mit der Übersetzung verknüpft. Übersetzungen sind genauso editierbar.

Sie können auch eigene Quelltranskripte und Übersetzungen bereitstellen. So bleibt Ihr bestehender Lokalisierungsprozess für die Inhalte zuständig, während das Modell die Stimmen übernimmt.

Wenn ein Transkript nach Abschluss der Synchronisation geändert wird, wird die Sprache als veraltet markiert und kann mit einem Aufruf aus dem aktuellen Text neu generiert werden.

curl -X POST https://api.elevenlabs.io/v1/dubbing/project/{project_id}/language/{language_id}/transcript/regenerate \
  -H "xi-api-key: $ELEVENLABS_API_KEY"

Neugenerierungen sind bis zur 1-fachen Dauer des Quellmediums kostenlos. Darüber hinaus wird nach Ihrem Standardtarif abgerechnet.

Anwendungsfälle für KI-Synchronisations-APIs

Eine Video-Synchronisations-API ist immer dann sinnvoll, wenn Sie Audio in großem Umfang lokalisieren müssen. Manuelle Synchronisation ist zeitaufwendig und arbeitsintensiv – eine KI-Synchronisations-API beschleunigt den Prozess erheblich.

Typische Anwendungsfälle für KI-Synchronisations-APIs:

  • Plattformen für Medienproduktion: Integrieren Sie Synchronisation direkt in Ihre Produktions-Workflows, damit Nutzer ohne Umwege in Ihrer App experimentieren können.
  • Schulungs- und Supportinhalte: Unternehmen mit globalen Teams können Inhalte in verschiedene Sprachen lokalisieren und so Onboarding-Videos für alle Nutzer bereitstellen.
  • Streaming und Medien: Lokalisierungs-Pipelines können automatisch Serien oder andere Medien für die Veröffentlichung in mehreren Regionen synchronisieren.
  • Marketingmaterialien: Starten Sie mehrsprachige Videokampagnen, ohne Sprechertexte in Dutzenden Sprachen neu aufnehmen zu müssen.
  • Edtech: Kursplattformen synchronisieren Dozentenvideos für alle Märkte und erhalten dabei die Stimme des Dozenten.

In allen Bereichen ermöglichen Synchronisations-APIs die Produktion hochwertiger, lokalisierter Inhalte im großen Maßstab.

Dubbing v2 ist jetzt auf ElevenAPI verfügbar

Die Dubbing API ist für Self-Service- und Enterprise-Entwickler verfügbar – mit Dubbing v2 für alle und Bearbeitungsendpunkten für Enterprise-Workspaces.

Entdecken Sie die Dubbing API für den vollständigen Funktionsumfang oder registrieren Sie sich und erstellen Sie einen API-Schlüssel, um Ihre erste Synchronisation in wenigen Minuten durchzuführen.

FAQ zu Synchronisations-APIs

Ähnliche Artikel

Erstellen Sie mit hochwertiger KI-Audio