Gå till innehåll

AI-dubbnings-API: Så dubbar du ljud och video i stor skala

Skriven av
Jack Limebear
Publicerad

LyssnaLyssna på den här artikeln

För några decennier sedan innebar det att dubba en video att boka studio, anlita röstskådespelare för målspråket, spela in (och spela om) varje replik och sedan vänta veckor på slutleveransen.

Ett AI-dubbnings-API gör om hela processen till några REST-anrop. Skicka in ditt ljud eller video och få tillbaka en dubbad version på nya språk, med originalets tajming och känsla bevarad.

Den här guiden förklarar hur ett AI-dubbnings-API fungerar och vad som skiljer ett produktionsklart API från ett hoplappat flöde. Vi visar också hur du integrerar ElevenLabs nya dubbnings-API, som nu erbjuder Dubbing v2, vår senaste dubbningsmodell, i alla arbetsflöden.

Sammanfattning

  • Ett AI-dubbnings-API tar källjud eller video och returnerar dubbad output på nya språk.
  • Dubbing v2 är en ljud-till-ljud-modell som utgår från originalets prestation, vilket gör att känsla, ton och leverans följer med i varje dub.
  • ElevenLabs Dubbing API täcker 90+ språk med synkroniserad översättning.
  • Utvecklare skapar ett dubbningsprojekt, lägger till målspråk och laddar ner färdiga dubbar med några REST-anrop.
  • Företagskunder kan redigera källmanus och översättningar och sedan bara återskapa de segment som ändrats.

Vad är ett AI-dubbnings-API?

Ett AI-dubbnings-API är ett programmerbart gränssnitt som tar emot ljud eller video på ett språk och returnerar dubbad ljudfil på målspråk. Det automatiserar hela lokaliseringskedjan: transkriberar källan, översätter dialogen, klonar varje talares röst, genererar tal på målspråket och synkar resultatet med originalets tajming.

Utvecklare har tidigare kopplat ihop Speech to Text, maskinöversättning och Text to Speech till provisoriska dubbningsflöden, men de är inte tillförlitliga för större volymer.

Talarnas identitet försvinner mellan stegen, tajmingen kan glida och ett manus som var fullt av känsla blir monotont.

Ett dubbnings-API som är byggt för ändamålet har flera funktioner som löser de här problemen. Med allt från talarseparation och röstbevarande till intern synkning och röstkloning gör ett högkvalitativt AI-dubbnings-API att resultatet låter som originaltalaren, inte bara som en platt översättning.

Dubbing v2 API logo on a gray textured background.

Så fungerar AI-dubbning: Ljud-till-ljud vs. kedjade flöden

De flesta automatiserade dubbningssystem är kedjade flöden. De transkriberar källjudet, översätter manuset och syntetiserar nytt tal från texten. Allt utöver själva manuset – som tvekan, spänning, sarkasm eller en viskning – försvinner innan syntesen ens börjar.

ElevenLabs Dubbing v2 gör på ett annat sätt.

Dubbing v2 erbjuder en ljud-till-ljud-modell som utgår direkt från originalinspelningen, inte från ett manus. Ton, känsla och uttryck följer med i dubben eftersom modellen hör prestationen istället för att läsa en beskrivning av den.

Comparison of audio-to-audio dubbing vs. cascaded dubbing, highlighting benefits of emotional tone, voice cloning, and timing in Dubbing v2, leading to dubs at 80-90% of human quality. AI Dubbing API

Vi uppskattar att Dubbing v2 ger dubbar med 80–90 % av mänsklig kvalitet, vilket gör att AI-dubbning nu fungerar även för filmiskt innehåll.

Tre andra viktiga funktioner kompletterar Dubbing v2:

  • Synkroniserad översättning: Modellen översätter med tajming i åtanke, så start och stopp i den dubbade ljudfilen matchar originalet direkt. Ingen videoredigering eller läppsynk krävs. Ljudet hamnar exakt där originaldialogen låg.
  • Automatisk voice cloning: Varje översättning levereras med en röstklon av originaltalaren, utan att du behöver klona manuellt. Talarnas identitet, tonhöjd och klang bevaras på alla språk, även med flera talare.
  • Lokal noggrannhet: Dubbing v2 skiljer på regionala varianter, som latinamerikansk eller kastiliansk spanska, med landskoder som pt-BR för brasiliansk portugisiska.

Vad ska du leta efter i ett AI-dubbnings-API?

När du utvärderar ett AI-dubbnings-API för din utvecklarprocess finns det några viktiga kriterier att tänka på.

Här är de viktigaste funktionerna i de bästa AI-dubbnings-API:erna:

  • Brett språk- och lokalstöd: Sök efter bredd (90+ språk) och möjlighet att styra regionala varianter.
  • Bevarande av prestation: Fråga om systemet utgår från källjudet eller manuset. Ljud-till-ljud-arkitektur avgör om känslan överlever dubben.
  • Sömlös synkkvalitet: Dubbat ljud som tappar tajmingen mot originalet leder till timmar av manuellt efterarbete. Synken måste fungera direkt för att slippa extra jobb.
  • Stöd för flera talare och bakgrund: Ett AI-dubbnings-API ska klara överlappande talare eller sound effects utan problem. API:et ska också bevara bakgrunds-musik eller mixar i klippet.
  • Redigering och återskapande: Ett dubbnings-API där du kan rätta ett manus, förbättra en översättning och bara återskapa de segment som ändrats sparar dig från att dubba om hela filer.
  • Regelefterlevnad: Företagskunder behöver SOC 2-, GDPR- och ISO 27001-efterlevnad innan innehåll går genom systemet.

Resten av guiden går igenom Dubbing API med ElevenLabs, som har alla funktioner i listan ovan.

Key criteria for choosing an AI dubbing API, highlighting ElevenAPI's features.

Så dubbar du ljud och video med ElevenLabs Dubbing API

Dubbing API är uppbyggt kring projekt. Varje projekt innehåller en källfil och dess manus. Du kan sedan lägga till ett målspråk per språk du vill dubba till, där varje språk får sin egen översättning och output.

Det grundläggande skapa-och-hämta-flödet nedan är tillgängligt för alla användare på ElevenAPI-plattformen.

The dubbing process on ElevenAPI in four REST calls: create, poll, add languages, download.

1) Skapa ett dubbningsprojekt

Skicka in ditt källmaterial som filuppladdning eller via en publik URL. Autentisering sker med din API-nyckel i xi-api-key-headern. Du kan lägga till en valfri referensetikett för att identifiera projektet och nyckelord för att styra transkribering och översättning mot produkt- eller varumärkesnamn.

Skapa från URL

curl -X POST https://api.elevenlabs.io/v1/dubbing/project \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -F "source_url=https://example.com/promo.mp4" \
  -F "source_language=en" \
  -F "reference=Q3 marketing video"

Skapa från filuppladdning

curl -X POST https://api.elevenlabs.io/v1/dubbing/project \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -F "file=@promo.mp4" \
  -F "source_language=en" \
  -F "reference=Q3 marketing video"

Svaret returnerar ett project_id med status queued. Utelämna source_language så upptäcker modellen det automatiskt vid transkribering.

2) Poll:a tills projektet är klart

Källor transkriberas asynkront, så poll:a projektet tills statusen är ready.

curl https://api.elevenlabs.io/v1/dubbing/project/{project_id} \
  -H "xi-api-key: $ELEVENLABS_API_KEY"

Ett klart projekt har sitt källmanus färdigt och väntar på att du lägger till målspråk. Framstegen per språk finns på respektive språk, så projektet förblir klart från och med nu.

3) Lägg till målspråk

Lägg till ett språk per mål. Inställningen cloning_strength (0 till 10, standard 7) styr balansen mellan likhet med originalrösten och naturlig leverans på målspråket.

curl -X POST https://api.elevenlabs.io/v1/dubbing/project/{project_id}/language \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"target_language": "es", "voice_settings": {"cloning_strength": 7}}'

Varje språk går från queued till processing till completed.

För att dubba till fem språk gör du fem anrop mot samma projekt. Källan transkriberas en gång och varje språk översätts från den.

4) Ladda ner den dubbade outputen

Hämta språket när statusen är completed. Svaret innehåller en signerad nedladdningslänk för den dubbade ljudfilen.

curl https://api.elevenlabs.io/v1/dubbing/project/{project_id}/language/{language_id} \
  -H "xi-api-key: $ELEVENLABS_API_KEY"

Tänk på att nedladdningslänkar är tidsbegränsade, så hämta språket igen när du vill ha en ny länk.

Med de här fyra stegen har du ett helt automatiserat dubbningsflöde: skapa, poll:a, lägg till språk, ladda ner.

Redigera och återskapa dubbar via API

Automatiserad output täcker de flesta behov, men för premiumlokalisering behövs ofta en mänsklig genomgång av orden för att allt ska kännas rätt. Dubbing API ger företagskunder kontroll på segmentnivå över båda sidor av översättningen.

Källmanuset är den enda sanningskällan som alla språk översätts från, och det är helt redigerbart. Du kan rätta en felhörd replik, ändra talarroll eller justera tajming på valfritt segment:

curl -X PATCH https://api.elevenlabs.io/v1/dubbing/project/{project_id}/transcript/segment/{segment_id} \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"text": "Welcome to our latest product demo."}'

Varje målspråk har sitt eget manus, där varje källsegment paras med sin översättning. Översättningarna kan redigeras på samma sätt.

Du kan också använda eget källmanus och översättning, så att din befintliga lokaliseringsprocess styr orden medan modellen hanterar rösterna.

När ett manus ändras efter att en dub är klar markeras språket som inaktuellt, och ett enda anrop återskapar det från aktuell text.

curl -X POST https://api.elevenlabs.io/v1/dubbing/project/{project_id}/language/{language_id}/transcript/regenerate \
  -H "xi-api-key: $ELEVENLABS_API_KEY"

Återskapanden är gratis upp till 1x källmediets längd, så du kan iterera på en översättning utan att dubbningskostnaden ökar. Efter 1x-kvoten debiteras återskapande enligt din vanliga dubbningstaxa.

Användningsområden för AI-dubbnings-API

Ett video-dubbnings-API är användbart när du behöver lokalisera ljud i stor skala. Manuell dubbning tar tid och är arbetskrävande, medan ett AI-dubbnings-API gör processen mycket snabbare.

Här är några exempel på hur AI-dubbnings-API:er kan användas:

  • Plattformar för mediaskapande: Bygg in dubbning direkt i dina produktionsflöden så att användare kan testa utan att lämna din app.
  • Utbildnings- och supportmaterial: Företag med globala team kan lokalisera innehåll till olika språk och stötta onboarding-videor för alla användare.
  • Streaming och media: Lokaliseringsflöden kan automatiskt dubba långserier eller annat innehåll för lansering i flera regioner.
  • Marknadsföringsmaterial: Rulla ut flerspråkiga videokampanjer utan att behöva spela in röstskådespelare på dussintals språk.
  • Edtech: Kursplattformar dubbar lärarvideor till alla marknader de når, samtidigt som lärarens röst bevaras.

Sammanfattningsvis gör dubbnings-API:er det enkelt att producera högkvalitativt, lokaliserat innehåll i stor skala.

Dubbing v2 är nu live på ElevenAPI

Dubbing API är tillgängligt för både självbetjänings- och företagsutvecklare, med Dubbing v2 för alla och redigeringsendpoints för företagsarbetsytor.

Utforska Dubbing API för att se hela funktionsutbudet, eller skapa ett konto och hämta en API-nyckel för att köra din första dub på några minuter.

Vanliga frågor om dubbnings-API

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet