Hoppa till innehållet

Röstkonvertering

Publicerad
Senast uppdaterad

LyssnaLyssna på den här artikeln

Vad är röstkonvertering?

Med röstkonvertering kan du förvandla en persons röst till en annans. Den använder en process som kallas Voice Cloning för att koda målrösten – alltså rösten vi konverterar till – och skapa samma budskap, uttalat på ett sätt som motsvarar måltalaren identitet men bevarar den ursprungliga intonationen.

Användningsområden

Röstkonvertering och Voice Cloning av hög kvalitet kan förändra hur innehåll produceras, distribueras och används i en rad olika branscher. Tekniken kan effektivisera produktionstid och kostnader, och ge personer som delar sina röster för att träna konverteringsalgoritmer möjlighet att få passiva ersättningar.

  • Inom film kan skådespelare dela sina röstdata med producenter för att skapa ljudspår utan att behöva resa till inspelningsplatsen eller studion;
  • felsagda repliker kan spelas in på nytt mycket effektivare i efterproduktionen;
  • tekniken kan också användas för att trovärdigt återskapa historiska personers röster i fiktiva scenarier eller väcka avlidna skådespelare till liv igen;
  • inom spelutveckling kan tekniken vara lika användbar: repliker kan korrigeras eller testas direkt, utan att skådespelaren behöver vara på plats för inspelning;
  • inom vården kan patienter som har förlorat talförmågan, till exempel till följd av behandling för strupcancer, få möjlighet att kommunicera igen med sin egen röst;
  • virtuella assistenter kan bli personliga, eftersom användare hemma kanske tycker att det känns mer naturligt att interagera med rösten från en närstående än med en virtuell främlings;
  • reklambranschen kan i sin tur dra nytta av syntetiska voice-overs som låter lika verkliga som mänskliga röster, men undviker frågor om rättighetsägande och royalties. Om det däremot är en igenkännbar röst som behövs kan reklamproducenter också använda tekniken för att, med samtycke, klona en viss skådespelares röst utan att personen behöver närvara vid långa inspelningssessioner;
  • ljudboks- och podcastbranschen är ytterligare två växande områden där Voice Cloning och röstkonvertering kan effektivisera produktion och redigering av uppslukande innehåll.

ElevenLabs röstkonvertering

Även om vi på Eleven utvecklar programvara för röstkonvertering som en del av vår verktygslåda, driver vår forskning om Voice Cloning och talsyntes främst utvecklingen av vår huvudprodukt, som vi planerar att lansera i början av nästa år: det automatiska, identitetsbevarande dubbningsverktyget.

Vårt mål är att göra allt talat innehåll tillgängligt på olika språk med originaltalarnas röster, med ett knapptryck. Föreställ dig en utbildande YouTube-video på engelska. Om någon bara talar spanska – men annars skulle tycka att ämnet var intressant om personen bara förstod språket – är det ett problem. Visst är undertexter en lösning, men vårt mål är att erbjuda ett mycket mer uppslukande och underhållande sätt att ta del av innehåll. Vi vill kunna låta samma person naturligt framföra samma budskap på spanska i nivå med en infödd talare, även om personen egentligen inte kan språket.

För detta ändamål låter Voice Cloning oss bevara deras identitet – hur deras röst låter. Vi använder det för att skapa nya yttranden på ett annat språk, så att det låter som om samma person talar.

Röstkonvertering är viktigt eftersom vi vill bevara personens känslor, avsikt och sätt att tala för maximal inlevelse. Vi tränar robusta flerspråkiga modeller som gör det möjligt att analysera yttranden på källspråket och överföra dem till målspråket med rätt intonation.

Process

För att konvertera en persons röst till en annans, alltså tal från en källröst till tal från en målröst, behöver vi en algoritm som kan uttrycka innehållet i källtalet med måltalets egenskaper. En bra jämförelse är appar för ansiktsbyte, där du kan blanda ditt ansikte med någon annans och skapa en bild där båda blir ett.

Det görs genom att ta bilden av ett ansikte och kartlägga dess egenskaper. Punkterna i exemplet nedan gör just det: de utgör gränserna inom vilka det andra ansiktets drag återges.

Vid röstkonvertering behöver algoritmen kunna koda måltalets egenskaper. Algoritmen tränas på en datamängd med många exempel på det talet. Den bryter ner dessa exempel till en grundläggande nivå – talets ”atomer”, så att säga. Tal består av meningar. Meningar består av ord. Ord består av fonem, och de utmärker måltalets egenskaper. Det är på denna grundläggande nivå som algoritmen arbetar.

Tricket med röstkonvertering är att återge innehållet i källtalet med fonemen från måltalet. Men här finns en avvägning, precis som i exemplet med ansiktsbyte: ju fler markörer du använder för att kartlägga ett ansiktes egenskaper, desto fler begränsningar lägger du på ansiktet som ska placeras inom dem. Färre markörer innebär färre begränsningar. Samma sak gäller röstkonvertering. Ju större vikt vi lägger vid måltalet, desto större risk att vi hamnar ur synk med källtalet. Men om vi inte lägger tillräcklig vikt vid det riskerar vi att förlora mycket av det som gör talet karaktäristiskt. Om vi till exempel skulle återge en inspelning av någon som skriker argt med Morgan Freemans röst, uppstår ett problem. Om vi ger för stor vikt åt känslorna i källtalet blir priset att det inte längre låter som att Morgan Freeman talar. Lägger vi för stor vikt vid hans talmönster förlorar vi källtalets känslomässiga laddning.

Etik

De etiska frågorna kring Voice Cloning behöver tas på allvar, eftersom risken för missbruk av tekniken oroar allt fler. År 2020 använde bedragare ljuddeepfakes för att utge sig för att vara en VD i ett telefonsamtal och godkänna en banköverföring på 35 miljoner dollar. En teknik som trovärdigt kan få det att framstå som att någon sagt något de inte har sagt väcker naturligtvis oro för desinformation, förtal och bedrägerier. På samma sätt väcker röstkonvertering viktiga frågor om upphovsrättsintrång om den låter användare tjäna på innehåll som skapats utan röstägarnas samtycke.

På Eleven anser vi att vi måste göra vad vi kan för att se till att vår teknik inte används i skadliga syften och införa skyddsåtgärder mot riskerna:

  • vi samarbetar bara med kunder som följer våra villkor, vilka förbjuder skadlig användning av vår teknik i syfte att sprida desinformation, förtala, begå bedrägerier eller för andra ändamål som kan anses olagliga eller skadliga;
  • syntetiskt videoinnehåll som produceras av Eleven har en tydlig vattenstämpel som anger att det är AI-genererat. Ljudinnehåll har en tydlig filbeskrivning. När vi använder igenkännbara röster gör vi det i demonstrationssyfte och i sammanhang som inte leder till intressekonflikter;
  • samtidigt vill vi stödja röstägare och deras licensgivare när de gör anspråk på sina rättigheter.
  • Om du har idéer om hur vi kan förbättra vår hållning får du gärna kontakta oss på ethics@elevenlabs.io

Vi anser inte att rädslan för missbruk bör vara den främsta faktorn som styr vår inställning till kraftfull ny teknik. I stället bör vi se till att lämpliga skyddsåtgärder införs under utvecklingen för att minimera risken för skada, samtidigt som vi tar vara på den potential tekniken erbjuder samhället i stort.

Framtiden

Röstkonvertering och Voice Cloning kan förändra film, tv, innehållsskapande, spelutveckling, podcast och ljudböcker, liksom reklambranschen. Men användningsområdena sträcker sig bortom det kommersiella, med möjligheter inom vård, utbildning och kommunikation.

Voice Cloning banar väg för en framtid där allt innehåll kan skapas på vilket språk och med vilken röst som helst, nå miljontals människor världen över och skapa en helt ny ekonomi. Vårt mål på Eleven är att bidra till att förverkliga den framtiden.

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet