Denna Röst Existerar Inte - Generativ Röst-AI
- Publicerad
LyssnaLyssna på den här artikeln
På sistone verkar alla prata om generativ AI. Stora språk- och text-till-bild-modeller som drivs av djupinlärning, till exempel ChatGPT, Stable Diffusion, DALL-E och Midjourney, har skapat stor uppståndelse i teknikvärlden och långt utanför den. Många räknar dem till de viktigaste AI-framstegen på senare tid. Oavsett om du håller med eller inte verkar den allmänna uppfattningen vara att något väldigt kraftfullt har dykt upp. Under 2023 kommer vi att höra om modeller som kan hjälpa dig att rita eller skapa videor. Precis som med frågan om vilken smartphone som är bäst just nu kommer vi snart att fråga vilken grundmodell som är bäst. Men trots all denna uppståndelse tycker vi att ett område inom generativa medier fortfarande får alldeles för lite uppmärksamhet: röst-AI. Det är också området där vi vill bli ledande. På Eleven använder vi varje dag möjligheterna med djupinlärning för att driva våra naturtrogna Text to Speech- och Voice Cloning-verktyg. Nu lanserar vi även vår egen generativa modell som låter dig skapa helt nya syntetiska röster från grunden.
Röstgenerator – skapa en röst
Våra användare använder plattformen varje dag för att ge sina karaktärer liv – oavsett om det gäller ljudböcker, spel eller fanfiction. Vi insåg att vårt nuvarande röstbibliotek är för litet för att alla ska kunna hitta röster som passar deras innehåll och samtidigt är unika för varje användare. Vår lösning var att låta dig skapa helt nya syntetiska röster.
Idén om hur vi skulle göra detta växte fram när vi analyserade metoderna vi redan använder för talsyntes och Voice Cloning. Båda processerna kräver ett sätt att koda egenskaperna hos en viss röst. Speaker embeddings bär denna identitet – de är en vektorrepresentation av en talares röst. Vi insåg att vi kunde sampla från fördelningen av speaker embeddings genom att träna en särskild modell som låter oss skapa oändligt många nya röster.
Eftersom våra användare främst letar efter specifika talegenskaper behövde vi lägga till viss kontroll över processen. Vi utökade vår modell med villkorning för att generera röster utifrån deras egenskaper. Modellen låter dig nu ställa in vissa grundläggande parametrar som fastställer den nya röstens kärnidentitet: kön, ålder, accent, tonhöjd och talstil. Med andra ord får du varje gång du klickar på ”generera”, även om du väljer samma grundparametrar, en helt ny röst som inte fanns tidigare.
Här är några exempel på röster som kan skapas på det här sättet:
”Design Voice” blir tillgängligt på vår plattform i februari, som en del av Voice Lab.
Vad kan det användas till?
Våra verktyg kan redan producera tal som är lika naturtroget som en människas, och vi förväntar oss att användningsområdena för artificiella röster bara kommer att växa. Många av dessa nya användningar, till exempel ljudinspelningar för nyhetspublikationer eller reklam, kräver att en röst är knuten till och förknippad med ett specifikt varumärke eller användningsområde och inte används någon annanstans. Andra användningsområden, som berättande och videospel, prioriterar flexibilitet och friheten att experimentera tidigt i utvecklingen. I stället för att skapa en enorm uppsättning virtuella talare ville vi därför låta användarna själva avgöra vilka röster som passar deras syften bäst.
Bokförfattare får nu inte bara möjlighet att enkelt omvandla sina verk till ljud, utan behåller också den konstnärliga kontrollen över att skapa skräddarsydd berättarröst. Det ger deras publik intressanta nya sätt att interagera med publikationer och ökar dessutom kraftigt antalet böcker vi kommer att kunna lyssna på.
Nyhetsutgivare satsar allt mer på ljud, och att välja utmärkande röster som representerar deras publikationer är en viktig uppgift – många lyssnare värdesätter både form och innehåll. Lika viktigt är att utgivare nu kan vara säkra på att en viss röst representerar dem, och bara dem.
Dataspelsutvecklare kan nu ge röst åt en mängd annars stumma NPC:er, med alla nödvändiga verktyg nära till hands. De kan inte bara arbeta mer kostnadseffektivt utan att tumma på kvaliteten, utan även skapa röster som är helt unika för de virtuella världar de bygger.
Reklamkreatörer behöver voice-over som passar specifika kampanjer, så möjligheten att skapa träffsäker och ändamålsenlig berättarröst redan i början av utvecklingen är en stor fördel. De kan nu direkt experimentera med flera röster och olika sätt att framföra innehållet, utan att behöva ta in ytterligare resurser.
Från kreatörer som producerar alla typer av ljud- och videoinnehåll till företagsrepresentanter som vill ge röst åt företagskommunikation – möjligheterna att skapa övertygande ljud som både är unikt och anpassat till ett specifikt användningsområde är nu oändliga.
Etisk AI
Precis som Voice Cloning väcker oro kring följderna av möjlig felanvändning, oroar sig allt fler för att AI-teknikens spridning kommer att hota yrkesverksammas försörjning. På Eleven ser vi en framtid där röstskådespelare kan licensiera sina röster för att träna talmodeller för specifika användningar, mot ersättning. Kunder och studior kommer fortfarande gärna att anlita professionella rösttalanger i sina projekt, och AI bidrar helt enkelt till snabbare leveranser och större frihet att experimentera och sätta riktning tidigt i utvecklingen. Tekniken kommer att förändra hur talat ljud utformas och spelas in, men att röstskådespelare inte längre behöver vara fysiskt närvarande vid varje inspelning ger dem verklig frihet att medverka i fler projekt samtidigt och att faktiskt föreviga sina röster.
Dessutom är vi glada över att en mängd böcker, nyheter, oberoende spel och annat innehåll, vars författare och utvecklare annars inte skulle ha råd med inspelningskostnader, nu blir tillgängliga genom ett annat medium. Den ökade tillgängligheten ger också möjlighet att nå en bredare publik i varje enskilt fall.
På Eleven är vi helt engagerade i att både respektera immateriella rättigheter och införa skydd mot möjlig felanvändning av vår teknik:
- Vi samarbetar bara med kunder som följer våra villkor, vilka förbjuder illvillig användning av vår teknik för syften som kan anses olagliga eller skadliga;
- Vi arbetar också med att vattenmärka allt ljud som genereras av vår modell, så att det omedelbart kan spåras tillbaka till oss;
- När vi använder igenkännbara röster gör vi det i demonstrationssyfte och i sammanhang som inte leder till intressekonflikter;
- Samtidigt vill vi stödja röstinnehavare och deras licensgivare när de gör anspråk på sina rättigheter, och alla kända intrång kommer att granskas och åtgärdas.
Framöver – förbättra din egen röst
I framtiden planerar vi att kombinera funktionerna i våra modeller för röstgenerering och Voice Cloning så att användare kan förbättra sina egna röster. Du kommer att kunna klona din röst och sedan anpassa den precis som du vill. Om du tycker att ditt naturliga sätt att tala är lite monotont kan du göra det mer varierat. Om du verkligen ogillar att bli inspelad kan du justera resultatet så att det låter mer naturligt. Alla som behöver producera ljud med sin egen röst, oavsett om det är en förinspelad presentation eller ett röstmeddelande, kommer att kunna göra det med vår verktygssvit med ett klick.
Gott nytt år
När 2022 närmade sig sitt slut vill vi tacka våra betaanvändare för ert fortsatta deltagande och er feedback. Många av funktionerna vi utvecklar bygger på era synpunkter och förslag. Vi kunde inte vara gladare över att ha er med oss och önskar er alla ett gott nytt år.
Eleven Labs Beta
Gå hit för att registrera dig för vår betaplattform och prova den själv. Vi gör ständigt förbättringar, och era insikter är mycket värdefulla för oss i det här tidiga skedet.

.jpg&w=3840&q=80)


