Hoppa till innehållet

Vi presenterar Eleven Multilingual v1: Vår nya talsyntesmodell

Publicerad

LyssnaLyssna på den här artikeln

I dag är vi glada över att lansera Eleven Multilingual v1 – vår avancerade talsyntesmodell med stöd för sju nya språk: franska, tyska, hindi, italienska, polska, portugisiska, och spanska. Vår nuvarande deep learning-metod bygger vidare på forskningen bakom Eleven Monolingual v1 och använder mer data, större beräkningskapacitet och nya tekniker i en allt mer avancerad modell. Den kan förstå nyanser i text och leverera en känslomässigt rik prestation. Framsteget ger kreatörer, spelutvecklare och utgivare fler kreativa möjligheter och banar väg för generativ media som kan skapa mer lokalt anpassat, tillgängligt och fantasifullt innehåll.

Den nya modellen finns i alla abonnemang och du kan prova den nu på vår betaplattform.

För att använda den väljer du den bara i den nya rullgardinsmenyn i panelen för talsyntes.

Forskningsöversikt

Precis som sin föregångare bygger den nya modellen helt på vår egen forskning. Den behåller alla de styrkor som gjorde Eleven Monolingual v1 till ett utmärkt verktyg för berättande, som förmågan att anpassa framförandet efter sammanhanget och förmedla avsikter och känslor på ett hyperrealistiskt sätt. Dessa funktioner har nu utökats till de nya språken genom träning på flerspråkiga data.

En viktig funktion i modellen är dess förmåga att identifiera flerspråkig text och uttala den korrekt. Du kan nu generera tal på flera språk med en enda prompt och samtidigt behålla varje talares unika röstegenskaper. För bästa resultat rekommenderar vi en prompt på ett enda språk. Modellen fungerar redan ganska bra med flera språk samtidigt, men behöver förbättras ytterligare.

Den nya modellen är kompatibel med andra VoiceLab-funktioner, som Instant Voice Cloning och Voice Design. Alla skapade röster förväntas behålla de flesta av sina ursprungliga talegenskaper på alla språk, inklusive sin ursprungliga accent.

Modellen har dock vissa kända begränsningar: siffror, förkortningar och utländska ord uttalas ibland på engelska när prompten är på ett annat språk. Till exempel kan siffran "11" eller ordet ”radio” i en spansk prompt uttalas som på engelska. Vi rekommenderar att du skriver ut förkortningar och siffror på målspråket medan vi arbetar på förbättringar.

Demokratisering av rösten

ElevenLabs grundades med drömmen om att göra allt innehåll universellt tillgängligt på alla språk och med alla röster. Våra medarbetare kommer från hela Europa, Asien och USA. I takt med att både vårt team och världen blir allt mer flerspråkiga enas vi allt starkare kring visionen att göra mänskligt naturtrogna AI-röster tillgängliga på alla språk.

Den senaste versionen av vår Text to Speech (TTS)-modell är bara det första steget mot att förverkliga denna vision. Med mänskligt naturtrogna AI-röster kan användare och företag nu skapa och anpassa ljudinnehåll efter sina behov, prioriteringar och preferenser. Detta har redan visat potential att jämna ut spelplanen för kreatörer, småföretag och oberoende artister. Med kraften i AI-ljud kan användare nu skapa högkvalitativa ljudupplevelser som kan mäta sig med dem från större organisationer med mer resurser.

Dessa fördelar omfattar nu även flerspråkiga, mångkulturella och utbildningsrelaterade användningsområden genom att ge användare, företag och institutioner möjlighet att skapa autentiskt ljud som når en bredare publik. Genom att erbjuda ett stort urval av röster, accenter och språk hjälper AI till att överbrygga kulturella klyftor och främja global förståelse. På Eleven tror vi att denna nya tillgänglighet i slutändan främjar mer kreativitet, innovation och mångfald.

Innehållsskapare som vill nå olika målgrupper har nu verktygen för att överbrygga kulturella klyftor och främja inkludering.

Spelutvecklare och utgivare kan skapa uppslukande, lokalt anpassade upplevelser för en internationell publik, överbrygga språkbarriärer och nå spelare och lyssnare för att maximera engagemang och effektivitet utan att kompromissa med kvalitet eller noggrannhet.

Utbildningsinstitutioner har nu möjlighet att skapa ljudinnehåll för olika användare på deras målspråk, vilket stärker språkförståelse och till och med uttalsförmåga samt möter olika undervisningsstilar och inlärningsbehov.

Tillgänglighetsinstitut kan nu ytterligare stärka personer med synnedsättning eller inlärningssvårigheter genom att ge dem möjlighet att enkelt omvandla mindre tillgängliga resurser till ett format som passar deras behov, både vad gäller innehåll och form.

Vi ser fram emot att se våra nuvarande och framtida kreatörer och utvecklare tänja på gränserna för vad som är möjligt!

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet