Nu lanserar vi Voice Changer
- Publicerad
LyssnaLyssna på den här artikeln
Voice Changer hette ursprungligen speech-to-speech. I samband med AI-röstassistenter syftar ”speech-to-speech” även på sammanslagna arkitekturer där en enda modell hanterar ljudinmatning och utdata direkt. ElevenAgents använder en avancerad kaskadarkitektur för sin plattform. Läs mer: Kaskadbaserade kontra sammanslagna modeller.
Voice Changer
Vi har lagt till Voice Changer i Speech Synthesis. Voice Changer är ett verktyg för röstkonvertering som tar en inspelning av en röst och får den att låta som om den talades av en annan – samtidigt som den ursprungliga framförandet bevaras. Det innebär att känslorna, tajmingen, tempot och uttalet i inspelningen följer med till målrösten.
Det ger dig en nivå av kontroll som text-to-speech-promptar ensamma inte alltid kan ge. Det finns två huvudsakliga sätt att använda det på.
Få fram mer känsla ur en röst. Alla röster svarar inte lika bra på känslomässig styrning via text-to-speech-promptar. Med Voice Changer kan du spela in eller ladda upp mycket uttrycksfullt tal och återskapa samma känslomässiga omfång i en annan röst. Om du behöver att en professionell berättare låter varmare, eller att en figur i en barnbok låter mer lekfull, kan du själv framföra repliken och låta Voice Changer överföra framförandet till målrösten.
Finjustera talets framförande. Våra text-to-speech-modeller hanterar vanligtvis intonation bra direkt. Men när du behöver exakt kontroll över hur en viss fras framförs – var betoningen ligger, hur en paus faller, hur rytmen känns – kan du visa det med din egen röst och sedan tillämpa framförandet på valfri röst. Det blir ännu mer användbart när vi integrerar Voice Changer direkt i Studio, men målet är detsamma: att ge dig exakt kontroll över resultatet.
Här är en genomgång från en av medlemmarna i vår community:
Forskning
För att konvertera källtal till måltal behöver vi uttrycka innehållet i källtalet med måltalets egenskaper. En användbar liknelse är ansiktsbyte: appar som tar två ansikten och blandar dem, så att en persons drag återges i en annan persons kartlagda struktur.
Det gör du genom att ta bilden av ett ansikte och kartlägga dess egenskaper. Markörerna i exemplet nedan gör just det – de anger gränserna inom vilka det andra ansiktet skulle återges.
Nyckeln till röstkonvertering är att återge innehållet i källtalet med måltalets fonem. Men här finns en avvägning, precis som i exemplet med ansiktsbyte: ju fler markörer du använder för att kartlägga ett ansiktes egenskaper, desto fler begränsningar lägger du på ansiktet du kartlägger inom dem. Färre markörer innebär färre begränsningar.
Samma sak gäller röstkonvertering. Ju mer vi prioriterar måltalet, desto större är risken att det hamnar ur synk med källtalet. Men om vi inte prioriterar det tillräckligt riskerar vi att förlora mycket av det som ger talet dess karaktär. Om vi till exempel skulle återge en inspelning av någon som skriker argt med en viskande röst, skulle vi få problem. Om vi ger för stor prioritet åt känslorna i källtalet blir priset att intrycket av en viskande röst går förlorat. Lägger vi för stor vikt vid det viskande talmönstret förlorar vi den känslomässiga laddningen i källtalet.
Produkt och senaste uppdateringar
Ändringar i färdiga röster
Vi gör ändringar i standardrösterna som finns i Speech Synthesis. Vi kommer att fasa ut några röster och ersätta dem med nya, med över 20 tillägg planerade under de kommande veckorna.
Vi kommer också att börja visa information i gränssnittet om hur länge varje röst förväntas vara tillgänglig. Under december kommer vi att göra om funktionerna för röstdelning och ersättning för användning för att förbättra röstutbudet. Mer information kommer snart.
Eleven Turbo v2 och uLaw-formatet 8 kHz
Turbo v2 är resultatet av månader av forskning från vårt team. Den är utformad för interaktioner i realtid, men fungerar för alla användningsområden. Den har också stöd för standardformatet (m)uLaw 8 kHz för IVR-system.
Normalisering och metadata med Studio
Studio har nu stöd för branschstandardiserade riktlinjer för inlämning av ljudböcker, inklusive nivåjustering och dynamisk komprimering. Du kan också bädda in metadata (ISBN, författare och titel) direkt i ditt Studio-projekt.
Uttalslexikon
Det här har varit en av våra mest efterfrågade funktioner. Förra månaden lade vi till stöd för SSML-taggar som anger uttal med IPA- och CMU-lexikon i våra engelska modeller. Nu har vi lanserat stöd för uttalslexikon i Studios gränssnitt, så att du kan ladda upp en fil som anger uttal med IPA, CMU eller ordersättningar (alias). Lexikonfiler använder branschstandardens öppna .PLS-lexikonfilformat.
IPA och CMU stöds för närvarande av Turbo v2 English. Ordersättningar stöds av alla modeller och språk. Fullständig dokumentation finns här.
Har du feedback? Tveka inte att kontakta oss på Discord!
Prova Voice Changer
Säg det som du vill och hör det framföras med en helt annan röst, med full kontroll över framförandet. Fånga viskningar, skratt, accenter och subtila känslomässiga nyanser.
Säg det på ditt sätt och hör det levererat med en helt annan röst – med full kontroll över uttrycket. Fånga viskningar, skratt, dialekter och subtila känslouttryck.




