Vi presenterar Eleven v4Möt Eleven v4, vår mest uttrycksfulla modell hittills. Med 3× fler krediter inkluderade i Creator+ till och med den 12 oktober

Hoppa till innehållet

Emotionell Text to Speech: Så regisserar du AI-röstprestationer med Eleven v4

Skriven av
Jack Limebear
Publicerad
Senast uppdaterad

LyssnaLyssna på den här artikeln

Emotionell text to speech (TTS) förvandlar ett manus till en prestation. I stället för en monoton uppläsning levererar en uttrycksfull TTS-modell varje ord med känsla och väcker en scen till liv med ilska, glädje, sorg, frustration och mer.

Genom att väva in Audio Tags i manuset formar du en text to speech-prestation precis som en regissör. Lägg till [furious] för att öka intensiteten i en replik, [sarcastic] för en glimt av torr humor eller någon annan tagg för att visa modellen hur du vill att repliken ska framföras. 

Med Eleven v4 får du emotionell TTS som du kan regissera rad för rad. Så här bygger du manus som väcker ditt skrivande till liv.

Vad är emotionell text to speech?

Emotionell text to speech är AI-genererat tal som framför en replik i stället för att bara läsa upp den. Den uttrycker känslor, förstår tajming och tempo, betonar rätt ord och lägger till icke-verbala ljud som suckar och skratt.

Eleven v4 är en banbrytande modell som förvandlar text till en verklig prestation. Med beskrivningar direkt i texten kan samma mening viskas, ropas eller framföras genom tårar, beroende på vad du föreställer dig.

Oavsett om du skriver en reklamkampanj inför nästa lansering eller väcker kapitlen i din roman till liv finns Eleven v4 där för att stötta dig med Text to Speech av högsta kvalitet.

Så tolkar Eleven v4 emotionella instruktioner

Eleven v4 tar emotionella ledtrådar från Audio Tags i ditt manus och förvandlar dem till en naturlig ljudprestation.

Här är några sätt att lägga till emotionella instruktioner i en text med Eleven v4 för att förbättra slutresultatet:

  • Audio Tags: Skriv Audio Tags i dina instruktioner, som [whispers] eller [cries], för att lägga in regi direkt i manuset. Du kan skapa scener med känslomässigt djup genom att regissera v4 precis som vilken scenartist som helst.
  • Interpunktion: Använd interpunktion för att forma tempo och framförande tillsammans med dina Audio Tags. Tre punkter saktar ner en replik, tankstreck avbryter en talare mitt i meningen och utropstecken ökar intensiteten. Det ger dig ytterligare ett lager av regi utan att lägga till en tagg.
  • Emotionell kontinuitet: Börja en mening med en känsla, så behåller Eleven v4 den tonen genom hela repliken. Bygg dina scener stegvis och skapa innehållsrika, kontextuella manus med Audio Tags i v4.

För att visa hur effektivt Audio Tags väcker text till liv med v4 ska vi utforska skillnaden mellan ljud med och utan taggar.

I det första exemplet använder vi bara en standardmening. Som referens använder vi Siren i de här exemplen.

Berättelsestycke utan Audio Tags i Eleven v4

The night was quiet, almost unnaturally so. Until I heard the old gate creak open behind me.
I turned slowly and called out, "Is anyone there?"
No answer.
Then, from somewhere in the darkness came a low, quiet laugh.
I took a step back. "You really shouldn't have come here," a voice whispered.
And then the lights went out.
0:00

Det andra exemplet har samma mening, men med Audio Tags tillagda. Här har vi emotionella signaler, ljudeffekter och till och med ljud utöver texten, som ett ondskefullt skratt.

Berättelsestycke med Audio Tags i Eleven v4

[hesitant] The night was quiet, almost unnaturally so.
[nervous] Then I heard the old gate creak open behind me. [gate creaking] [scared] I turned slowly and called out, "Is anyone there?"
[tense, cautious] No answer.
[silence] [whispering, fearful] Then, from somewhere in the darkness, came a low, quiet laugh. [evil laugh] [alarmed] I took a step back. [footstep] [low, threatening] "You really shouldn't have come here." A voice whispered.
[whisper] [terrified] And then the lights went out. [light switch clicking]
0:00
Eleven v4 emotional text to speech uses audio tags, punctuation, and emotional continuity to direct emotion.

Fem emotionella text to speech-prestationer med Eleven v4

Det bästa sättet att visa hela registret hos Eleven v4 är att prova själv. När du skapar ett konto kan du börja använda Eleven v4 på några minuter.

För att ge dig en liten demonstration av vad som är möjligt med den här uttrycksfulla Text to Speech-modellen har vi en replik som har renderats fem gånger. Varje replik har en egen scenanvisning som visar exakt vad du kan göra med modellen.

Alla följande fem kort använder ”I didn’t think you’d actually come back.” som text, modifierad med en känslomässigt rik Audio Tag. Som referens använder de här exemplen också Siren.

Lägga till [furious]

Konsonanterna blir hårdare och klusilerna tydligare. Repliken låter arg och uppfattas som en anklagelse.

[furious]

[furious] I didn't think you'd actually come back
0:00

Lägga till [excited]

Tonläget höjs och tempot ökar, så att samma fras förvandlas till ett glatt välkomnande.

[excited]

[excited] I didn't think you'd actually come back.
0:00

Lägga till [sarcastic] 

Tonläget blir plattare och vokalerna i orden dras ut. Sarkasm är ett utmärkt användningsområde för Audio Tags, eftersom det som sägs direkt motsäger det som skrivs i tonfall.

[sarcastic]

[sarcastic] I didn't think you'd actually come back.
0:00

Lägga till [crying]

Den här är riktigt tårdrypande. Framförandet saktar ner och bryts mitt i meningen. Du kommer märka att andningen gör mycket av jobbet här.

[crying]

[crying] I didn't think you'd actually come back.
0:00

Lägga till [worried]

Tystare och lite tveksam – [worried] tar bort säkerheten ur repliken.

[worried] I didn't think you'd actually come back.
0:00

Tips för att skriva manus som AI kan framföra

Vi har gjort ElevenLabs Text to Speech-appen så intuitiv som möjligt. Öppna sidan och börja skriva, eller lägg till beskrivande Audio Tags för att bädda in specifika ljud eller känslor i din scen

Här är några fler tips som hjälper dig få bästa möjliga resultat med Eleven v4:s emotionella Text to Speech:

  1. Justera dina instruktioner: Om en replik inte fungerar, byt tagg i stället för att skriva om texten. Prova [worried] i stället för [sad], eller [sarcastic] i stället för [annoyed], och generera på nytt tills framförandet stämmer med det du hade i åtanke.
  2. Generera hela scener på en gång: Meningar var för sig kan ge ett nyanserat framförande, som vi visade ovan, men Eleven v4 fungerar bäst med stycken eller längre textavsnitt. När modellen får tillräckligt med text för att förstå scenens sammanhang förbättras framförandet genom hela avsnittet. Med Eleven v4 kan du skriva upp till 10 000 tecken per generering i TTS-appen.
  3. Använd en känsla per fras: Du kan lägga flera Audio Tags genom en mening, men för att undvika förvirring är det bäst att använda en för varje meningsdel. Motstridiga känslor som instruktioner kan ge ett mindre träffsäkert resultat. Du kan också lägga en tagg före exakt den sats du vill påverka och en ny tagg efter satsen om du vill ändra känslan mitt i meningen. 

Med de här tipsen förvandlar du snart din text till en prestation.

Three tips for AI-ready scripts: iterate, generate full scenes, and use one emotion per phrase.

Kom igång med Eleven v4 för emotionell text to speech

Allt du har sett i den här artikeln genererades i ElevenLabs Text to Speech-appen med ett manus, en röst och en handfull Audio Tags i Eleven v4.

För att skapa egna scener väljer du bara en röst, klistrar in en replik du har skrivit och regisserar din första prestation.

Läs mer om Eleven v4 eller registrera dig för att komma igång med din första generering.

Vanliga frågor om emotionell text to speech-AI

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet