Vad är Audio Tags? Den kompletta guiden till emotionell TTS
- Skriven av
- Jack Limebear
- Publicerad
- Senast uppdaterad
Audio Tags är signaler inom hakparenteser på naturligt språk, som [laughs], [gasps], [excited] och [worried], som Eleven v3 tolkar som regi för framförandet i stället för ord som ska uttalas. När du skriver ett manus för en text to speech-modell ger dessa Audio Tags dig detaljerad kontroll över hur texten förmedlas känslomässigt.
Eleven v3 blev offentligt tillgängligt i mars 2026. Före v3 innebar det att generera om innehåll och hoppas på det bästa för att få en specifik känslomässig prestation från en Text to Speech-modell innebar att generera innehåll på nytt och hoppas på det bästa. Audio Tags tar bort gissningsarbetet och ger dig full kontroll över ett emotionellt text to speech-framförande.
Den här guiden förklarar vad Audio Tags är, hur de fungerar, alla tillgängliga taggkategorier och hur de skiljer sig från SSML (Speech Synthesis Markup Language). Vi går också igenom vanliga användningsområden, med länkar till en egen guide för varje område.
Sammanfattning
- Audio Tags är signaler inom hakparenteser, som [shouts] eller [excited], som styr känsla, tempo, framförande och ton i TTS med Eleven v3.
- Eleven v3 har inte stöd för SSML, utan ersätter det med Audio Tags för en mer naturlig skrivupplevelse.
- Taggarna omfattar flera kategorier, bland annat känslor, framförande och tempo, mänskliga reaktioner, accenter och ljudeffekter.
- Interpunktion och versaler i texten hjälper dig att forma tempot i en AI-röstprestation.
- Du kan använda Audio Tags i ElevenLabs via gränssnittet eller API:et.
Hur fungerar Audio Tags?
Audio Tags placeras direkt i transkriptionen och omsluts av hakparenteser. När du vill ändra framförandet, till exempel från normalt till [worried], lägger du bara till en audio tag.
Du kan också använda fler än en tagg i samma mening och kombinera taggar för ett mer nyanserat framförande, till exempel [tired] Det har varit en lång dag… [upset] Hur många fler dagar orkar jag?
Arkitekturen bakom Eleven v3 gör att modellen kan läsa sammanhang på en djupare nivå än tidigare modeller. Den kan följa känslomässiga signaler, tonskiften, talarbyten och ledtrådar i sammanhanget utan att du behöver använda en separat parameter eller inställning. Berätta bara för modellen vad situationen kräver, så framför den repliken precis som du har tänkt dig.
Eleven v3 hanterar också dialoger med flera talare som känns spontana, med avbrott, humörskiften och det naturliga samspelet i ett verkligt samtal – allt enbart utifrån taggar och manusstruktur.
Audio Tags jämfört med SSML
Om du har arbetat med andra TTS-system har du förmodligen stött på Speech Synthesis Markup Language. Plattformar som Amazon Polly och Microsoft Azure Speech använder SSML-taggar som <break> eller <emphasis> för att ge ett TTS-manus ytterligare sammanhang.
Eleven v3 har inte stöd för SSML:s break-taggar eller resten av SSML-tagguppsättningen. I stället tar Audio Tags, skiljetecken och själva textstrukturen över den rollen, samtidigt som du får detaljerad kontroll över framförandet.
I tabellen nedan kan du jämföra vanliga SSML-taggar med motsvarigheten i Eleven v3.
Ur en skribents perspektiv kräver det mycket mindre arbete att lägga till [whispers] i en replik än att konfigurera en prosodi-hastighet.
Kategorierna för Audio Tags i v3: Styr framförandet med Audio Tags
Du kan placera Audio Tags var som helst i manuset för att forma framförandet i realtid. Du kan också kombinera taggar i ett manus eller till och med i en mening.
Taggarna delas in i följande huvudkategorier.
Känslor
De här taggarna hjälper dig att sätta röstens känslomässiga ton, oavsett om den är dyster, intensiv eller uppsluppen. Du kan till exempel använda en eller en kombination av [sad], [angry], [happily] och [sorrowful].
Framförande och tempo
De här handlar mer om ton och framförande. Du kan använda dem för att justera volym och energi i scener som behöver återhållsamhet eller kraft. Exempel är taggar som [whispers], [shouts] och [softly].
Mänskliga reaktioner
Äkta, naturligt tal innehåller reaktioner. Du kan till exempel göra talet mer verklighetstroget genom att lägga in naturliga, oplanerade ögonblick. Taggar som [laughs], [clears throat] och [sighs] bidrar alla till en TTS-modell som kan förmedla mänskliga känslor.
Andra exempel på kategorier av audio tags är:
- Accenter och karaktärsröster: Accenttaggar ändrar rösten till en specifik region eller persona utan att byta modell, som [French accent], [British accent] eller [pirate voice]. Använd dem för att göra en enda röst till en flexibel ensemble i stället för ett enda fast framförande.
- Ljudeffekter: Taggar för ljudeffekter lägger till ljud utan tal direkt i genereringen, som [gunshot], [explosion] och [clapping]. De passar bra för uppslukande ljud, spel och dramatiserade berättelser där scenen behöver mer än en röst. Du kan också använda ElevenCreative AI-ljudeffektgenerator.
Taggar ger dig hög kontroll, men du kan också använda interpunktion för att forma rytm och betoning. Lägg till exempel till en ellips för en naturlig paus eller använd kommatecken för att skapa naturliga andningsmönster. Prova att skriva ett ord med bara versaler för att betona det: ”Jag vill ha det JUST NU.”
Vad kan du göra med Audio Tags?
Audio Tags gör det enkelt att fånga manusets känslomässiga komplexitet. Skriv naturligt och lägg till taggar längs vägen.
Här är en snabb överblick över några användningsområden för emotionell TTS med Audio Tags.
Situationsmedvetenhet i AI-ljud
Taggar som [whisper] eller [shouting] låter Eleven v3 reagera på situationen. Du kan göra en varning mjukare eller hålla en utdragen paus för spänning och bygga in dynamisk situationsmedvetenhet i manuset.
Läs vår guide om situationsmedvetenhet i AI-ljud för en fullständig genomgång.
Styra karaktärers framförande i tal
När du skriver ett manus med flera karaktärer vill du tydligt visa hur varje röst skiljer sig åt. Från att justera deras personlighet med [sarcastically] till att definiera hur de talar med [British accent] kan du fånga ett helt känsloregister med vår TTS-motor.
Läs mer om att styra karaktärers framförande i AI-tal.
Uttrycka känslomässigt sammanhang i tal
Med Audio Tags kan du forma en replikers känslomässiga framförande medan den utvecklas. Du kan bygga upp känslor genom ett tal och nå ett crescendo precis när du föreställer dig att din karaktär når sin fulla potential. Taggar som [awe], [booming] och [big laugh] hjälper dig att skapa ett helt känsloregister i din AI-röst.
Läs mer om att använda känslomässigt sammanhang i AI-tal.
Ge liv åt dialoger med flera karaktärer
När du bygger dialoger med flera karaktärer kan du börja varje replik med en audio tag för att skapa rika karaktärssamtal.
Ta följande som exempel: Tom: [coughing] [beginning to speak] förlåt, jag är lite sjuk i dag— Emma: [interrupting] —Sjuk? Du vet hur mycket jag hatar hosta, Tom! Tom: [surprised] Det är bara lite hosta, inget allvarligt. Hur skulle du känna om— Emma: [overlapping] [annoyed] —Jag tycker att du behöver gå hem.
Se vad mer du kan göra med dialoger med flera karaktärer i Eleven v3.
Exakt kontroll över framförandet i AI-tal
Du kan styra talets tempo i Eleven v3 med Audio Tags eller skiljetecken. Taggar som [pause], [rushed] eller [drawn out] låter dig forma repliken med precision. Du kan också lägga till ellipser, punkter och utropstecken för att naturligt bygga in känslor i ditt TTS-framförande.
Vi har skrivit en djupgående guide om exakt kontroll över framförandet i Eleven v3.
Känslomässig TTS är tillgänglig via API:et
Audio Tags fungerar på samma sätt via Text to Speech API som i ElevenLabs gränssnitt. Skriv taggen direkt i manustexten, så returnerar API:et det taggade framförandet i det genererade ljudet – från ljudboksflöden till voice-over för annonser.
Läs mer om Eleven v3 eller kontakta säljteamet för att komma igång i dag.










