Vad är ljudtaggar? Komplett guide till emotionell TTS
- Skriven av
- Jack Limebear
- Publicerad
- Senast uppdaterad
Audio tags är anvisningar inom hakparenteser på naturligt språk, som [laughs], [gasps], [excited] och [worried], som Eleven v3 tolkar som instruktioner för framförandet snarare än ord som ska sägas. När du skriver ett manus för en Text to Speech-modell ger dessa audio tags dig detaljerad kontroll över hur känslorna förmedlas i texten.
Eleven v3 blev tillgängligt för allmänheten i mars 2026. Före v3 innebar det att generera om innehåll och hoppas på det bästa om du ville få fram ett specifikt känslomässigt uttryck från en Text to Speech-modell. Audio tags eliminerar gissningsarbetet och ger dig full kontroll över ett känslomässigt Text to Speech-framförande.
I den här guiden går vi igenom vad audio tags är, hur de fungerar, alla tillgängliga taggkategorier och hur de jämförs med SSML (Speech Synthesis Markup Language). Vi tar också upp vanliga användningsområden, med länkar till en egen guide för varje område.
Sammanfattning:
- Audio tags är anvisningar inom hakparenteser, som [shouts] eller [excited], som styr känsla, tempo, framförande och ton i TTS med Eleven v3.
- Eleven v3 har inte stöd för SSML, utan ersätter det med audio tags för en mer naturlig skrivupplevelse.
- Taggarna finns i flera kategorier, till exempel känslor, framförande och tempo, mänskliga reaktioner, accenter och ljudeffekter.
- Interpunktion och versaler i texten låter dig forma tempot i en AI-rösts framförande.
- Du kan använda audio tags i ElevenLabs via användargränssnittet eller API:et.
Hur fungerar audio tags?
Audio tags placeras direkt i transkriberingen och omges av hakparenteser. När du vill att framförandet ska ändras, till exempel från normalt till [worried], lägger du bara till en audio tag.
Du kan också använda fler än en tagg i samma mening och kombinera taggar för ett mer nyanserat framförande, till exempel [tired] It’s been a long day… [upset] How many more days can I take?
Arkitekturen bakom Eleven v3 gör att modellen kan läsa kontext på en djupare nivå än tidigare modeller. Den kan följa känslomässiga signaler, tonskiften, talarbyten och ledtrådar i kontexten utan att du behöver använda en separat parameter eller inställning. Berätta bara för modellen vad situationen kräver, så framför den repliken precis som du har tänkt dig.
Eleven v3 hanterar också dialoger med flera talare som känns spontana, med avbrott, humörsvängningar och det naturliga samspelet i verkliga samtal – enbart med hjälp av taggar och manusets struktur.
Audio tags jämfört med SSML
Om du har arbetat med andra TTS-system har du förmodligen stött på Speech Synthesis Markup Language. Plattformar som Amazon Polly och Microsoft Azure Speech använder SSML-taggar som <break> och <emphasis> för att ge ett TTS-manus ytterligare kontext.
Eleven v3 har inte stöd för SSML:s break-taggar eller resten av SSML-tagguppsättningen. I stället fyller audio tags, interpunktion och själva textstrukturen den funktionen, samtidigt som du får detaljerad kontroll över framförandet.
Använd tabellen nedan för att jämföra vanliga SSML-taggar med motsvarigheten i Eleven v3.
Ur en skribents perspektiv kräver det mycket mindre arbete att lägga till [whispers] i en replik än att konfigurera en prosodi-hastighet.
Kategorier av audio tags i v3: Styr framförandet med audio tags
Du kan placera audio tags var som helst i manuset för att forma framförandet i realtid. Du kan också kombinera taggar i ett manus eller till och med i en enda mening.
Taggarna delas in i följande huvudkategorier.
Känslor
De här taggarna hjälper dig att ange röstens känslomässiga ton, oavsett om den är dyster, intensiv eller uppåt. Du kan till exempel använda en eller flera av [sad], [angry], [happily] och [sorrowful].
Framförande och tempo
De här handlar mer om ton och framförande. Du kan använda dem för att justera volym och energi i scener som behöver återhållsamhet eller kraft. Exempel är taggar som [whispers], [shouts] och [softly].
Mänskliga reaktioner
Verkligt naturligt tal innehåller reaktioner. Du kan till exempel göra talet mer realistiskt genom att bädda in naturliga, oplanerade ögonblick. Taggar som [laughs], [clears throat] och [sighs] bidrar alla till att skapa en TTS-modell som kan förmedla mänskliga känslor.
Andra exempel på kategorier av audio tags är:
- Accenter och karaktärsröster: Accenttaggar växlar rösten till en specifik region eller personlighet utan att du byter modell, som [French accent], [British accent] eller [pirate voice]. Använd dem för att göra en enda röst till en flexibel ensemble i stället för ett fast framförande.
- Ljudeffekter: Taggar för ljudeffekter lägger till ljud som inte är tal direkt i genereringen, som [gunshot], [explosion] och [clapping]. De passar bra för uppslukande ljud, spel och dramatiserade berättelser där scenen behöver mer än bara en röst. Du kan även använda ElevenCreative AI-ljudeffektgenerator.
Taggar ger dig en hög grad av kontroll, men du kan också använda interpunktion för att forma rytm och betoning. Lägg till exempel till tre punkter för en naturlig paus eller använd kommatecken för att skapa naturliga andningsmönster. Prova att skriva ett ord med bara versaler för att betona det: ”I want it right NOW.”
Vad kan du göra med audio tags?
Audio tags öppnar upp för manusens känslomässiga komplexitet på ett intuitivt sätt. Skriv naturligt och lägg till taggar efter hand.
Här är en snabb överblick över några användningsområden för känslomässig TTS med audio tags.
Situationsmedvetenhet i AI-ljud
Taggar som [whisper] eller [shouting] gör att Eleven v3 kan reagera på stunden. Du kan dämpa en varning eller hålla en lång paus för att skapa spänning och bygga in dynamisk situationsmedvetenhet i manuset.
Läs vår guide om situationsmedvetenhet i AI-ljud för en fullständig genomgång.
Styra karaktärers framförande i tal
När du bygger ett manus med flera karaktärer vill du tydligt visa hur varje röst skiljer sig åt. Från att justera personligheten med [sarcastically] till att definiera hur de talar med [British accent] kan du fånga hela känsloregistret med vår TTS-motor.
Läs mer om att styra karaktärers framförande i AI-tal.
Uttrycka känslomässig kontext i tal
Audio tags låter dig forma hur en replik förmedlar känslor medan den utvecklas. Du kan bygga upp känslor genom hela ett tal och nå ett crescendo i exakt det ögonblick du ser karaktären nå sin fulla potential. Taggar som [awe], [booming] och [big laugh] hjälper dig att bygga in ett helt känsloregister i AI-röstens framförande.
Läs mer om hur du använder känslomässig kontext i AI-tal.
Ge dialoger med flera karaktärer liv
När du skapar dialoger med flera karaktärer kan du börja varje replik med en audio tag för att skapa levande samtal mellan karaktärerna.
Ta följande exempel: Tom: [coughing] [beginning to speak] sorry I’m a little bit ill today— Emma: [interrupting] —Ill? You know how I hate coughing, Tom! Tom: [surprised] It’s just a little cough, it’s nothing serious. How would you feel if— Emma: [overlapping] [annoyed] —I think you need to go home.
Se vad mer du kan göra med dialoger med flera karaktärer i Eleven v3.
Precisionskontroll av framförandet för AI-tal
Du kan styra talets tempo i Eleven v3 med audio tags eller interpunktion. Taggar som [pause], [rushed] och [drawn out] låter dig aktivt forma repliken med precision. Du kan också lägga till tre punkter, punkter och utropstecken för att bygga in känslor naturligt i ditt TTS-framförande.
Vi har skrivit en djupgående guide om precisionskontroll av framförandet i Eleven v3.
Känslomässig TTS är tillgänglig via API:et
Audio tags fungerar på samma sätt via Text to Speech API som i ElevenLabs användargränssnitt. Skriv taggen direkt i manustexten, så returnerar API:et det taggade framförandet i det genererade ljudet, från ljudboksflöden till voice-over för annonser.
Läs mer om Eleven v3 eller kontakta säljteamet för att komma igång i dag.







%20copy.webp&w=3840&q=80)


