Listan över Audio Tags för Eleven v4: Testa dem och skriv sedan egna
- Skriven av
- Jack Limebear
- Publicerad
LyssnaLyssna på den här artikeln
Eleven v4 är en banbrytande Text to Speech-modell som förvandlar text till en prestation. Med Audio Tags kan du styra den prestationen med detaljerad kontroll över dess känslomässiga uttryck. Lägg in en instruktion på naturligt språk inom hakparenteser, som [whispers] eller [excited], och hör hur v4 ändrar framförandet därefter.
Den här listan över ElevenLabs Audio Tags omfattar alla känslor i hela Eleven v4:s känsloregister, samt taggar för framförande, tempo, reaktioner, accenter och ljudeffekter. När du kan grunderna visar vi också hur du skriver egna taggar på vanlig svenska.
Upptäck känslorna i Eleven v4
Lyssna på registretSammanfattning
- Audio Tags är signaler på naturligt språk inom hakparenteser som Eleven v4 läser som instruktioner för framförandet och som ändrar hur de efterföljande orden levereras.
- Eleven v4 är den högst rankade modellen i Artificial Analysis Speech Arena [September 2026], och med Audio Tags kan du styra framförandet rad för rad.
- Känslohjulet för Eleven v4 låter dig höra olika känslor och snabbt få en överblick över modellens möjligheter.
- Taggar är inte begränsade till en fast lista, så du kan skriva egna genom att kombinera egenskaper, som [whispering, fearful], eller beskriva situationen eller karaktären bakom en replik.
- Audio Tags fungerar via ElevenAPI på Eleven v4, Eleven v4 Turbo och Eleven v3.
Vad är ElevenLabs Audio Tags?
Audio Tags är instruktioner på naturligt språk som du kan lägga in i texten inom hakparenteser. Eleven v4 läser dem som markörer för framförandet och använder dem som anvisningar som ändrar hur den säger vissa ord eller fraser. Du skriver dem direkt i ditt manus i ElevenLabs Text to Speech-app och ser hur våra modeller väcker dem till liv.
Eleven v4 är den högst rankade TTS-modellen i Artificial Analysis Speech Arena, där lyssnare röstar på den mest naturligt klingande text till tal.1 Med Audio Tags kan du ta framförandet ännu längre genom att styra exakt hur varje rad levereras.
Så här använder du Audio Tags i ett manus:
- Placera en tagg före orden den påverkar: När du skriver ”[shouts] I can’t believe you said that to me” ropas hela raden ut.
- Känslan fortsätter: När du lägger till en tagg fortsätter dess känsla genom raden, så du behöver bara lägga in en ny tagg när du vill ändra framförandet. Till exempel: ”[proud] I’ve been cooking for over a decade. I know how to boil an egg. [startled] What’s that burning smell?"
- Kombinera taggar för flera instruktioner: Separera Audio Tags med kommatecken inom samma hakparentes, som [whispering, playful], för att ge ditt TTS-framförande fler nyanser.
- Kombinera taggar med skiljetecken: Audio Tags anger stämning och framförande, medan du kan styra tempot naturligt med skiljetecken i manuset. Lägg till ellipser, tankstreck eller versaler för att forma prosodin i en replik.
För en djupare förklaring av hur taggar fungerar och hur de ersätter SSML har vi skrivit en komplett guide till Audio Tags.

Lista över känslo-Audio Tags
Känslohjulet i Eleven v4 innehåller dussintals känslor, var och en framförd av v4 så att du kan höra skillnaden innan du skriver en enda tagg.
Klicka på en känsla nedan för att höra den på hjulet, eller testa direkt med meningen och känslan för att höra Eleven v4 väcka känslomässiga Audio Tags till liv.
Känslofamilj | Känslo-Audio Tags |
Hög energi | [excited], [playful], [amazed], [powerful], [proud], [optimistic], [startled] |
Upphettad | |
Spänd | [anxious], [stressed], [scared], [threatened], [vulnerable], [confused], [busy] |
Låg energi | |
Lugn och eftertänksam |
Vi har bara visat ett urval av känslor här, men du kan använda naturligt språk för alla känslor du vill ha. I exemplet nedan använder vi en rad Audio Tags som inte finns ovan för att visa vad du kan göra med instruktioner på naturligt språk.
Det här exemplet väcktes till liv med Jonathan Livingston.
Lista över Audio Tags för framförande och volym
Taggar för framförande och volym styr hur högt eller intensivt en replik låter, oberoende av känslan du väljer att koppla till den. Om du vill att v4 ska följa en mer specifik vision kan du kombinera taggar för framförande och känslor för mer detaljerad kontroll.
Här är några exempel:
- [whispers] Rör dig inte, den är precis bakom dig.
- [shouts] Alla måste utrymma byggnaden, nu!
- [softly] Du gjorde allt du kunde.
- [quietly] Jag tror att de är borta.
- [low, threatening] Du borde verkligen inte ha kommit hit.
Låt oss se kontrollen av volym och framförande i praktiken.
Exemplet ovan väcktes till liv med Rod.
Lista över Audio Tags för tempo
Audio Tags för tempo ändrar hastigheten i en replik. Lägg till dem för att skapa spänning eller bygga upp ett perfekt komiskt ögonblick. När tajmingen är lika viktig som själva orden bör du använda tempotaggar.
Ett extra tips: Skiljetecken hjälper naturligt med text till tal-framförandet, så använd båda för att få full kontroll över meningen:
- [slowly] Och vinnaren är...
- [rushed] Förlåt att jag är sen, tåget stannade, jag sprang hela vägen.
- [pause] Sedan ringde telefonen.
- [drawn out] Nääää, verkligen inte.
Adam var rösten som väckte det här exemplet till liv.
Lista över människoliknande reaktions-Audio Tags
Reaktionstaggar lägger till ljud som skratt, flämtningar, gråt, hostningar och suckar i dina meningar. De väcker verkligen din text till liv och får ett TTS-ljudprov att låta naturligt, som en person som talar spontant i stället för från ett manus.
Här är några reaktions-Audio Tags:
- [laughs] Gick du verkligen på det?
- [sighs] Okej. Jag diskar.
- [gasps] Är det en riktig diamant?
- [clears throat] Om jag kan få allas uppmärksamhet.
- [crying] Jag trodde inte att du skulle komma tillbaka.
Eleven v4 lägger också till små mänskliga detaljer när känslan kräver det. Lyssna på känslohjulet så hör du repliker som ”Y- you came back?” och ”Ugh, this is real?” där v4 själv lade till stamning eller ett stön.
För att använda den här rösten i dina egna produktioner, leta efter Jack John.
Lista över Audio Tags för accent och karaktär
Det är enklare än någonsin att bygga upp rika scener med olika accenter eller karaktärsröster med Eleven v4. Med ett fåtal Audio Tags kan du ge en röst en ny personlighet samtidigt som dess grundläggande egenskaper behålls. En röst kan spela en hel ensemble i en enda generering.
- [British accent] Vill du ha en kopp te?
- [French accent] Välkommen till mitt lilla kafé.
- [Australian accent] Ingen fara, kompis, vi löser det.
- [pirate voice] Hissa seglen och skicka rommen.
Lauren hjälpte till att väcka det här exemplet till liv.
Lista över ljudeffekts-Audio Tags
Audio Tags för ljudeffekter lägger in händelser utan tal direkt i dina genereringar. Om du till exempel bygger en berättelsescen eller ett spår för ett videospel kan du använda dem för att dramatisera utan ett separat SFX-spår. Du kan dock alltid använda AI-röstgeneratorn för ljudeffekter om du letar efter något specifikt.
- [thunder rumbling] Det kommer närmare.
- [footsteps] Någon kommer uppför trappan.
- [door creaking] Hallå? Är någon hemma?
- [clapping] Tack, tack, ni är för snälla.
Rösten i klippet ovan är Siren.
Skriv egna Audio Tags med naturligt språk
Alla Audio Tags vi har visat ovan är en bra utgångspunkt. Men det fantastiska med ElevenLabs TTS är att du kan skriva vilken ny Audio Tag som helst på naturligt språk för att ge modellen extra kontext att använda.
Om ingen tagg med ett enda ord fångar det du är ute efter kan du i stället skriva en mer utförlig instruktion.
- Kombinera känslor och egenskaper: [tense, cautious] eller [whispering, fearful]
- Beskriv sättet: [like a sports commentator, speeding up]
- Beskriv situationen: [out of breath after running up the stairs]
- Beskriv karaktären: [a tired detective who has heard it all before]
- Beskriv förändringen: [starting calm, then losing patience]
Väck din scen till liv med Spuds Oxley.
Tips för att välja Audio Tags
Att skriva på naturligt språk ger dig stor flexibilitet när du skapar ljudprov med text till tal, men det innebär också att det kan krävas lite fram och tillbaka för att få ett perfekt resultat.
Här är några tips för att göra din TTS-upplevelse med Eleven v4 så smidig som möjligt:
- Lyssna innan du skriver: Spela upp några känslor på känslohjulet för att höra hur v4 tolkar var och en av dem, eller använd dem som inspiration. Välj sedan den som passar din replik bäst.
- Byt tagg innan du skriver om repliken: Om framförandet inte blir rätt kan du prova en närliggande känsla, som [let down] i stället för [despair], och generera på nytt.
- Använd en tagg per sats: Kontrasterande taggar för samma ord kan göra framförandet otydligt. Lägg till en ny tagg där du vill att känslan ska ändras.
- Ge modellen en hel scen: Eleven v4 presterar bättre med kontext. Med upp till 10 000 tecken per generering i Text to Speech-appen har du utrymme att bygga upp lager av instruktioner och skapa magi i din scen.
- Börja med en förinställning och bli sedan specifik. Om [nervous] är nära men inte helt rätt, skriv vad som saknas: [nervous, trying to sound confident].
Men framför allt är det bästa sättet att komma igång och börja skapa högkvalitativt TTS-ljud att öppna ElevenLabs TTS-app och experimentera.

Kom igång med uppslukande ljud i Eleven v4
Det finns ingen definitiv lista över ElevenLabs Audio Tags eftersom du kan skapa vilken kombination du vill genom att skriva på naturligt språk. Alla taggar i den här listan fungerar på Eleven v4, men även taggar du kommer på medan du skriver din scen fungerar.
Välj en av de över 17 500 rösterna från Voice Library, klistra in ditt manus och lägg till din första Audio Tag för att komma igång.
Läs mer om Eleven v4 eller registrera dig för att skapa imponerande ljudframföranden.
Vanliga frågor om ElevenLabs Audio Tags
- Artificial Analysis, Provider Voice Arena Preference Elo, 30 september 2026


