Vi presenterar Eleven v4Möt Eleven v4, vår mest uttrycksfulla modell hittills. Med 3× fler krediter inkluderade i Creator+ till och med den 12 oktober

Hoppa till innehållet

Guide till uttalslexikon: Rätta vilket ord som helst i TTS med Eleven v4

Skriven av
Jack Limebear
Publicerad

LyssnaLyssna på den här artikeln

Eleven v4 sätter en ny standard för uttal i Text to Speech-modeller och hanterar förkortningar, tekniska termer, namn och text på flera språk mer korrekt än någon tidigare modell. Samtidigt har varje varumärke sitt eget ordförråd, från unika produktnamn till branschspecifik jargong, så du behöver full kontroll över hur orden låter.

Eleven v4 erbjuder flera sätt att rätta uttal, så att du får detaljerad kontroll över hur modellen talar. Du kan bygga ett omfattande uttalslexikon som gäller för alla manus du skriver i TTS-appen. Eller skriva IPA direkt i texten för en enstaka korrigering. 

Här är ett kort exempel på hur Eleven v4 hanterar ett manus fullt av svåra termer:

At 2:47 A.M., Siobhan Lester's phone lit up. The search service on the Kubernetes cluster was timing out. She read the pod logs and found the cause in Tuesday's release. A new fuzzy matching feature compared every query against the entire product catalog using Levenshtein distance, so each search took 1,400 milliseconds, well past the one-second limit. Her lead, a purist who quotes Dijkstra and Euler in code reviews, wanted to rewrite the matcher from scratch. Instead, she rolled back to Monday's build, and by 3:30 A.M., the rollback was live and response times were back under 50 milliseconds. The proper fix, an index that narrows each search to close matches, shipped in Thursday's release.
0:00

Den här guiden visar hur du skapar och använder ett TTS-uttalslexikon samt alla strategier runt omkring som hjälper dig att få ljudet att låta så nära din vision som möjligt. 

Sammanfattning

  • Ett uttalslexikon är en uppsättning regler som du skriver för att tala om för en Text to Speech-modell hur specifika ord eller fraser ska uttalas.
  • TTS-uttalsregler är antingen aliasbaserade, som ersätter text med annan text, eller fonembaserade, som använder fonetisk stavning.
  • Eleven v4 har stöd för fonemregler och IPA direkt i texten (internationella fonetiska alfabetet).
  • SSML-taggar för fonem och pauser fungerar inte i Eleven v4, men du kan använda ett uttalslexikon eller Audio Tags som ett naturligt språkligt alternativ.
  • Du kan använda upp till tre uttalslexikon per begäran via ElevenAPI.

Vad är ett uttalslexikon?

Ett uttalslexikon är ett verktyg som låter dig ställa in exakt hur en text to speech-modell uttalar vissa ord. Genom att lägga till ord eller fraser i ett uttalslexikon anger du hur de ska låta varje gång de förekommer i ett TTS-manus. 

Uttalslexikon används vanligtvis för:

  • Varumärkesnamn: Varumärkesnamn är vanliga poster i uttalslexikon, särskilt när de har unik eller ovanlig stavning.
  • Akronymer: Vissa akronymer har ett specifikt uttal. AEO ska till exempel låta som /ˌeɪ.iːˈoʊ/ (”A-E-O”), inte /eɪˈjoʊ/ (”ay-yo”). En fast lexikonregel ser till att modellen uttalar det rätt varje gång du skriver det.
  • Ortnamn och andra egennamn: Vissa ortnamn kan uttalas helt annorlunda än man föreställer sig när man ser dem skrivna. Worcestershire är ett välkänt exempel där en uttalsguide kan hjälpa till att undvika problem.
  • Branschtermer: Branschjargong eller specialiserade termer från exempelvis medicin eller juridik kan behöva ett uttalslexikon om modellen inte uttryckligen har tränats på data från dessa områden. 

Utanför text to speech är uttalslexikon vanligtvis crowdsourcade samlingar av ljudklipp från modersmålstalare, som elever använder för att höra hur vissa ord uttalas.

Different uses of pronunciation dictionaries in TTS apps

Så styr du TTS-uttal i Eleven v4

Eleven v4 rankas som Text to Speech-modellen med högst kvalitet av Artificial Analysis' Provider Voice Arena.1 En del av det som gör Eleven v4 marknadsledande är modellens förmåga att hantera komplex text och samtidigt få resultatet att låta naturligt. 

För att ge användare bästa möjliga upplevelse med Eleven v4 erbjuder modellen flera sätt att anpassa uttal, så att varje resultat uppfyller dina krav på precision. 

Så här kan du styra uttal med Eleven v4:

  • IPA direkt i texten: Du kan skriva IPA i dina manus mellan snedstreck för att styra uttalet utan att använda uttalslexikonet. Vi går snart igenom exakt hur du gör.
  • Fonemregler i lexikon: Skriv fonembaserade regler i dina uttalslexikon för att styra det fonetiska ljudet för återkommande ord.
  • Flytande uttal på olika språk: Eleven v4 kan skapa naturligt tal på över 90 språk. Behåll det inhemska uttalet på varje språk medan du använder samma röst för en enhetlig ljudprofilering-upplevelse.

Så här skiljer sig olika TTS-modeller från ElevenLabs åt när det gäller uttalskontroll:

Modell

Aliasregler (lexikon)

Fonemregler (lexikon)

IPA direkt i texten (/.../)

SSML-fonemtaggar (<phoneme>)

Eleven v4

Ja

Ja

Ja

Nej

Eleven v4 Turbo

Ja

Ja

Ja

Nej

Eleven v3

Ja

Ja

Ja

Nej

Eleven Flash v2

Ja

Ja

Nej

Ja (endast engelska)

Eleven Turbo v2

Ja

Nej

Nej

Ja (endast engelska)

Eleven Multilingual v2

Ja

Nej

Nej

Nej

Pronunciation dictionary guide on ElevenLabs across different models

Vad är skillnaden mellan alias- och fonemregler i ett uttalslexikon?

Aliasregler för uttal ersätter en textdel med en annan innan modellen uttalar ordet. Det sker i bakgrunden när en modell genererar ljud och ersätter uttalet av ett ord eller en fras med det du har angett i ditt uttalslexikon. 

Här är några exempel på aliasregler för uttal:

  • ”SaaS” blir ”sass”
  • ”UN” blir ”United Nations”
  • ”OAuth” blir ”oh auth”

Fonemregler ger däremot modellen en exakt fonetisk stavning att använda. De är svårare att skapa eftersom du själv behöver skriva eller generera IPA-transkriptionen och lägga in den i lexikonet. Till exempel blir ”Kubernetes” /ˌkuː.bərˈnɛt.iːz/.

Så rättar du uttalet av ett varumärkesnamn i en TTS-modell

Varumärkesnamn är en av de vanligaste posterna i uttalslexikon eftersom de inte alltid är riktiga ord. Om ditt företag har hittat på ett ord eller en unik stavning för ditt varumärke kan TTS-modeller ha svårt att uttala det korrekt, eftersom det finns mycket lite tillgänglig träningsdata med just det uttalet.

Så här rättar du uttalet av ett varumärkesnamn i Eleven v4:

  1. Testa standarduttalet: Öppna Text to Speech-appen och skriv ditt varumärkesnamn. Generera ett klipp och lyssna på hur det låter. Om uttalet är fel går du vidare till nästa steg. 
  2. Prova en aliasregel: Det enklaste sättet att rätta ett felaktigt uttal av ett varumärke är att skapa en aliasregel. De är snabba att skriva och enkla att förstå.
  3. Byt till en fonemregel: Om aliasregeln inte fungerar riktigt kan du använda IPA. Transkribera ditt varumärkesnamn med IPA och skapa sedan en regel i uttalslexikonet för Text to Speech för att rätta uttalet.
  4. Täck alla versaliseringar: Se till att inkludera IPA-transkriptionen för både gemena och versala versioner av ditt varumärkesnamn, om du använder båda.
  5. Använd IPA direkt i texten för enstaka ändringar: Om du bara vill ha en snabb korrigering för en enstaka generering kan du lägga till IPA direkt i manuset i stället för att skapa en lexikonpost.

När du har skapat en regel för ett varumärkesnamn finns den framöver i alla delade projekt, oavsett om den används i din AI-agent eller nås via ett API.

Så skapar du ett uttalslexikon med ElevenLabs

Du kan skapa ett uttalslexikon genom att lägga till regler i Text to Speech-appen, ladda upp en .pls-fil eller via ElevenAPI. I den här guiden går vi igenom det första alternativet, som bara kräver några få steg.

Title slide: “How to create a pronunciation dictionary,” by ElevenLabs and ElevenCreative.

Följ de här stegen för att skapa ett uttalslexikon:

  1. Öppna panelen för uttalslexikon: Klicka på sökfältet högst upp på Text to Speech-sidan, skriv ”Pronunciation dictionary” och välj Pronunciation dictionaries under Actions.
  2. Skapa eller välj ett lexikon: Klicka på New för att skapa ett nytt lexikon, eller välj ett befintligt i listan till vänster. 
  3. Lägg till en regel: Klicka på Add rule för att skapa en ny rad. Skriv in ordet du vill rätta. Ange ordet eller frasen precis som den förekommer i dina manus i fältet Input. Regler är skiftlägeskänsliga, så använd samma versalisering som i dina manus. 
  4. Välj regeltyp: Välj Alias för att ersätta med annan text eller Phoneme för att ange en IPA- eller CMU-stavning. 
  5. Ange ersättningen: Skriv aliaset eller den fonetiska stavningen i fältet Output. Använd röstväljaren högst upp i panelen för att höra regeln med rösten du arbetar med. 
  6. Spara ändringarna: Klicka på Save changes längst ned i panelen.

Om du vill koppla en uttalsguide till en agent eller använda en via API:t följer du vår dokumentation om uttalslexikon.

Så använder du IPA i text to speech med Eleven v4

För mindre ändringar eller ovanliga ord behöver du inte nödvändigtvis skapa en ny post i ditt TTS-uttalslexikon för att rätta ett fel. I stället kan du använda IPA direkt i texten för att ange exakt hur modellen ska uttala ett ord.

I Eleven v4 kan du aktivera IPA direkt i texten genom att använda snedstreck. Precis som Audio Tags placeras de direkt i manuset för att göra det så enkelt som möjligt. Här är några exempel på IPA i Eleven v4:

  • Tekniska termer: Termen "/ˌbaɪoʊˈkemɪstri/" syftar på studiet av kemiska processer. 
  • Medicinskt ordförråd: "/ɡluːˈkoʊs/" och "/ˈɪnsjəlɪn/" används ofta för att hantera tillstånd som "/ˌdaɪəˈbiːtiːz/". 
  • Varumärkes- och produktnamn: Våra servrar kör på "/ˌɛndʒɪnˈɛks/" för att hantera trafiktoppar.

Som en sidonot kan en IPA-konverterare hjälpa dig som inte har en examen i lingvistik att få rätt IPA från vanlig text att klistra in i ditt manus.

Varför SSML-fonemtaggar inte fungerar i Eleven v4

Eleven v4 har inte stöd för SSML utan använder i stället mer flexibla funktioner, som Audio Tags och uttalslexikon, som ger dig större kontroll över den färdiga ljudproduktionen. 

Varje funktion som SSML erbjuder har en direkt ersättning i v4:

SSML-tagg

Vad den gjorde

Ersättning i Eleven v4

<phoneme>

Angav ett fonetiskt uttal

IPA direkt i texten (/…/) eller en fonemregel i lexikonet

<sub alias>

Ersatte text före uppläsning

En aliasregel i lexikonet

<break>

Lade till en paus

Audio Tags som [pause], ellipser eller radbrytningar

<prosody rate>

Ändrade talhastighet

Audio Tags för tempo, som [slowly] eller [rushed]

<emphasis>

Betonade ett ord

Versaler eller en Audio Tag för uttryck

Kom igång med naturligt uttal i text to speech med Eleven v4

Med en rad verktyg som hjälper dig att förbättra uttalets precision i Eleven v4 kan du skriva detaljerade manus och få modellen att framföra dem precis som du har tänkt dig.

Bygg uttalslexikon i ElevenLabs Text to Speech-app och använd dem i stor skala med ElevenAPI. 

Registrera dig för att komma igång eller läsa mer om Eleven v4 i dag.

Vanliga frågor

  1. Artificial Analysis, Provider Voice Arena Preference Elo, 30 september 2026

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet