For AI agents: a documentation index is available at the root level at /llms.txt. Append /llms.txt to any URL for a page-level index, or .md for the markdown version of any page.
En guide till hur du omvandlar text till tal med ElevenLabs
Översikt
ElevenLabs Text to Speech-teknik är en central del av vårt erbjudande och ger högkvalitativt AI-genererat tal i många olika tillämpningar världen över. Du har förmodligen redan hört våra röster i användning, där de levererar verklighetstrogna ljudupplevelser.
Det är mycket enkelt att komma igång och skapa ditt första ljud med Text to Speech. För att få ut så mycket som möjligt av funktionen finns det dock några saker du behöver tänka på.
Klicka på knappen ‘Generate’ för att skapa din ljudfil.
Inställningar
Bekanta dig med rösterna, modellerna och inställningarna för att skapa tal av hög kvalitet.
Inställningarna du använder, särskilt rösten och modellen, påverkar resultatet avsevärt. Det är mycket viktigt att bekanta sig med dem och förstå några rekommenderade metoder. Andra inställningar påverkar också resultatet, men mindre än den röst och modell du väljer.
Viktighetsordningen är följande: valet av röst är viktigast, följt av val av modell och sedan modellens inställningar. Alla dessa, och kombinationen av dem, påverkar resultatet.
Röster
Röster
Vi erbjuder många typer av röster, inklusive de utvalda standardrösterna, vårt omfattande röstbibliotek med nästan alla röster du kan tänka dig, helt syntetiska röster som skapats med vårt verktyg Voice Design, och du kan skapa din egen samling av klonade röster med våra två tekniker: Instant Voice Cloning och Professional Voice Cloning.
Alla röster är inte likvärdiga, och mycket beror på källjudet som använts för att skapa dem. Vissa röster ger en bättre och mer mänsklig prestation och leverans, medan andra är mer stabila.
Att välja rätt röst för ditt specifika innehåll är avgörande. Det är troligen det viktigaste beslutet och det som har störst påverkan på slutresultatet. Det avgör kön, ton, accent, rytm och leverans. Det är värt att lägga extra tid på att välja den perfekta rösten och testa den ordentligt för att säkerställa att den är konsekvent och uppfyller dina förväntningar.
För att generera tal på ett specifikt språk får du bäst resultat genom att använda en modersmålsröst från röstbiblioteket eller klona en röst som talar språket med rätt accent. Alla röster kan tekniskt sett tala alla språk, men de behåller sin ursprungliga accent. Om du till exempel använder en engelsk modersmålsröst för att generera franskt tal blir resultatet troligen franska med engelsk accent, eftersom AI:n måste generalisera hur rösten skulle låta på ett språk den inte tränats på.
Om du har en röst du gillar men vill ha en annan leverans kan vårt verktyg Voice Remixing hjälpa dig. Med naturliga språkprompter kan du ändra en rösts leverans, rytm, ton, kön och även accenter. När du ändrar accenter är basrösten och målaccentsen mycket viktiga. Resultaten kan variera; ibland fungerar det perfekt, medan det andra gånger kan krävas några försök för att få rätt resultat.
Du kan få riktigt bra resultat med Voice Remixing, men de är vanligtvis inte lika bra som med en korrekt klonad Professional Voice Clone. De ligger närmare resultaten från en Instant Voice Clone.
Tänk på att röstremixning bara fungerar för vissa röster. Du kan till exempel inte remixa röster från röstbiblioteket, utan bara röster som du själv har skapat eller standardrösterna.
Modeller
Modeller
Vi erbjuder två modellfamiljer: modellerna Standard (hög kvalitet) och Flash-modellerna, som är optimerade för extremt låg latens. De flesta familjer har både engelskspråkiga och flerspråkiga versioner.
Eleven v4 är vår senaste modell. Den finns i två varianter: Eleven v4 och Eleven v4 Turbo.
Modellvalet har näst störst påverkan på ditt slutliga ljudresultat, direkt efter röstvalet. Vi rekommenderar att du testar de olika modellerna med den röst du valt för att hitta den bästa kombinationen. Alla våra modeller har styrkor och svagheter och fungerar bättre med vissa röster än med andra, så det är viktigt att hitta en bra kombination.
Om resultatet endast ska vara på engelska rekommenderar vi starkt att du använder någon av våra engelskspråkiga modeller. De är ofta enklare att arbeta med, mer stabila och ger generellt bättre resultat för innehåll enbart på engelska. Om ditt innehåll ska vara på ett annat språk eller potentiellt flerspråkigt måste du använda någon av de flerspråkiga modellerna.
Den vanligaste inställningen är stabilitet runt 50, likhet runt 75 och stil på 0, med minimala ändringar därefter. Det beror förstås på den ursprungliga rösten och vilken typ av prestation du vill uppnå.
Det är viktigt att notera att AI:n inte är deterministisk; att ställa reglagen på specifika värden garanterar inte samma resultat varje gång. Reglagen fungerar i stället mer som ett intervall som avgör hur stor slumpvariationen kan vara mellan varje generering.
Hastighet
Med hastighetsinställningen kan du öka eller minska hastigheten på det genererade talet. Standardvärdet är 1.0, vilket innebär att hastigheten inte justeras. Värden under 1.0 saktar ner rösten, ner till minst 0.7. Värden över 1.0 snabbar upp rösten, upp till högst 1.2. Extrema värden kan påverka kvaliteten på det genererade talet.
Hastighet är inte tillgänglig för modellen Eleven v3.
Stabilitet
Stabilitetsreglaget avgör hur stabil rösten är och graden av slumpvariation mellan varje generering. Om du sänker reglaget får rösten ett bredare känslomässigt register. Som nämnts tidigare påverkas detta också mycket av den ursprungliga rösten. Om reglaget ställs för lågt kan det leda till märkliga prestationer som är alltför slumpmässiga och får karaktären att tala för snabbt. Om det däremot ställs för högt kan rösten bli monoton och ha begränsat känslouttryck.
För en mer livfull och dramatisk prestation rekommenderar vi att du ställer stabilitetsreglaget lägre och genererar några gånger tills du hittar en prestation du gillar.
Om du i stället vill ha en mer allvarlig prestation, till och med nära monoton vid mycket höga värden, rekommenderar vi att du ställer stabilitetsreglaget högre. Eftersom resultatet är mer konsekvent och stabilt behöver du vanligtvis inte generera lika många exempel för att uppnå önskat resultat. Experimentera för att hitta det som fungerar bäst för dig!
Likhet
Likhetsreglaget styr hur nära AI:n ska hålla sig till den ursprungliga rösten när den försöker återskapa den. Om originalljudet är av låg kvalitet och likhetsreglaget är inställt för högt kan AI:n återge artefakter eller bakgrundsbrus när den försöker efterlikna rösten, om sådant fanns i originalinspelningen.
Likhet är inte tillgänglig för modellen Eleven v3.
Stilöverdrift
I samband med introduktionen av de nyare modellerna lade vi också till en inställning för stilöverdrift. Inställningen försöker förstärka den ursprungliga talarens stil. Den använder ytterligare beräkningsresurser och kan öka latensen om den är inställd på något annat än 0. Det är viktigt att notera att användning av den här inställningen har visat sig göra modellen något mindre stabil, eftersom den försöker betona och efterlikna den ursprungliga röstens stil.
Generellt rekommenderar vi att du alltid håller den här inställningen på 0.
Speaker Boost
Den här inställningen ökar likheten med den ursprungliga talaren. Den kräver dock något högre beräkningskapacitet, vilket i sin tur ökar latensen. Skillnaderna som inställningen ger är generellt ganska subtila.
Speaker Boost är inte tillgänglig för modellen Eleven v3.
Generera
När du har valt röst, modell och konfigurerat inställningarna är genereringsprocessen enkel: du skriver in text, trycker på “Generera tal” och ljudet genereras.
Även om processen är mycket enkel på ytan är texten du anger extremt viktig för att uppnå önskat resultat. När du använder ord som kan vara “utanför distributionen” – alltså sådant som AI:n sällan stötte på under träningen – som märkliga namn, ovanliga förkortningar, symboler eller till och med emojis, riskerar du att förvirra AI:n och göra resultatet mer instabilt. Emojis och vissa symboler är särskilt svåra för AI:n att tolka korrekt.
När du använder Text to Speech via användargränssnittet kör vi ett automatiskt normaliseringssteg på din inmatning för att förbättra textens läsbarhet och göra den enklare för AI:n att bearbeta. Vanligtvis omvandlar steget symboler och siffror till utskriven text, vilket hjälper AI:n med korrekt uttal.
En rekommenderad metod som vi starkt rekommenderar är att undvika att skriva siffror som siffror eller använda symboler, särskilt när du använder flerspråkiga modeller (men det gäller även modeller enbart för engelska). Eftersom siffror och symboler skrivs på samma sätt på många språk men uttalas olika skapar siffror tvetydighet för AI:n. Talet “1” skrivs till exempel identiskt på engelska och många andra språk, men uttalas olika. Att skriva ut talet i text, till exempel “ett”, gör att AI:n inte behöver tolka vad den ska göra.
Vi arbetar på mer avancerade arbetsflöden som låter dig påverka AI:ns leverans och prestation med hjälp av det vi kallar Audio Tags. Den här funktionen finns i Eleven v4 och Eleven v3. Om du vill veta mer om funktionen rekommenderar vi att du läser vår guide för prompting.
Vanliga frågor
Bra inmatning ger bra resultat
Den första och en av de viktigaste faktorerna är att bra, högkvalitativ och konsekvent inmatning ger bra, högkvalitativa och konsekventa resultat.
Om du ger AI:n ljud som inte är idealiskt – till exempel ljud med mycket brus, reverb på tydligt tal, flera talare eller inkonsekvens i volym, prestation eller leverans – blir AI:n mer instabil och resultatet mer oförutsägbart.
Om du planerar att klona din egen röst rekommenderar vi starkt att du går igenom riktlinjerna i dokumentationen för att skapa korrekta röstkloner, eftersom det ger dig bästa möjliga grund att utgå från. Även om du endast tänker använda Instant Voice Clones är det klokt att också läsa avsnittet om Professional Voice Cloning. Det avsnittet innehåller värdefull information om att skapa röstkloner, även om kraven för de två teknikerna skiljer sig något.
Använd rätt röst
Den andra faktorn att tänka på är att rösten du väljer har en enorm effekt på resultatet. Som nämndes i den första faktorn är inte bara kvaliteten och konsekvensen hos exemplen som användes för att skapa den specifika klonen mycket viktig, utan även röstens språk och tonalitet.
Om du vill ha en röst som låter glad och munter bör du använda en röst som klonats med glada och muntra exempel. Om du däremot vill ha en röst som låter eftertänksam och grubblande bör du välja en röst med de egenskaperna.
Det är dock också avgörande att använda en röst som har tränats på rätt språk. Alla professionella röstkloner som vi erbjuder som standardröster är till exempel engelska röster och har tränats på engelska exempel. Om du låter dem tala andra språk kan deras prestation på dessa språk därför bli oförutsägbar. Det är viktigt att använda en röst som har klonats från exempel där rösten talade det språk du vill att AI:n sedan ska tala.
Använd korrekt formatering
Det kan verka ganska trivialt, men det kan göra stor skillnad. AI:n försöker förstå hur något ska läsas utifrån textens sammanhang, vilket innebär inte bara vilka ord som används utan även hur de sätts ihop, hur skiljetecken används, grammatiken och textens allmänna formatering.
Detta kan ha en liten men betydande påverkan på AI:ns leverans. Om du stavar ett ord fel rättar AI:n det inte, utan försöker läsa det som det är skrivet.
Icke-deterministisk
AI:ns inställningar är icke-deterministiska, vilket innebär att den även med samma startförutsättningar (röst, inställningar, modell) ger dig ett något annorlunda resultat, ungefär som en röstskådespelare levererar en något annorlunda prestation varje gång.
Denna variation kan bero på flera faktorer, som alternativen som nämndes tidigare: röst, inställningar och modell. Generellt kan omfattningen av variationen styras med stabilitetsreglaget. En lägre stabilitetsinställning innebär större variation mellan genereringar, men introducerar också variation mellan enskilda genereringar, där AI:n kan vara lite mer uttrycksfull.
Större variation kan ofta vara önskvärd, eftersom en alltför hög stabilitet kan få vissa röster att låta monotona då AI:n inte får samma utrymme att generera mer varierat innehåll. Men om stabiliteten ställs för lågt kan det också leda till andra problem där genereringarna blir instabila, särskilt med vissa röster som kan ha använt mindre än idealiskt ljud i kloningsprocessen.
Standardinställningen 50 är generellt en bra utgångspunkt för de flesta användningsområden.
Vad är Eleven v4?
Vi rekommenderar att du byter till Eleven v4 och testar det med ditt eget innehåll.
Eleven v4 är vår senaste och mest avancerade Text to Speech-modell, och den första i en ny generation av modeller. Den förbättrar kvaliteten på resultatet, röstnoggrannheten, känslor, ljudtaggar och språkstödet jämfört med Eleven v3.
Noggrannheten i Voice Cloning tar ett stort steg framåt med Eleven v4. Klonade röster fångar källröstens egenskaper – klangfärg, rytm och framförande – mer troget än någon tidigare modell.
Instant Voice Clones (IVC:er) är mer exakta än någonsin i Eleven v4. De fångar de utmärkande egenskaperna hos en källröst mer troget, vilket gör det enklare att snabbt skapa en övertygande klon från ett kort ljudprov.
Professional Voice Clones (PVC:er) stöds fullt ut i Eleven v4. De bygger på samma framsteg inom röstnoggrannhet och erbjuder en mer trogen återgivning av källrösten för arbetsflöden som kräver högsta möjliga konsekvens och kontroll.
Eleven v4 finns i två varianter, så att du kan välja rätt balans mellan kvalitet och hastighet för ditt användningsfall:
Eleven v4 (eleven_v4) – vår modell med högst kvalitet, perfekt för innehållsskapande, ljudböcker, röstpålägg för karaktärer och alla användningsfall där kvalitet är högsta prioritet.
Eleven v4 Turbo (eleven_v4_turbo) – extremt hög kvalitet med imponerande låg latens, särskilt utvecklad för realtidsanvändning som konversationsagenter och interaktiva röstupplevelser.
Båda varianterna använder två röstinställningar: Stability och Similarity. Reglagen Style och Speed är inte tillgängliga i Eleven v4, och SSML stöds inte.
När språket du genererar på matchar språket för din referensröst bevaras den ursprungliga accenten precis som tidigare. När språket du genererar på skiljer sig från referensröstens språk genererar Eleven v4 flytande, naturligt klingande tal på målspråket – i stället för att föra över referensröstens accent från dess ursprungliga språk.
Information om kloning, accenter, jämförelser och en fullständig beskrivning finns i Eleven v4. Information om taggar och prompting finns i Prompting Eleven v4.
Vad är Eleven v3?
Vi rekommenderar att du byter till Eleven
v4 och testar det
med ditt eget innehåll. Många av promptteknikerna för Eleven
v4 fungerar även för
Eleven v3.
Eleven v3 är en känslomässigt rik och uttrycksfull Text to Speech-modell. Den producerar naturligt, verklighetstroget tal med stort känslomässigt omfång och kontextförståelse på över 70 språk.
Du kan styra rösthastigheten för Text to Speech via Speech Synthesis, Studio, ElevenAgents och vårt API.
Du kan styra röstens hastighet med inställningen Speed.
Möjliga värden är från 0,7 till 1,2. Värden under 1 saktar ner talet, medan värden över 1 snabbar upp det. Extrema värden kan påverka kvaliteten på det genererade talet.
Den här inställningen är tillgänglig för alla röster och modeller. Du hittar den i röstinställningarna.
Information om hur du styr talet när du använder API:t finns i vår API-referens.
Kan jag använda samma klonade/designade röst på olika språk?
Alla röster kan tala alla språk som stöds.
Den nuvarande modellen fungerar så att du inte väljer ett specifikt språk. I stället skriver du på det språk du vill att AI:n ska tala, och AI:n förstår automatiskt. Det kan dock finnas överlappningar mellan olika språk som använder liknande ord och ordförråd men har helt olika uttal och accenter. Därför bör du använda en klonad röst som klonades medan personen talade språket med rätt accent.
Språket avgörs av texten, medan accent och uttal avgörs av själva rösten. Den behöver båda dessa sammanhang för att fungera optimalt.
Vi undersöker hur vi kan utveckla ny teknik som underlättar språkvalet, men sättet AI:n är byggd på innebär att arbetet fortfarande pågår.
Hur laddar jag ner genererade filer från Text to Speech?
Du kan ladda ner de genererade filerna på två sätt:
Du kan ladda ner en genererad fil direkt genom att klicka på nedladdningsknappen längst ner till höger efter att du har genererat innehållet.
Tidigare genererade filer kan laddas ner från din historik.
För att komma åt din historik loggar du in på ditt konto och väljer Text to Speech i sidofältet. Öppna sedan historiken genom att klicka på historikfliken i panelen på skärmens högra sida. På smala skärmar kan du komma åt historiken genom att klicka på historikikonen ovanför knappen Generera tal.
I historiken kan du klicka på nedladdningsikonen för att se alternativet att ladda ner som MP3-fil (128 kbps) eller WAV-fil.
Du kan också klicka på Avancerat för att ladda ner i ytterligare filformat:
MP3 (192 kbps)
MP3 (256 kbps)
M4A
FLAC
Kan ni få röster att skapa andningsljud?
Ja. Med Eleven v4 och Eleven v3 kan du använda ljudtaggar som [sighs] eller [exhales] för att lägga till andning och liknande reaktioner i genererat tal.
I promptguiden finns mer information om ljudtaggar och styrning av framförandet.
Erbjuder ni en AI-modell för samtal eller chattbottar?
Våra Flash- och Turbo-modeller har utvecklats särskilt för applikationer med låg latens.
Flash v2 och Flash v2.5 är våra modeller med ultralåg latens och genererar ljud på mindre än 75 ms. Flash v2 är endast tillgänglig på engelska, medan Flash v2.5 stöder 32 språk. Du hittar en fullständig lista över alla språk som stöds
här.
Våra Turbo-modeller har också låg latens, men eftersom Flash-modellerna ger mycket liknande resultat rekommenderar vi att du använder Flash-modellerna i stället för Turbo. Turbo v2 är endast tillgänglig på engelska, medan Turbo v2.5 stöder 32 språk och är 25 % snabbare än Turbo v2, med ljudgenerering på omkring 300 ms.
Både Flash och Turbo är högoptimerade modeller, särskilt anpassade för applikationer med låg latens utan att kompromissa med röstprestandan eller den kvalitetsnivå som människor förväntar sig av våra modeller.
Båda modellerna är rabatterade när du genererar via API. Mer information finns i våra API-priser.
Vi erbjuder även ElevenAgents, vår plattform för att driftsätta anpassade, interaktiva röstagentar. Besök vår dokumentation för ElevenAgents om du vill veta mer.
Hur kan jag lägga till pauser?
Det finns några sätt att lägga in en paus eller ett avbrott och påverka talarens rytm och tempo. Vilken metod du använder beror på modellen.
Ljudtaggar (Eleven v4 och Eleven v3)
Med Eleven v4 och Eleven v3 använder du ljudtaggar och skiljetecken för att styra tempo och framförande. Dessa modeller har inte stöd för SSML-breaktaggar.
I promptguiden finns vägledning om hur du anger pauser och framförande.
Breaktaggar (Multilingual v2, Flash v2 och Flash v2.5)
Det mest konsekventa sättet att lägga till en paus i Multilingual v2, Flash v2 och Flash v2.5 är med SSML-syntaxen för breaktaggar: <break time="1.5s" />. Detta skapar en exakt och naturlig paus i talet. Det är inte bara tystnad som läggs in mellan ord – modellen förstår syntaxen och lägger till en naturlig paus.
Hur modellen hanterar dessa pauser kan variera. Rösten som används spelar en avgörande roll för resultatet. Vissa röster, som tränats med några “eh” och “ah”, kan lägga in sådana röstmanér under pauser, precis som en riktig talare kan göra.
Ett exempel kan se ut så här:
“Ge mig en sekund att tänka på det.” <break time="1.0s" /> “Ja, det skulle fungera.”
Pausens längd ska anges i sekunder. AI:n kan hantera pauser på upp till 3 sekunder och kan användas i Text to Speech och via API:t.
Om du använder ett alltför stort antal SSML-pauser i texten kan det orsaka problem. Talet kan bli snabbare, eller så kan ljudet få mer brus och andra artefakter. Vi arbetar på att lösa detta.
Skiljetecken
De här alternativen är mindre konsekventa än breaktaggar eller ljudtaggar, men kan ändå påverka tempot.
Ett enkelt bindestreck - eller tankstreck — fungerar ofta bra. Du kan lägga till flera bindestreck, till exempel -- --, för en längre paus.
“Det - börjar - bli sent.”
En ellips ... kan ibland lägga till en paus mellan ord, men den ger vanligtvis också rösten en viss tvekan eller nervositet som inte alltid passar.
“Jag… ja, det antar jag…”
Hur kan jag tvinga fram ett visst uttal av ett ord eller namn?
Eleven v3 har inbyggt stöd för det internationella fonetiska alfabetet (IPA). Läs mer i IPA med Eleven v3.
SSML-fonemtaggar (endast Flash v2 och Turbo v2)
I Flash v2 och Turbo v2 kan du tvinga fram ett visst uttal med SSML-fonemtaggar. Vi stöder både IPA och CMU. CMU tenderar att vara lite mer förutsägbart och konsekvent i den nuvarande implementeringen. Du kan läsa mer i vår uttalsguide.
Alternativa stavningar
Ett alternativ är att hitta en annan stavning och skriva ett ord mer fonetiskt. Du kan använda olika knep, till exempel versaler, bindestreck, apostrofer eller till och med enkla citattecken runt en eller flera bokstäver.
Till exempel kan ett ord som “trapezii” stavas “trapezIi” för att betona ordets “ii” mer.
Hur fungerar ljudtaggar med Eleven v3 och v4?
Eleven v4 och Eleven v3 stöder ljudtaggar. Vi rekommenderar Eleven v4. Skriv en kort instruktion inom hakparenteser och placera den i texten där framförandet ska ändras. Samma taggar fungerar med båda modellerna.
Filer som du har genererat med Text to Speech eller Voice Changer kan laddas ner som MP3-, WAV-, M4A- eller FLAC-filer. WAV-, M4A- och FLAC-filer måste laddas ner från din historik.
Så laddar du ner WAV-filer
Välj antingen Text to Speech eller Voice Changer i sidofältet och öppna sedan historiken genom att klicka på historikfliken i panelen på skärmens högra sida. På smala skärmar kan du komma åt historiken genom att klicka på historikikonen ovanför knappen Generera tal.
I historiken kan du klicka på nedladdningsikonen för att se alternativet att ladda ner som MP3- eller WAV-fil.
Så laddar du ner FLAC- eller M4A-filer
Välj antingen Text to Speech eller Voice Changer i sidofältet och öppna sedan historiken genom att klicka på historikfliken i panelen på skärmens högra sida. På smala skärmar kan du komma åt historiken genom att klicka på historikikonen ovanför knappen Generera tal.
I historiken kan du klicka på nedladdningsikonen för att se alternativet att ladda ner som MP3- eller WAV-fil. För att få tillgång till ytterligare filformat, inklusive FLAC och M4A, klickar du på Avancerat och väljer önskat format.
Hur väljer jag språk och accent?
Språk vid generering på webbplatsen
När du genererar ljud på ElevenLabs webbplats identifierar vår AI automatiskt språket utifrån sammanhanget i texten i din prompt. Därför är det bäst att undvika flera språk i samma prompt, eftersom det kan skapa förvirring kring vilket språk som ska användas. För närvarande går det inte att ange ett språk vid generering på webbplatsen.
Språk vid generering via API
Om du genererar ljud via API:t kan du manuellt ange språket för din prompt med parametern language_code. Detta är en valfri parameter som accepterar språkkoder enligt ISO 639-1.
Detta kan vara användbart för korta eller tvetydiga promptar, till exempel när texten bara innehåller siffror. Genom att ange språket säkerställer du att normaliseraren tillämpar rätt regler för det språket.
Accenten som används i din generering kommer från rösten du använder. Om du använder en röst som inte har tränats på språket du genererar på kan du märka en lätt accent från röstens ursprungliga språk.
För bästa resultat rekommenderar vi att du använder en röst som har tränats på ljud på språket du genererar på, med den accent du föredrar. Det hjälper AI:n att förstå uttal och intonation mer exakt.
Detta är särskilt viktigt för språk som liknar varandra eller delar många vanliga ord. Genom att välja en röst som tränats på rätt språk säkerställer du att AI:n använder rätt uttal och accent.
Du kan:
Skapa en klonad röst med ljud på språket och med accenten du föredrar.
Bläddra i Voice Library och använda sökfiltren för att hitta lämpliga röster som
passar dina behov.
Hur mycket kostar det att generera med Eleven v3 (Alpha)?
Det kostar 1 kredit per tecken att generera med Eleven v3 på webbplatsen. Generering via API har rabatt – se API-priser för mer information.
Med Eleven v4 och Eleven v3 kan du använda ljudtaggar, till exempel [laughs], för att lägga till skratt och andra reaktioner i genererat tal. Mer information finns i promptguiden.
För andra modeller beror känslomässigt framförande på sammanhang, skiljetecken och röstinställningar. Se Hur skapar jag känslor?.
Hur skapar jag känslouttryck?
Modellen är känslig för det bredare sammanhanget kring varje yttrande – den bedömer om något är rimligt utifrån hur det hänger ihop med föregående och efterföljande text. Detta helhetsperspektiv gör att den kan intonera längre stycken korrekt genom att lägga ett enhetligt känslomässigt mönster över en tankegång som sträcker sig över flera meningar.
Tips för att skapa känslor:
Kontext är avgörande för att skapa specifika känslor. Om du skriver in skrattande eller rolig text kan resultatet bli glatt. Detsamma gäller ilska, sorg och andra känslor – det är viktigt att sätta rätt kontext.
Interpunktion och röstinställningar spelar störst roll för hur resultatet framförs.
Lägg till betoning genom att sätta relevanta ord eller fraser inom citationstecken.
För tal som genereras med en klonad röst återskapas talstilen från de exempel du laddar upp för kloning i resultatet. Om talet i det uppladdade exemplet är monotont kommer modellen att ha svårt att skapa ett uttrycksfullt resultat.
Med Eleven v4 och Eleven v3 kan du även använda ljudtaggar för att styra känslor och framförande mer direkt, till exempel [happy], [sad], [angry], [whispers] och [laughs]. Mer information finns i promptguiden.
De här tipsen kan hjälpa till att styra det känslomässiga framförandet, men garanterar inte ett specifikt resultat.
Finns det ett sätt att förhandsgranska ljud utan att förbruka kvoten före nedladdning?
Tyvärr erbjuder vi för närvarande inte avdrag vid nedladdning som ett alternativ till avdrag vid generering. Det finns för närvarande inget sätt att förhandsgranska genereringar utan att förbruka kvot.
När du trycker på ”Generate” på webbplatsen dras krediter, eftersom servrarna behöver startas och ljudet behöver genereras. Det går inte att testa eller förhandsgranska en röst med din egen text utan att använda krediter.
Vi tillåter två kostnadsfria omgenereringar i Text to Speech via webbplatsen under följande omständigheter:
Prompten (för Text to Speech) eller filen (för Voice Changer), rösten och modellen är oförändrade. Du kan ändra reglagen för röstinställningarna.
Den första genereringen gjordes för mindre än två timmar sedan.
Du har inte uppdaterat sidan sedan det ursprungliga ljudet genererades.
Om detta gäller dig visas ”Regenerate speech”, och antalet återstående kostnadsfria omgenereringar visas när du håller muspekaren över knappen ”Regenerate speech”:
När dina kostnadsfria omgenereringar har använts ändras knappen tillbaka till ”Generate speech”, och antalet krediter som används för genereringen visas:
Kostnadsfria omgenereringar är endast tillgängliga i Text to Speech via webbplatsen. De är inte tillgängliga via API:et.
Vi undersöker om vi kan möjliggöra förhandsgranskningar med den här kvaliteten utan att höja priserna eller kostnaderna. Vi undersöker också sätt att göra AI:n mer styrbar, så att du slipper förhandsgranska och i stället får önskat resultat, förhoppningsvis redan vid första försöket.
Vad är dialogläget?
Eleven v4 och Eleven v3 erbjuder dialogläget, som låter dig generera dynamiska konversationer med flera talare i naturligt tempo och hantera avbrott, tonlägesändringar och känslomässiga signaler utifrån samtalets kontext.
Dialogläget är tillgängligt när du använder flera talare via webbplatsen.
Du kan även använda API-slutpunkterna för Text to Dialogue för att generera interaktioner med flera talare. Mer information finns i vår API-dokumentation:
Alla röster kan tala alla språk som AI:n för närvarande stöder. Men om du inte använder en röst som har det språk du vill att AI:n ska tala som modersmål – till exempel om du använder en genererad röst eller en röst som klonats medan den talar engelska – kan AI:n ha en svag engelsk accent eller ibland växla till närliggande språk.
En fullständig lista över alla språk som stöds finns i den här artikeln: Vilka språk stöder ni?
Den nuvarande modellen fungerar så att du inte väljer ett specifikt språk. I stället skriver du på det språk du vill att AI:n ska tala, så förstår AI:n automatiskt. Eftersom olika språk kan överlappa genom att använda liknande ord och ordförråd, men ha ganska olika uttal och accenter, bör du använda en klonad röst som klonats medan den talar språket med rätt accent. Det ger AI:n bäst förutsättningar att förstå hur något ska uttalas och på vilket språk.
Språket avgörs av texten, medan accent och uttal avgörs av själva
rösten.
Vi undersöker ny teknik som kan göra det möjligt att välja språk, men sättet AI:n är uppbyggd på innebär att allt detta fortfarande är under utveckling.
Hur mycket text och hur många tecken kan jag generera som mest?
I Text to Speech kan du, via webbplatsen, generera upp till 5 000 tecken i en enda generering med alla betalplaner och upp till 2 500 tecken med alla gratisplaner.
Om du planerar att generera längre innehåll med fler än några tusen tecken rekommenderar vi dock starkt att du använder Studio, där du enkelt kan generera mycket långt innehåll som böcker och romaner. Du kan läsa mer om det här.
Om du genererar via API:t varierar den maximala inmatningslängden beroende på vilken modell du använder:
Text to Speech
Flash v2.5 – upp till 40 000 tecken (~40 minuters ljud)
Turbo v2.5 – upp till 40 000 tecken (~40 minuters ljud)
Flash v2 – upp till 30 000 tecken (~30 minuters ljud)
Turbo v2 – upp till 30 000 tecken (~30 minuters ljud)
Multilingual v2 – upp till 10 000 tecken (~10 minuters ljud)
Voice Changer
Multilingual v2 – upp till 10 minuters ljud
Vilka röster i röstbiblioteket har ett visst språk som modersmål?
Alla förgjorda röster och genererade röster är engelska. Det betyder att de kanske inte har rätt accent eller uttal när de talar andra språk.
I Voice Library, under kategorin för professionella röster, hittar du röster som communityn har delat med oss. Dessa röster är communitymedlemmarnas egna Professional Voice Clones. De har vanligtvis en språktagg som anger språket de klonades på, vilket gör dem till modersmålsröster för det språket. Du kan också använda språkfiltret för att filtrera efter specifika språk.
Varför uttalas siffror, datum, symboler och akronymer inte korrekt eller på rätt språk?
Siffror, datum, symboler och förkortningar kan vara en utmaning för AI:n, eftersom det ofta finns flera sätt att uttala dem korrekt. Det kan också bero på vilket språk som används. Till exempel kan ”11” läsas som ”elva”, men på spanska kan det vara ”once” och på tyska ”elf”.
Det finns flera sätt att säkerställa att siffror, datum, förkortningar och symboler uttalas korrekt.
Skriv ut dem med ord
För bästa resultat rekommenderar vi att du skriver siffror, förkortningar, datum och symboler fullt ut med ord, på det sätt du vill att AI:n ska uttala dem. Då får AI:n så mycket sammanhang som möjligt för att kunna ge rätt resultat. För ”$100” rekommenderar vi till exempel att du skriver antingen ”hundra dollar” eller ”en hundra dollar” för att säkerställa att du får det resultat du vill ha.
Använda en LLM
Om du använder en stor språkmodell för att skapa dina textprompter, till exempel när du använder ElevenAgents, kan du instruera modellen att alltid skriva ut siffror, datum, symboler och förkortningar med ord på det sätt du vill att AI:n ska uttala dem.
Normalisering
Om du genererar via API:t kan du ange om textnormalisering ska tillämpas med parametern apply_text_normalization. Textnormalisering skriver ut siffror och datum med ord för att ge bättre uttal. Det här alternativet ökar fördröjningen eftersom normaliseringsprocessen kräver extra bearbetningstid.
Parametern apply_text_normalization har tre lägen:
on, vilket innebär att den alltid tillämpas
off, vilket innebär att den aldrig tillämpas
auto, vilket innebär att AI:n automatiskt avgör när textnormalisering ska tillämpas
Du kan också ange språket för din prompt med parametern language_code. Det här är en valfri parameter som accepterar språkkoder enligt ISO 639-1.
Det kan vara användbart för korta eller tvetydiga promptar, till exempel när texten bara innehåller siffror eller symboler. Genom att ange språket säkerställer du att normaliseraren tillämpar rätt regler för det språket.
Normalisering är aktiverat som standard när du genererar med Text to Speech via webbplatsen.
I Studio tillämpas normalisering automatiskt som standard, vilket innebär att AI:n avgör när textnormalisering ska användas. Du kan också välja att normalisering alltid ska tillämpas – alternativet finns i Projektinställningar under fliken Avancerat.
Varför uttalar min röst vissa ord fel?
Feluttal kan bero på flera olika saker. Den vanligaste orsaken är att ordet helt enkelt är felstavat. AI:n försöker inte rätta felstavade ord, utan läser dem precis som de är skrivna. Därför är det viktigt att dubbelkolla och se till att texten är korrekturläst och färdig innan AI:n läser den.
Om du vill tvinga fram ett visst uttal kan du använda SSML-fonemtaggar med vår Flash v2-modell. Läs mer om detta i vår uttalsguide.
Ibland kan AI:n uttala ord fel eller ha en ovanlig accent som inte är den du förväntar dig. Det kan bero på flera saker och är i de flesta fall mycket beroende av rösten och språket. Det bästa sättet att säkerställa rätt accent och uttal är att klona en röst med rätt accent och uttal. Då får AI:n mest sammanhang när ljudet genereras.
Språket anges av texten och accenten anges av rösten. Om du skriver på ett språk som delar många vanliga ord med ett annat språk eller som är nära besläktat med ett annat språk, kan AI:n därför ha svårt att förstå hur vissa ord ska uttalas eller när den ska växla mellan accenter.
Under vissa omständigheter kan AI:n dock uttala korrekt skrivna ord fel, även på engelska. Det verkar i hög grad bero på rösten och texten som används, men bör vara ovanligt.