> This is a page from the ElevenLabs documentation. For a complete page index, fetch https://elevenlabs.io/docs/llms.txt. For the full documentation in a single file, fetch https://elevenlabs.io/docs/llms-full.txt.

# Text to Speech

## Översikt

ElevenLabs [Text to Speech (TTS)](/docs/sv/api-reference/text-to-speech/convert)-API förvandlar text till verklighetstroget ljud med nyanserad intonation, tempo och känslomedvetenhet. [Våra modeller](/docs/sv/overview/models) anpassar sig till textsignaler på 32 språk och flera röststilar och kan användas för att:

* Berätta globala mediekampanjer och annonser
* Producera ljudböcker på flera språk med komplex känslomässig leverans
* Strömma ljud i realtid från text

Lyssna på ett exempel:

<elevenlabs-audio-player audio-title="George" audio-src="https://storage.googleapis.com/eleven-public-cdn/audio/marketing/george.mp3" />

Utforska vårt [röstbibliotek](https://elevenlabs.io/app/voice-library) för att hitta den perfekta rösten för ditt projekt.

> **Warning**
>
> Röstbiblioteket är inte tillgängligt via API:t för användare på kostnadsfri nivå.

#### [Produkter](/docs/sv/eleven-creative/playground/text-to-speech)

Steg-för-steg-guide för att använda text till tal i ElevenLabs.

#### [Utvecklare](/docs/sv/eleven-api/quickstart)

Lär dig hur du integrerar text till tal i din applikation.

#### [API-referens](/docs/sv/api-reference/text-to-speech/convert)

Fullständig API-referens för Text to Speech-slutpunkten.

#### [MCP](/docs/sv/eleven-agents/operate/hosted-mcp)

Generera tal från Claude eller valfri MCP-klient med den värdbaserade MCP-servern.

#### [Eleven v4](/docs/sv/overview/capabilities/text-to-speech/eleven-v4)

Vad som har ändrats i Eleven v4, med jämförelser av röstkloning.

### Röstkvalitet

För realtidsapplikationer ger Flash v2.5 ultralåg latens på 75 ms, medan Multilingual v2 levererar ljud av högsta kvalitet med mer nyanserade uttryck.

#### [Eleven v4](/docs/sv/overview/models#eleven-v4)

Vår mest känslosamma modell för talsyntes med hög kvalitet

Exceptionella möjligheter till Voice Cloning

Stöd för över 90 språk

Gräns på 10 000 tecken

Stöd för naturliga dialoger med flera talare

#### [Eleven v4 Turbo](/docs/sv/overview/models#eleven-v4-turbo)

Vår mest känslosamma modell för talsyntes i realtid

Ultralåg latens (medianlatens för inferens på \~100 ms†)

Exceptionella möjligheter till Voice Cloning

Stöd för över 90 språk

Ljudtaggar för detaljerad kontroll

#### [Eleven v3](/docs/sv/overview/models#eleven-v3)

Vår känslomässigt rika och uttrycksfulla modell för talsyntes

Dramatiskt framförande och uttryck

Stöd för över 70 språk

Gräns på 5 000 tecken

Stöd för naturliga dialoger med flera talare

#### [Eleven v3 Conversational](/docs/sv/overview/models#eleven-v3-conversational)

Vår uttrycksfulla modell för talsyntes i realtid

Låg latens (\~280 ms)

Dramatiskt framförande och uttryck

Stöd för över 70 språk

Ljudtaggar för detaljerad kontroll

#### [Eleven Multilingual v2](/docs/sv/overview/models#multilingual-v2)

Modell för talsyntes med verklighetstroget och jämnt hög kvalitet

Naturligt ljudande resultat

Stöd för 29 språk

Gräns på 10 000 tecken

Mest stabil vid långa genereringar

#### [Eleven Flash v2.5](/docs/sv/overview/models#flash-v25)

Vår snabba och prisvärda modell för talsyntes

Ultralåg latens (\~75 ms†)

Stöd för 32 språk

Gräns på 40 000 tecken

Snabbare modell, 50 % lägre pris per tecken för API-genereringar

[Utforska alla](/docs/sv/overview/models)

### Röstalternativ

ElevenLabs erbjuder tusentals röster på 32 språk genom flera olika skapandemetoder:

* [Röstbibliotek](/docs/sv/overview/capabilities/voices) med över 3 000 röster delade av communityn
* [Professionell röstkloning](/docs/sv/overview/capabilities/voices#cloned) för kopior med högsta möjliga kvalitet
* [Omedelbar röstkloning](/docs/sv/overview/capabilities/voices#cloned) för snabb röstkopiering
* [Voice Design](/docs/sv/overview/capabilities/voices#voice-design) för att skapa anpassade röster från textbeskrivningar

Läs mer om våra [röstalternativ](/docs/sv/overview/capabilities/voices).

#### Utdataformat som stöds

Standardformatet för svaret är `mp3`, men andra format som `pcm` och `ulaw` är också tillgängliga.

* **MP3**
  * Samplingsfrekvenser: 22,05 kHz–44,1 kHz
  * Bithastigheter: 32 kbps–192 kbps
  * 22,05 kHz @ 32 kbps
  * 44,1 kHz @ 32 kbps, 64 kbps, 96 kbps, 128 kbps, 192 kbps
* **PCM (S16LE)**
  * Samplingsfrekvenser: 16 kHz–44,1 kHz
  * Bithastigheter: 8 kHz, 16 kHz, 22,05 kHz, 24 kHz, 44,1 kHz, 48 kHz
  * 16-bitars djup
* **μ-law**
  * Samplingsfrekvens på 8 kHz
  * Optimerat för telefoniapplikationer
* **A-law**
  * Samplingsfrekvens på 8 kHz
  * Optimerat för telefoniapplikationer
* **Opus**
  * Samplingsfrekvens: 48 kHz
  * Bithastigheter: 32 kbps–192 kbps

> **Success**
>
> Ljudalternativ med högre kvalitet är endast tillgängliga i betalabonnemang – se vår [prissida ](https://elevenlabs.io/pricing/api) för mer information.

### Språk som stöds

Våra flerspråkiga v2-modeller har stöd för 29 språk:

*Engelska (USA, Storbritannien, Australien, Kanada), japanska, kinesiska, tyska, hindi, franska (Frankrike, Kanada), koreanska, portugisiska (Brasilien, Portugal), italienska, spanska (Spanien, Mexiko), indonesiska, nederländska, turkiska, filippinska, polska, svenska, bulgariska, rumänska, arabiska (Saudiarabien, Förenade Arabemiraten), tjeckiska, grekiska, finska, kroatiska, malajiska, slovakiska, danska, tamil, ukrainska och ryska.*

Flash v2.5 har stöd för 32 språk – alla språk från v2-modellerna samt:

*Ungerska, norska och vietnamesiska*

Skriv bara in text på något av våra språk som stöds och välj en passande röst från vårt [röstbibliotek](https://elevenlabs.io/app/voice-library). För mest naturliga resultat väljer du en röst med en accent som matchar ditt målspråk och din region.

### Promptning

Modellerna tolkar känslomässig kontext direkt från textinmatningen. Att till exempel lägga till
beskrivande text som "sa hon upphetsat" eller använda utropstecken påverkar talets
känsla. Röstinställningar som stabilitet och likhet hjälper till att styra konsekvensen, medan den
underliggande känslan kommer från textens signaler.

Läs [promptguiden](/docs/sv/overview/capabilities/text-to-speech/best-practices) för mer information.

> **Note**
>
> Beskrivande text kommer att läsas upp av modellen och måste klippas bort eller tas bort manuellt från
> ljudet om så önskas.

## Vanliga frågor

#### Kan jag klona min egen röst?

Ja, du kan skapa [omedelbara röstkloner](/docs/sv/overview/capabilities/voices#cloned) av din egen röst
från korta ljudklipp. För kloner med hög kvalitet kan du läsa om vår funktion för [professionell röstkloning](/docs/sv/overview/capabilities/voices#cloned).

#### Äger jag ljudutdata?

Ja. Du behåller äganderätten till allt ljud du genererar. Kommersiella användningsrättigheter är dock endast
tillgängliga med betalabonnemang. Med en betald prenumeration kan du använda genererat ljud i kommersiella
syften och tjäna pengar på resultatet om du äger IP-rättigheterna till innehållet du matar in.

#### Vad räknas som en kostnadsfri omgenerering?

En kostnadsfri omgenerering låter dig generera samma text till tal-innehåll igen utan extra kostnad, under följande villkor:

* Du kan generera varje innehållsdel igen upp till 2 gånger utan kostnad
* Innehållet måste vara exakt samma som i föregående generering. Alla ändringar av texten, röstinställningarna eller andra parametrar kräver en ny, betald generering

Kostnadsfria omgenereringar är användbara om det finns en mindre förvrängning i ljudutdata. Enligt ElevenLabs interna jämförelser löser omgenereringar ungefär hälften av kvalitetsproblemen, medan återstående problem vanligtvis beror på dåliga träningsdata.

#### Hur minskar jag latensen i realtidsscenarier?

Använd Flash-[modellerna](/docs/sv/overview/models) med låg latens (Flash v2 eller v2.5), som är optimerade för nära nog realtida
samtals- eller interaktiva scenarier. Se vår [guide för latensoptimering ](/docs/sv/eleven-api/guides/how-to/best-practices/latency-optimization) för mer information.

#### Varför är mina utdata ibland inkonsekventa?

Modellerna är icke-deterministiska. För bättre konsekvens kan du använda den valfria [seed- parametern](/docs/sv/api-reference/text-to-speech/convert#request.body.seed), även om små
skillnader fortfarande kan förekomma.

#### Vilken metod är bäst för stora textkonverteringar?

Dela upp lång text i segment och använd streaming för realtidsuppspelning och effektiv bearbetning.
För att behålla ett naturligt prosodiflöde mellan delar inkluderar du parametrarna [föregående/nästa text eller föregående/nästa begärande-id](/docs/sv/api-reference/text-to-speech/convert#request.body.previous_text).

## Viktiga fakta

* **Determinism**: Utdata är icke-deterministiska — använd parametern `seed` för mer konsekventa resultat
* **Kostnadsfria omgenereringar**: Upp till 2 kostnadsfria omgenereringar per generering (endast samma innehåll och parametrar)
* **Äganderätt**: Du behåller äganderätten till genererat ljud; kommersiell användning kräver ett betalabonnemang
* **Användningsområden med låg latens**: Använd Flash-modeller (`eleven_flash_v2` eller `eleven_flash_v2_5`) — se [guiden för latensoptimering](/docs/sv/eleven-api/guides/how-to/best-practices/latency-optimization)
* **Lång text**: Dela upp lång text i segment; använd parametrarna `previous_text` / `next_text` för att behålla naturlig prosodi mellan delar