> This is a page from the ElevenLabs documentation. For a complete page index, fetch https://elevenlabs.io/docs/llms.txt. For the full documentation in a single file, fetch https://elevenlabs.io/docs/llms-full.txt.

# Text till dialog

## Översikt

ElevenLabs [Text to Dialogue](/docs/sv/api-reference/text-to-dialogue/convert)-API skapar naturligt och uttrycksfullt tal från text med [Eleven v4](/docs/sv/overview/capabilities/text-to-speech/eleven-v4) och Eleven v3. Vi rekommenderar Eleven v4. Vanliga användningsområden är:

* Skapa träffsäkra samtal för tv-spel
* Skapa uppslukande dialog för poddar och annat ljudinnehåll
* Ge ljudböcker liv med uttrycksfull berättarröst

Flera genereringar kan krävas för att uppnå önskat resultat. När du integrerar Text to Dialogue i din applikation bör du överväga att skapa flera genereringar och låta användaren välja den bästa.

Lyssna på ett exempel:

<elevenlabs-audio-player audio-title="Dialogexempel" audio-src="https://storage.googleapis.com/eleven-public-cdn/documentation_assets/audio/dialogue.mp3" />

#### [Utvecklare](/docs/sv/eleven-api/guides/cookbooks/text-to-dialogue)

Lär dig hur du integrerar text till dialog i din applikation.

#### [Promptguide](/docs/sv/overview/capabilities/text-to-speech/best-practices#prompting-eleven-v4)

Lär dig hur du skapar uttrycksfull dialog med ljudtaggar.

#### [API-referens](/docs/sv/api-reference/text-to-dialogue/convert)

Fullständig API-referens för Text to Dialogue-slutpunkten.

## Röstalternativ

ElevenLabs erbjuder tusentals röster genom flera olika skapandemetoder. Eleven v4 har stöd för över 90 språk och Eleven v3 har stöd för över 70 språk.

* [Röstbibliotek](/docs/sv/overview/capabilities/voices) med över 3 000 röster delade av communityn
* [Professionell röstkloning](/docs/sv/overview/capabilities/voices#cloned) för kopior med högsta möjliga kvalitet
* [Omedelbar röstkloning](/docs/sv/overview/capabilities/voices#cloned) för snabb röstkopiering
* [Voice Design](/docs/sv/overview/capabilities/voices#voice-design) för att skapa anpassade röster från textbeskrivningar

Läs mer om våra [röstalternativ](/docs/sv/overview/capabilities/voices).

## Promptning

Modellerna tolkar känslomässig kontext direkt från textinmatningen. Att till exempel lägga till
beskrivande text som "sa hon upphetsat" eller använda utropstecken påverkar talets
känsla. Röstinställningar som stabilitet och likhet hjälper till att styra konsekvensen, medan den
underliggande känslan kommer från textens signaler.

Läs [promptguiden](/docs/sv/overview/capabilities/text-to-speech/best-practices#prompting-eleven-v4) för mer information.

### Känslomässig leverans med ljudtaggar

> **Warning**
>
> Den här funktionen är fortfarande under aktiv utveckling, så resultatet kan variera.

Eleven v4 och Eleven v3 gör det möjligt att använda ljudhändelser som inte är tal för att påverka hur dialogen levereras. Det gör du genom att lägga in ljudhändelser i textinmatningen inom hakparenteser.

I Text to Dialogue har varje replik sin egen text och röst. Lägg till ljudtaggar i texten för den replik de ska påverka. `voice_id` väljer fortfarande talarens röst för den repliken, medan taggarna styr leveransen.

En talare kan till exempel använda en röst medan texten börjar med `[giggling]`, och nästa talare kan använda en annan röst medan texten börjar med `[whispering]`. Se [snabbstartsguiden för Text to Dialogue](/docs/sv/eleven-api/guides/cookbooks/text-to-dialogue) för ett API-exempel som kombinerar taggar med `voice_id`.

Ljudtaggar är instruktioner på naturligt språk, inte en enum-parameter. Sätt instruktionen inom hakparenteser och placera den i texten där leveransen ska ändras. Exemplen nedan är inte uttömmande. Använd [promptguiden](/docs/sv/overview/capabilities/text-to-speech/best-practices#prompting-eleven-v4) för mer vägledning om effektiva taggar.

Ljudtaggar finns i några olika former:

### Känslor och leverans

Till exempel \[sad], \[laughing] och \[whispering]

### Ljudhändelser

Till exempel \[leaves rustling], \[gentle footsteps] och \[applause].

### Övergripande instruktion

Till exempel \[football], \[wrestling match] och \[auctioneer].

Några exempel:

```
"[giggling] That's really funny!"
"[groaning] That was awful."
"Well, [sigh] I'm not sure what to say."
```

<elevenlabs-audio-player audio-title="Uttrycksfull dialog" audio-src="https://storage.googleapis.com/eleven-public-cdn/documentation_assets/audio/dialogue-emotive.mp3" />

Du kan också använda skiljetecken för att ange dialogens flöde, till exempel avbrott:

```
"[cautiously] Hello, is this seat-"
"[jumping in] Free? [cheerfully] Yes it is."
```

<elevenlabs-audio-player audio-title="Avbrott" audio-src="https://storage.googleapis.com/eleven-public-cdn/documentation_assets/audio/dialogue-interruption.mp3" />

Ellipser kan användas för att ange avbrutna meningar:

```
"[indecisive] Hi, can I get uhhh..."
"[quizzically] The usual?"
"[elated] Yes! [laughs] I'm so glad you knew!"
```

<elevenlabs-audio-player audio-title="Ellipser" audio-src="https://storage.googleapis.com/eleven-public-cdn/documentation_assets/audio/dialogue-ellipses.mp3" />

#### Utdataformat som stöds

Standardformatet för svaret är `mp3`, men andra format som `pcm` och `ulaw` är också tillgängliga.

* **MP3**
  * Samplingsfrekvenser: 22,05 kHz–44,1 kHz
  * Bithastigheter: 32 kbps–192 kbps
  * 22,05 kHz @ 32 kbps
  * 44,1 kHz @ 32 kbps, 64 kbps, 96 kbps, 128 kbps, 192 kbps
* **PCM (S16LE)**
  * Samplingsfrekvenser: 16 kHz–44,1 kHz
  * Bithastigheter: 8 kHz, 16 kHz, 22,05 kHz, 24 kHz, 44,1 kHz, 48 kHz
  * 16-bitars djup
* **μ-law**
  * Samplingsfrekvens på 8 kHz
  * Optimerat för telefoniapplikationer
* **A-law**
  * Samplingsfrekvens på 8 kHz
  * Optimerat för telefoniapplikationer
* **Opus**
  * Samplingsfrekvens: 48 kHz
  * Bithastigheter: 32 kbps–192 kbps

> **Success**
>
> Ljudalternativ med högre kvalitet är endast tillgängliga i betalabonnemang – se vår [prissida ](https://elevenlabs.io/pricing/api) för mer information.

## Språk som stöds

Eleven v4 har stöd för över 90 språk. Eleven v3 har stöd för över 70 språk. Se [Eleven v4](/docs/sv/overview/models#eleven-v4) och [Eleven v3](/docs/sv/overview/models#eleven-v3) för de fullständiga listorna.

## Vanliga frågor

#### Vilka modeller kan jag använda?

Text to Dialogue är tillgängligt för modellerna Eleven v4 och Eleven v3.

#### Äger jag ljudutdata?

Ja. Du behåller äganderätten till allt ljud du genererar. Kommersiella användningsrättigheter är dock endast
tillgängliga med betalabonnemang. Med en betald prenumeration kan du använda genererat ljud i kommersiella
syften och tjäna pengar på resultatet om du äger IP-rättigheterna till innehållet du matar in.

#### Vad räknas som en kostnadsfri omgenerering?

En kostnadsfri omgenerering låter dig generera samma text till tal-innehåll igen utan extra kostnad, under följande villkor:

* Endast tillgängligt i ElevenLabs kontrollpanel.
* Du kan generera varje innehållsdel igen upp till 2 gånger utan kostnad.
* Innehållet måste vara exakt samma som i föregående generering. Alla ändringar av texten, röstinställningarna eller andra parametrar kräver en ny, betald generering.

Kostnadsfria omgenereringar är användbara om det finns en mindre förvrängning i ljudutdata. Enligt ElevenLabs interna jämförelser löser omgenereringar ungefär hälften av kvalitetsproblemen, medan återstående problem vanligtvis beror på dåliga träningsdata.

#### Hur många talare kan min dialog ha?

Det finns ingen gräns för antalet talare i en dialog.

#### Varför är mina utdata ibland inkonsekventa?

Modellerna är icke-deterministiska. För bättre konsekvens kan du använda den valfria [seed- parametern](/docs/sv/api-reference/text-to-speech/convert#request.body.seed), även om små
skillnader fortfarande kan förekomma.

#### Vilken metod är bäst för stora textkonverteringar?

Håll den totala längden för alla `inputs[].text`-värden på högst 2 000 tecken per begäran för tillförlitlig generering. Dela upp längre text i delar och sammanfoga det resulterande ljudet i din applikation.

## Viktiga fakta

* **Modeller**: Tillgängligt med Eleven v4 och Eleven v3
* **Talare**: Ingen gräns för antalet talare per dialog
* **Begäransstorlek**: Håll den totala längden för alla `inputs[].text`-värden på högst 2 000 tecken per begäran
* **Determinism**: Utdata är icke-deterministiska — använd parametern `seed` för mer konsekventa resultat
* **Kostnadsfria omgenereringar**: Upp till 2 kostnadsfria omgenereringar per generering (samma innehåll, samma parametrar, endast i kontrollpanelen)
* **Äganderätt**: Du behåller äganderätten till genererat ljud; kommersiell användning kräver ett betalabonnemang