Hoppa till navigering

Text till dialog

Lär dig hur du skapar uppslukande dialoger som låter naturliga med ElevenLabs.

Översikt

ElevenLabs Text to Dialogue-API skapar naturligt och uttrycksfullt tal från text med Eleven v4 och Eleven v3. Vi rekommenderar Eleven v4. Vanliga användningsområden är:

  • Skapa träffsäkra samtal för tv-spel
  • Skapa uppslukande dialog för poddar och annat ljudinnehåll
  • Ge ljudböcker liv med uttrycksfull berättarröst

Flera genereringar kan krävas för att uppnå önskat resultat. När du integrerar Text to Dialogue i din applikation bör du överväga att skapa flera genereringar och låta användaren välja den bästa.

Lyssna på ett exempel:

Röstalternativ

ElevenLabs erbjuder tusentals röster genom flera olika skapandemetoder. Eleven v4 har stöd för över 90 språk och Eleven v3 har stöd för över 70 språk.

Läs mer om våra röstalternativ.

Promptning

Modellerna tolkar känslomässig kontext direkt från textinmatningen. Att till exempel lägga till beskrivande text som “sa hon upphetsat” eller använda utropstecken påverkar talets känsla. Röstinställningar som stabilitet och likhet hjälper till att styra konsekvensen, medan den underliggande känslan kommer från textens signaler.

Läs promptguiden för mer information.

Känslomässig leverans med ljudtaggar

Den här funktionen är fortfarande under aktiv utveckling, så resultatet kan variera.

Eleven v4 och Eleven v3 gör det möjligt att använda ljudhändelser som inte är tal för att påverka hur dialogen levereras. Det gör du genom att lägga in ljudhändelser i textinmatningen inom hakparenteser.

I Text to Dialogue har varje replik sin egen text och röst. Lägg till ljudtaggar i texten för den replik de ska påverka. voice_id väljer fortfarande talarens röst för den repliken, medan taggarna styr leveransen.

En talare kan till exempel använda en röst medan texten börjar med [giggling], och nästa talare kan använda en annan röst medan texten börjar med [whispering]. Se snabbstartsguiden för Text to Dialogue för ett API-exempel som kombinerar taggar med voice_id.

Ljudtaggar är instruktioner på naturligt språk, inte en enum-parameter. Sätt instruktionen inom hakparenteser och placera den i texten där leveransen ska ändras. Exemplen nedan är inte uttömmande. Använd promptguiden för mer vägledning om effektiva taggar.

Ljudtaggar finns i några olika former:

Känslor och leverans

Till exempel [sad], [laughing] och [whispering]

Ljudhändelser

Till exempel [leaves rustling], [gentle footsteps] och [applause].

Övergripande instruktion

Till exempel [football], [wrestling match] och [auctioneer].

Några exempel:

"[giggling] That's really funny!"
"[groaning] That was awful."
"Well, [sigh] I'm not sure what to say."

Du kan också använda skiljetecken för att ange dialogens flöde, till exempel avbrott:

"[cautiously] Hello, is this seat-"
"[jumping in] Free? [cheerfully] Yes it is."

Ellipser kan användas för att ange avbrutna meningar:

"[indecisive] Hi, can I get uhhh..."
"[quizzically] The usual?"
"[elated] Yes! [laughs] I'm so glad you knew!"

Standardformatet för svaret är mp3, men andra format som pcm och ulaw är också tillgängliga.

  • MP3
    • Samplingsfrekvenser: 22,05 kHz–44,1 kHz
    • Bithastigheter: 32 kbps–192 kbps
    • 22,05 kHz @ 32 kbps
    • 44,1 kHz @ 32 kbps, 64 kbps, 96 kbps, 128 kbps, 192 kbps
  • PCM (S16LE)
    • Samplingsfrekvenser: 16 kHz–44,1 kHz
    • Bithastigheter: 8 kHz, 16 kHz, 22,05 kHz, 24 kHz, 44,1 kHz, 48 kHz
    • 16-bitars djup
  • μ-law
    • Samplingsfrekvens på 8 kHz
    • Optimerat för telefoniapplikationer
  • A-law
    • Samplingsfrekvens på 8 kHz
    • Optimerat för telefoniapplikationer
  • Opus
    • Samplingsfrekvens: 48 kHz
    • Bithastigheter: 32 kbps–192 kbps

Ljudalternativ med högre kvalitet är endast tillgängliga i betalabonnemang – se vår prissida för mer information.

Språk som stöds

Eleven v4 har stöd för över 90 språk. Eleven v3 har stöd för över 70 språk. Se Eleven v4 och Eleven v3 för de fullständiga listorna.

Vanliga frågor

Text to Dialogue är tillgängligt för modellerna Eleven v4 och Eleven v3.

Ja. Du behåller äganderätten till allt ljud du genererar. Kommersiella användningsrättigheter är dock endast tillgängliga med betalabonnemang. Med en betald prenumeration kan du använda genererat ljud i kommersiella syften och tjäna pengar på resultatet om du äger IP-rättigheterna till innehållet du matar in.

En kostnadsfri omgenerering låter dig generera samma text till tal-innehåll igen utan extra kostnad, under följande villkor:

  • Endast tillgängligt i ElevenLabs kontrollpanel.
  • Du kan generera varje innehållsdel igen upp till 2 gånger utan kostnad.
  • Innehållet måste vara exakt samma som i föregående generering. Alla ändringar av texten, röstinställningarna eller andra parametrar kräver en ny, betald generering.

Kostnadsfria omgenereringar är användbara om det finns en mindre förvrängning i ljudutdata. Enligt ElevenLabs interna jämförelser löser omgenereringar ungefär hälften av kvalitetsproblemen, medan återstående problem vanligtvis beror på dåliga träningsdata.

Det finns ingen gräns för antalet talare i en dialog.

Modellerna är icke-deterministiska. För bättre konsekvens kan du använda den valfria seed- parametern, även om små skillnader fortfarande kan förekomma.

Håll den totala längden för alla inputs[].text-värden på högst 2 000 tecken per begäran för tillförlitlig generering. Dela upp längre text i delar och sammanfoga det resulterande ljudet i din applikation.

Viktiga fakta

  • Modeller: Tillgängligt med Eleven v4 och Eleven v3
  • Talare: Ingen gräns för antalet talare per dialog
  • Begäransstorlek: Håll den totala längden för alla inputs[].text-värden på högst 2 000 tecken per begäran
  • Determinism: Utdata är icke-deterministiska — använd parametern seed för mer konsekventa resultat
  • Kostnadsfria omgenereringar: Upp till 2 kostnadsfria omgenereringar per generering (samma innehåll, samma parametrar, endast i kontrollpanelen)
  • Äganderätt: Du behåller äganderätten till genererat ljud; kommersiell användning kräver ett betalabonnemang