Remixa en röst.
Remixa en befintlig röst via en prompt. Den här metoden returnerar en lista med röstförhandsvisningar. Varje förhandsvisning har ett generated_voice_id och ett röstprov som base64-kodad mp3-ljudfil. Skapa en röst genom att använda generated_voice_id från den önskade förhandsvisningen med slutpunkten /v1/text-to-voice.
Sökvägsparametrar
Röst-ID som ska användas. Du kan använda https://api.elevenlabs.io/v1/voices för att lista alla tillgängliga röster.
Headers
Frågeparametrar
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.
Förfrågan
Beskrivning av ändringarna som ska göras i rösten.
Text att generera, textlängden måste vara mellan 100 och 1 000.
Om en text som passar röstbeskrivningen ska genereras automatiskt.
Styr volymnivån för den genererade rösten. -1 är tystast, 1 är högst och 0 motsvarar ungefär -24 LUFS.
Slumptal som styr röstgenereringen. Samma seed med samma indata ger samma röst.
Styr hur nära AI:n följer prompten. Lägre värden ger AI:n större kreativ frihet, medan högre värden får den att följa prompten mer strikt. Höga värden kan få rösten att låta konstgjord eller robotlik. Vi rekommenderar längre och mer detaljerade prompter vid lägre Guidance Scale.
Avgör om Text to Voice-förhandsvisningarna ska inkluderas i svaret. Om värdet är true returneras endast de genererade ID:na, som sedan kan streamas via slutpunkten /v1/text-to-voice/:generated_voice_id/stream.
ID:t för iterationen i remixningssessionen som dessa genereringar ska kopplas till. Om det inte anges skapas en ny iteration.
Styr balansen mellan prompt och referensljud när röstprover genereras. 0 innebär nästan ingen påverkan från prompten, 1 innebär nästan ingen påverkan från referensljudet. Stöds endast med modellen eleven_ttv_v3.
Svar
Förhandsvisningarna av de genererade rösterna.
Texten som används för att förhandsgranska rösterna.