Remixar uma voz.

Remixe uma voz existente por meio de um prompt. Este método retorna uma lista de prévias de voz. Cada prévia tem um generated_voice_id e uma amostra da voz como áudio mp3 codificado em base64. Para criar uma voz, use o generated_voice_id da prévia escolhida com o endpoint /v1/text-to-voice.

Parâmetros de caminho

voice_idstringObrigatório
ID de voz a ser usado. Você pode usar https://api.elevenlabs.io/v1/voices para listar todas as vozes disponíveis.

Cabeçalhos

xi-api-keystringOpcional

Parâmetros de consulta

output_formatenumOpcional
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Solicitação

This endpoint expects an object.
voice_descriptionstringObrigatório5-1000 characters

Descrição das alterações a serem feitas na voz.

textstring or nullOpcional100-1000 characters

Texto a gerar; o comprimento deve estar entre 100 e 1000.

auto_generate_textbooleanOpcionalPadrão é false

Indica se deve gerar automaticamente um texto adequado para a descrição da voz.

loudnessdoubleOpcional-1-1Padrão é 0.5

Controla o nível de volume da voz gerada. -1 é o mais baixo, 1 é o mais alto e 0 corresponde a aproximadamente -24 LUFS.

seedinteger or nullOpcional0-2147483647

Número aleatório que controla a geração de voz. A mesma seed com as mesmas entradas produz a mesma voz.

guidance_scaledoubleOpcional0-100Padrão é 2

Controla o quanto a IA segue o prompt de perto. Valores menores dão à IA mais liberdade criativa, enquanto valores maiores a fazem seguir mais o prompt. Valores altos podem fazer a voz soar artificial ou robótica. Recomendamos usar prompts mais longos e detalhados com uma Guidance Scale menor.

stream_previewsbooleanOpcionalPadrão é false

Determina se as prévias do Text to Voice devem ser incluídas na resposta. Se for true, apenas os IDs gerados serão retornados e poderão ser transmitidos pelo endpoint /v1/text-to-voice/:generated_voice_id/stream.

remixing_session_idstring or nullOpcional

O ID da sessão de remixagem.

remixing_session_iteration_idstring or nullOpcional

O ID da iteração da sessão de remixagem à qual estas gerações devem ser anexadas. Se não for fornecido, uma nova iteração será criada.

prompt_strengthdouble or nullOpcional0-1

Controla o equilíbrio entre o prompt e o áudio de referência ao gerar amostras de voz. 0 significa quase nenhuma influência do prompt; 1 significa quase nenhuma influência do áudio de referência. Compatível apenas com o modelo eleven_ttv_v3.

Resposta

Resposta bem-sucedida

previewslist of objects

As prévias das vozes geradas.

textstring
O texto usado para visualizar as vozes.

Erros

409
Conflict Error
422
Unprocessable Entity Error