Criar uma voz.

Crie uma voz por meio de um prompt. Este método retorna uma lista de prévias de voz. Cada prévia tem um generated_voice_id e uma amostra da voz como áudio mp3 codificado em base64. Para criar uma voz, use o generated_voice_id da prévia escolhida com o endpoint /v1/text-to-voice.

Cabeçalhos

xi-api-keystringOpcional

Parâmetros de consulta

output_formatenumOpcional
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Solicitação

This endpoint expects an object.
voice_descriptionstringObrigatório20-1000 characters

Descrição a ser usada para a voz criada.

model_idenumOpcionalPadrão é eleven_multilingual_ttv_v2

Modelo a ser usado para a geração de voz. Valores possíveis: eleven_multilingual_ttv_v2, eleven_ttv_v3.

Valores permitidos:
textstring or nullOpcional100-1000 characters

Texto a gerar; o comprimento deve estar entre 100 e 1000.

auto_generate_textbooleanOpcionalPadrão é false

Indica se deve gerar automaticamente um texto adequado para a descrição da voz.

loudnessdoubleOpcional-1-1Padrão é 0.5

Controla o nível de volume da voz gerada. -1 é o mais baixo, 1 é o mais alto e 0 corresponde a aproximadamente -24 LUFS.

seedinteger or nullOpcional0-2147483647

Número aleatório que controla a geração de voz. A mesma seed com as mesmas entradas produz a mesma voz.

guidance_scaledoubleOpcional0-100Padrão é 5

Controla o quanto a IA segue o prompt de perto. Valores menores dão à IA mais liberdade criativa, enquanto valores maiores a fazem seguir mais o prompt. Valores altos podem fazer a voz soar artificial ou robótica. Recomendamos usar prompts mais longos e detalhados com uma Guidance Scale menor.

stream_previewsbooleanOpcionalPadrão é false

Determina se as prévias do Text to Voice devem ser incluídas na resposta. Se for true, apenas os IDs gerados serão retornados e poderão ser transmitidos pelo endpoint /v1/text-to-voice/:generated_voice_id/stream.

should_enhancebooleanOpcionalPadrão é false

Indica se deve aprimorar a descrição da voz usando IA para adicionar mais detalhes e melhorar a qualidade da geração de voz. Quando ativado, o sistema expandirá automaticamente prompts simples em descrições de voz mais detalhadas. O padrão é False.

remixing_session_idstring or nullOpcional

O ID da sessão de remixagem.

remixing_session_iteration_idstring or nullOpcional

O ID da iteração da sessão de remixagem à qual estas gerações devem ser anexadas. Se não for fornecido, uma nova iteração será criada.

qualitydouble or nullOpcional-1-1
Uma qualidade mais alta resulta em uma voz melhor, mas com menos variedade.
reference_audio_base64string or nullOpcional

Áudio de referência a ser usado para a geração de voz. O áudio deve ser codificado em base64. Compatível apenas com o modelo eleven_ttv_v3.

prompt_strengthdouble or nullOpcional0-1

Controla o equilíbrio entre o prompt e o áudio de referência ao gerar amostras de voz. 0 significa quase nenhuma influência do prompt; 1 significa quase nenhuma influência do áudio de referência. Compatível apenas com o modelo eleven_ttv_v3.

Resposta

Resposta bem-sucedida

previewslist of objects

As prévias das vozes geradas.

textstring
O texto usado para visualizar as vozes.

Erros

409
Conflict Error
422
Unprocessable Entity Error