Concevoir une voix.

Concevez une voix à partir d’un prompt. Cette méthode renvoie une liste d’aperçus de voix. Chaque aperçu comporte un generated_voice_id et un échantillon de la voix sous forme d’audio MP3 encodé en base64. Pour créer une voix, utilisez le generated_voice_id de l’aperçu choisi avec le point de terminaison /v1/text-to-voice.

En-têtes

xi-api-keystringOptionnel

Paramètres de requête

output_formatenumOptionnel
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Requête

This endpoint expects an object.
voice_descriptionstringRequis20-1000 characters

Description à utiliser pour la voix créée.

model_idenumOptionnelPar défaut eleven_multilingual_ttv_v2

Modèle à utiliser pour la génération vocale. Valeurs possibles : eleven_multilingual_ttv_v2, eleven_ttv_v3.

Valeurs autorisées:
textstring or nullOptionnel100-1000 characters

Texte à générer, dont la longueur doit être comprise entre 100 et 1 000 caractères.

auto_generate_textbooleanOptionnelPar défaut false

Indique s’il faut générer automatiquement un texte adapté à la description de la voix.

loudnessdoubleOptionnel-1-1Par défaut 0.5

Contrôle le niveau de volume de la voix générée. -1 correspond au niveau le plus faible, 1 au niveau le plus élevé et 0 correspond approximativement à -24 LUFS.

seedinteger or nullOptionnel0-2147483647

Nombre aléatoire qui contrôle la génération de voix. La même graine avec les mêmes entrées produit la même voix.

guidance_scaledoubleOptionnel0-100Par défaut 5

Contrôle dans quelle mesure l’IA suit fidèlement le prompt. Des valeurs faibles donnent à l’IA davantage de liberté créative, tandis que des valeurs élevées l’obligent à suivre plus strictement le prompt. Des valeurs élevées peuvent donner à la voix un son artificiel ou robotique. Nous recommandons d’utiliser des prompts plus longs et détaillés avec une Guidance Scale plus faible.

stream_previewsbooleanOptionnelPar défaut false

Détermine si les aperçus Text to Voice doivent être inclus dans la réponse. Si cette valeur est true, seuls les ID générés sont renvoyés. Ils peuvent ensuite être diffusés via le point de terminaison /v1/text-to-voice/:generated_voice_id/stream.

should_enhancebooleanOptionnelPar défaut false

Indique s’il faut enrichir la description de la voix à l’aide de l’IA afin d’ajouter des détails et d’améliorer la qualité de génération vocale. Lorsqu’il est activé, le système développe automatiquement les prompts simples en descriptions de voix plus détaillées. La valeur par défaut est False.

remixing_session_idstring or nullOptionnel
L'ID de session de remixage.
remixing_session_iteration_idstring or nullOptionnel

L’ID de l’itération de session de remixage à laquelle ces générations doivent être associées. S’il n’est pas fourni, une nouvelle itération sera créée.

qualitydouble or nullOptionnel-1-1

Une qualité supérieure améliore le rendu vocal, mais réduit la variété.

reference_audio_base64string or nullOptionnel

Audio de référence à utiliser pour la génération de voix. L’audio doit être encodé en base64. Pris en charge uniquement avec le modèle eleven_ttv_v3.

prompt_strengthdouble or nullOptionnel0-1

Contrôle l’équilibre entre le prompt et l’audio de référence lors de la génération d’échantillons vocaux. 0 signifie que le prompt n’a presque aucune influence, 1 signifie que l’audio de référence n’a presque aucune influence. Pris en charge uniquement avec le modèle eleven_ttv_v3.

Réponse

Réponse réussie

previewslist of objects

Les aperçus des voix générées.

textstring

Le texte utilisé pour prévisualiser les voix.

Erreurs

409
Conflict Error
422
Unprocessable Entity Error