Concevoir une voix.
Concevez une voix à partir d’un prompt. Cette méthode renvoie une liste d’aperçus de voix. Chaque aperçu comporte un generated_voice_id et un échantillon de la voix sous forme d’audio MP3 encodé en base64. Pour créer une voix, utilisez le generated_voice_id de l’aperçu choisi avec le point de terminaison /v1/text-to-voice.
En-têtes
Paramètres de requête
Requête
Description à utiliser pour la voix créée.
Modèle à utiliser pour la génération vocale. Valeurs possibles : eleven_multilingual_ttv_v2, eleven_ttv_v3.
Texte à générer, dont la longueur doit être comprise entre 100 et 1 000 caractères.
Indique s’il faut générer automatiquement un texte adapté à la description de la voix.
Contrôle le niveau de volume de la voix générée. -1 correspond au niveau le plus faible, 1 au niveau le plus élevé et 0 correspond approximativement à -24 LUFS.
Nombre aléatoire qui contrôle la génération de voix. La même graine avec les mêmes entrées produit la même voix.
Contrôle dans quelle mesure l’IA suit fidèlement le prompt. Des valeurs faibles donnent à l’IA davantage de liberté créative, tandis que des valeurs élevées l’obligent à suivre plus strictement le prompt. Des valeurs élevées peuvent donner à la voix un son artificiel ou robotique. Nous recommandons d’utiliser des prompts plus longs et détaillés avec une Guidance Scale plus faible.
Détermine si les aperçus Text to Voice doivent être inclus dans la réponse. Si cette valeur est true, seuls les ID générés sont renvoyés. Ils peuvent ensuite être diffusés via le point de terminaison /v1/text-to-voice/:generated_voice_id/stream.
Indique s’il faut enrichir la description de la voix à l’aide de l’IA afin d’ajouter des détails et d’améliorer la qualité de génération vocale. Lorsqu’il est activé, le système développe automatiquement les prompts simples en descriptions de voix plus détaillées. La valeur par défaut est False.
L’ID de l’itération de session de remixage à laquelle ces générations doivent être associées. S’il n’est pas fourni, une nouvelle itération sera créée.
Une qualité supérieure améliore le rendu vocal, mais réduit la variété.
Audio de référence à utiliser pour la génération de voix. L’audio doit être encodé en base64. Pris en charge uniquement avec le modèle eleven_ttv_v3.
Contrôle l’équilibre entre le prompt et l’audio de référence lors de la génération d’échantillons vocaux. 0 signifie que le prompt n’a presque aucune influence, 1 signifie que l’audio de référence n’a presque aucune influence. Pris en charge uniquement avec le modèle eleven_ttv_v3.
Réponse
Réponse réussie
Les aperçus des voix générées.
Le texte utilisé pour prévisualiser les voix.