Voice Changer

Transformez un audio d’une voix à une autre. Gardez un contrôle total sur l’émotion, le rythme et l’interprétation.

Paramètres de chemin

voice_idstringRequis

ID de la voix à utiliser. Utilisez le point de terminaison Obtenir les voix pour lister toutes les voix disponibles.

En-têtes

xi-api-keystringOptionnel

Paramètres de requête

enable_loggingbooleanOptionnelPar défaut true

Lorsque enable_logging est défini sur false, le mode zéro rétention est utilisé pour la requête. Les fonctionnalités d’historique, y compris l’enchaînement des requêtes, ne sont alors pas disponibles pour cette requête. Le mode zéro rétention est réservé aux clients Enterprise.

optimize_streaming_latencyinteger or nullOptionnelDeprecated
Vous pouvez activer des optimisations de latence au détriment de la qualité. La meilleure latence finale possible varie selon le modèle. Valeurs possibles : 0 - mode par défaut, sans optimisation de la latence 1 - optimisations de latence normales, environ 50 % de l’amélioration de latence possible avec l’option 3 2 - optimisations de latence importantes, environ 75 % de l’amélioration de latence possible avec l’option 3 3 - optimisations de latence maximales 4 - optimisations de latence maximales, avec en plus le normaliseur de texte désactivé pour réduire davantage la latence, meilleure latence, mais une mauvaise prononciation est possible, par exemple pour les nombres et les dates. La valeur par défaut est None.
output_formatenumOptionnelPar défaut mp3_44100_128
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM and WAV formats with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Requête

This endpoint expects a multipart form containing a file.
audiofileRequis

Fichier audio contenant le contenu et l’émotion qui contrôleront la parole générée.

model_idstringOptionnelPar défaut eleven_english_sts_v2

Identifiant du modèle à utiliser. Vous pouvez consulter les modèles avec GET /v1/models. Le modèle doit prendre en charge la conversion de parole à parole, ce que vous pouvez vérifier avec la propriété can_do_voice_conversion.

voice_settingsstring or nullOptionnel

Paramètres vocaux remplaçant les paramètres enregistrés pour la voix donnée. Ils s’appliquent uniquement à la requête concernée. Doivent être envoyés sous forme de chaîne encodée en JSON.

seedinteger or nullOptionnel

Si spécifié, notre système fera de son mieux pour échantillonner de manière déterministe, afin que des requêtes répétées avec la même graine et les mêmes paramètres renvoient le même résultat. Le déterminisme n’est pas garanti. Doit être un entier compris entre 0 et 4294967295.

remove_background_noisebooleanOptionnelPar défaut false

Si défini, supprimera le bruit de fond de votre entrée audio à l’aide de notre modèle d’isolation audio. S’applique uniquement à Voice Changer.

file_formatenum or nullOptionnelPar défaut other

The format of input audio. Options are ‘pcm_s16le_16’ or ‘other’ For pcm_s16le_16, the input audio must be 16-bit PCM at a 16kHz sample rate, single channel (mono), and little-endian byte order. Latency will be lower than with passing an encoded waveform.

Valeurs autorisées:

Réponse

Le fichier audio généré

Erreurs

422
Unprocessable Entity Error