Diffuser la voix avec minutage

Convertit du texte en parole avec la voix de votre choix et renvoie un flux d’objets JSON contenant l’audio sous forme de chaîne encodée en base64 ainsi que des informations sur le moment où chaque caractère a été prononcé.

Paramètres de chemin

voice_idstringRequis

ID de la voix à utiliser. Utilisez le point de terminaison Obtenir les voix pour lister toutes les voix disponibles.

En-têtes

xi-api-keystringOptionnel

Paramètres de requête

enable_loggingbooleanOptionnelPar défaut true

Lorsque enable_logging est défini sur false, le mode zéro rétention est utilisé pour la requête. Les fonctionnalités d’historique, y compris l’enchaînement des requêtes, ne sont alors pas disponibles pour cette requête. Le mode zéro rétention est réservé aux clients Enterprise.

optimize_streaming_latencyinteger or nullOptionnelDeprecated
Vous pouvez activer des optimisations de latence au détriment de la qualité. La meilleure latence finale possible varie selon le modèle. Valeurs possibles : 0 - mode par défaut, sans optimisation de la latence 1 - optimisations de latence normales, environ 50 % de l’amélioration de latence possible avec l’option 3 2 - optimisations de latence importantes, environ 75 % de l’amélioration de latence possible avec l’option 3 3 - optimisations de latence maximales 4 - optimisations de latence maximales, avec en plus le normaliseur de texte désactivé pour réduire davantage la latence, meilleure latence, mais une mauvaise prononciation est possible, par exemple pour les nombres et les dates. La valeur par défaut est None.
output_formatenumOptionnelPar défaut mp3_44100_128
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Requête

This endpoint expects an object.
textstringRequis
Le texte qui sera converti en parole.
model_idstringOptionnelPar défaut eleven_multilingual_v2

Identifiant du modèle à utiliser. Vous pouvez consulter les modèles avec GET /v1/models. Le modèle doit prendre en charge la synthèse vocale, ce que vous pouvez vérifier avec la propriété can_do_text_to_speech.

language_codestring or nullOptionnel

Code de langue (ISO 639-1) utilisé pour imposer une langue au modèle et à la normalisation du texte. Si le modèle ne prend pas en charge le code de langue fourni, celui-ci sera ignoré. Ce paramètre n’est pas pris en charge par les modèles multilingual_v2.

voice_settingsobject or nullOptionnel

Paramètres vocaux remplaçant les paramètres enregistrés pour la voix donnée. Ils s’appliquent uniquement à la requête concernée.

pronunciation_dictionary_locatorslist of objects or nullOptionnel

Liste des localisateurs de dictionnaires de prononciation (id, version_id) à appliquer au texte. Ils seront appliqués dans l’ordre. Vous pouvez inclure jusqu’à 3 localisateurs par requête.

seedinteger or nullOptionnel

Si spécifié, notre système fera de son mieux pour échantillonner de manière déterministe, afin que des requêtes répétées avec la même graine et les mêmes paramètres renvoient le même résultat. Le déterminisme n’est pas garanti. Doit être un entier compris entre 0 et 4294967295.

previous_textstring or nullOptionnel

Le texte qui précède celui de la requête actuelle. Peut être utilisé pour améliorer la continuité de la parole lors de la concaténation de plusieurs générations ou pour influencer la continuité de la parole dans la génération actuelle.

next_textstring or nullOptionnel

Le texte qui suit celui de la requête actuelle. Peut être utilisé pour améliorer la continuité de la parole lors de la concaténation de plusieurs générations ou pour influencer la continuité de la parole dans la génération actuelle.

previous_request_idslist of strings or nullOptionnel

Liste des request_id des échantillons générés avant cette génération. Peut être utilisée pour améliorer la continuité de la parole lorsqu’une tâche importante est divisée en plusieurs requêtes. Les résultats seront meilleurs si le même modèle est utilisé pour toutes les générations. Si previous_text et previous_request_ids sont tous deux envoyés, previous_text sera ignoré. Vous pouvez envoyer au maximum 3 request_ids.

next_request_idslist of strings or nullOptionnel

Liste des request_id des échantillons suivant cette génération. next_request_ids est particulièrement utile pour préserver la continuité de la parole lors de la régénération d’un échantillon présentant des problèmes de qualité audio. Par exemple, si vous avez généré 3 extraits vocaux et souhaitez améliorer l’extrait 2, transmettre l’identifiant de requête de l’extrait 3 comme next_request_id, ainsi que celui de l’extrait 1 comme previous_request_id, aidera à préserver un flux naturel dans la parole combinée. Les résultats seront meilleurs si le même modèle est utilisé pour toutes les générations. Si next_text et next_request_ids sont tous deux envoyés, next_text sera ignoré. Vous pouvez envoyer au maximum 3 request_ids.

use_pvc_as_ivcbooleanOptionnelPar défaut false

Indique s’il faut utiliser la version IVC d’une voix professionnelle. Cela peut améliorer l’expressivité et réduire la latence.

apply_text_normalizationenumOptionnelPar défaut auto

Ce paramètre contrôle la normalisation du texte selon trois modes : « auto », « on » et « off ». Lorsqu’il est défini sur « auto », le système décide automatiquement d’appliquer ou non la normalisation du texte, par exemple en écrivant les nombres en toutes lettres. Avec « on », la normalisation est toujours appliquée, tandis qu’avec « off », elle est ignorée.

Valeurs autorisées:
apply_language_text_normalizationbooleanOptionnelPar défaut false

Ce paramètre contrôle la normalisation linguistique du texte. Il améliore la prononciation du texte dans certaines langues prises en charge. AVERTISSEMENT : ce paramètre peut considérablement augmenter la latence de la requête. Actuellement pris en charge uniquement pour le japonais.

Réponse

Flux de segments de transcription
audio_base64string

Données audio encodées en base64

alignmentobject or nullOptionnel

Informations d’horodatage pour chaque caractère du texte original

normalized_alignmentobject or nullOptionnel

Informations d’horodatage pour chaque caractère du texte normalisé

Erreurs

422
Unprocessable Entity Error