Texte à dialogue en flux continu avec horodatages

Convertit une liste de paires texte et ID vocal en parole (dialogue) et renvoie un flux d’objets JSON contenant l’audio sous forme de chaîne encodée en base64 et des horodatages.

En-têtes

xi-api-keystringOptionnel

Paramètres de requête

output_formatenumOptionnel
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.
enable_loggingbooleanOptionnelPar défaut true

Lorsque enable_logging est défini sur false, le mode zéro rétention est utilisé pour la requête. Les fonctionnalités d’historique, y compris l’enchaînement des requêtes, ne sont alors pas disponibles pour cette requête. Le mode zéro rétention est réservé aux clients Enterprise.

Requête

This endpoint expects an object.
inputslist of objectsRequis

Liste d’entrées de dialogue, chacune contenant du texte et un ID de voix qui sera converti en parole. Le nombre maximal d’ID de voix uniques est de 10. Pour une génération fiable, maintenez le nombre total de caractères dans l’ensemble des valeurs inputs[].text à 2 000 caractères ou moins par requête. Les requêtes plus longues peuvent se terminer prématurément dans les réponses en streaming ou renvoyer une erreur de validation.

model_idstringOptionnelPar défaut eleven_v3

Identifiant du modèle à utiliser. Vous pouvez consulter les modèles avec GET /v1/models. Le modèle doit prendre en charge la synthèse vocale, ce que vous pouvez vérifier avec la propriété can_do_text_to_speech.

language_codestring or nullOptionnel

Code de langue (ISO 639-1) utilisé pour imposer une langue au modèle et à la normalisation du texte. Si le modèle ne prend pas en charge le code de langue fourni, celui-ci sera ignoré. Ce paramètre n’est pas pris en charge par les modèles multilingual_v2.

settingsobject or nullOptionnel

Paramètres contrôlant la génération de dialogues.

pronunciation_dictionary_locatorslist of objects or nullOptionnel

Liste des localisateurs de dictionnaires de prononciation (id, version_id) à appliquer au texte. Ils seront appliqués dans l’ordre. Vous pouvez inclure jusqu’à 3 localisateurs par requête.

seedinteger or nullOptionnel

Si spécifié, notre système fera de son mieux pour échantillonner de manière déterministe, afin que des requêtes répétées avec la même graine et les mêmes paramètres renvoient le même résultat. Le déterminisme n’est pas garanti. Doit être un entier compris entre 0 et 4294967295.

apply_text_normalizationenumOptionnelPar défaut auto

Ce paramètre contrôle la normalisation du texte selon trois modes : « auto », « on » et « off ». Lorsqu’il est défini sur « auto », le système décide automatiquement d’appliquer ou non la normalisation du texte, par exemple en écrivant les nombres en toutes lettres. Avec « on », la normalisation est toujours appliquée, tandis qu’avec « off », elle est ignorée.

Valeurs autorisées:
use_pvc_as_ivcbooleanOptionnelPar défaut false

Indique s’il faut utiliser la version IVC d’une voix professionnelle. Cela peut améliorer l’expressivité et réduire la latence.

previous_request_idslist of strings or nullOptionnel

Liste des request_ids des générations de dialogue précédant celle-ci. Utilisée pour conditionner le modèle afin d’assurer la continuité lorsqu’une tâche importante est divisée en plusieurs requêtes. Vous pouvez envoyer au maximum 3 request_ids. Le dernier request_id correspond à l’audio le plus proche de la requête actuelle. Cette fonctionnalité n’est pas prise en charge par tous les modèles.

next_request_idslist of strings or nullOptionnel

Liste des request_ids des générations de dialogue suivant celle-ci. Utile pour maintenir la continuité lors de la régénération d’un extrait au milieu d’une séquence. Vous pouvez envoyer au maximum 3 request_ids. Le premier request_id correspond à l’audio le plus proche de la requête actuelle. Cette fonctionnalité n’est pas prise en charge par tous les modèles.

previous_textstring or nullOptionnel<=100 characters

Le texte qui précède immédiatement cette génération, utilisé pour conditionner le modèle afin d’assurer la continuité prosodique. Un maximum de 100 caractères peut être envoyé. Cette fonctionnalité n’est pas prise en charge par tous les modèles.

future_textstring or nullOptionnel<=100 characters

Le texte qui suit immédiatement cette génération, utilisé pour conditionner le modèle afin d’assurer la continuité prosodique. Un maximum de 100 caractères peut être envoyé. Cette fonctionnalité n’est pas prise en charge par tous les modèles.

Réponse

Flux de segments de transcription
audio_base64string

Données audio encodées en base64

voice_segmentslist of objects

Segments vocaux de l’audio

alignmentobject or nullOptionnel

Informations d’horodatage pour chaque caractère du texte original

normalized_alignmentobject or nullOptionnel

Informations d’horodatage pour chaque caractère du texte normalisé

Erreurs

422
Unprocessable Entity Error