Texte à dialogue en flux continu avec horodatages
Texte à dialogue en flux continu avec horodatages
Convertit une liste de paires texte et ID vocal en parole (dialogue) et renvoie un flux d’objets JSON contenant l’audio sous forme de chaîne encodée en base64 et des horodatages.
En-têtes
Paramètres de requête
Lorsque enable_logging est défini sur false, le mode zéro rétention est utilisé pour la requête. Les fonctionnalités d’historique, y compris l’enchaînement des requêtes, ne sont alors pas disponibles pour cette requête. Le mode zéro rétention est réservé aux clients Enterprise.
Requête
Liste d’entrées de dialogue, chacune contenant du texte et un ID de voix qui sera converti en parole. Le nombre maximal d’ID de voix uniques est de 10. Pour une génération fiable, maintenez le nombre total de caractères dans l’ensemble des valeurs inputs[].text à 2 000 caractères ou moins par requête. Les requêtes plus longues peuvent se terminer prématurément dans les réponses en streaming ou renvoyer une erreur de validation.
Identifiant du modèle à utiliser. Vous pouvez consulter les modèles avec GET /v1/models. Le modèle doit prendre en charge la synthèse vocale, ce que vous pouvez vérifier avec la propriété can_do_text_to_speech.
Code de langue (ISO 639-1) utilisé pour imposer une langue au modèle et à la normalisation du texte. Si le modèle ne prend pas en charge le code de langue fourni, celui-ci sera ignoré. Ce paramètre n’est pas pris en charge par les modèles multilingual_v2.
Paramètres contrôlant la génération de dialogues.
Liste des localisateurs de dictionnaires de prononciation (id, version_id) à appliquer au texte. Ils seront appliqués dans l’ordre. Vous pouvez inclure jusqu’à 3 localisateurs par requête.
Si spécifié, notre système fera de son mieux pour échantillonner de manière déterministe, afin que des requêtes répétées avec la même graine et les mêmes paramètres renvoient le même résultat. Le déterminisme n’est pas garanti. Doit être un entier compris entre 0 et 4294967295.
Ce paramètre contrôle la normalisation du texte selon trois modes : « auto », « on » et « off ». Lorsqu’il est défini sur « auto », le système décide automatiquement d’appliquer ou non la normalisation du texte, par exemple en écrivant les nombres en toutes lettres. Avec « on », la normalisation est toujours appliquée, tandis qu’avec « off », elle est ignorée.
Indique s’il faut utiliser la version IVC d’une voix professionnelle. Cela peut améliorer l’expressivité et réduire la latence.
Liste des request_ids des générations de dialogue précédant celle-ci. Utilisée pour conditionner le modèle afin d’assurer la continuité lorsqu’une tâche importante est divisée en plusieurs requêtes. Vous pouvez envoyer au maximum 3 request_ids. Le dernier request_id correspond à l’audio le plus proche de la requête actuelle. Cette fonctionnalité n’est pas prise en charge par tous les modèles.
Liste des request_ids des générations de dialogue suivant celle-ci. Utile pour maintenir la continuité lors de la régénération d’un extrait au milieu d’une séquence. Vous pouvez envoyer au maximum 3 request_ids. Le premier request_id correspond à l’audio le plus proche de la requête actuelle. Cette fonctionnalité n’est pas prise en charge par tous les modèles.
Le texte qui précède immédiatement cette génération, utilisé pour conditionner le modèle afin d’assurer la continuité prosodique. Un maximum de 100 caractères peut être envoyé. Cette fonctionnalité n’est pas prise en charge par tous les modèles.
Le texte qui suit immédiatement cette génération, utilisé pour conditionner le modèle afin d’assurer la continuité prosodique. Un maximum de 100 caractères peut être envoyé. Cette fonctionnalité n’est pas prise en charge par tous les modèles.
Réponse
Données audio encodées en base64
Segments vocaux de l’audio
Informations d’horodatage pour chaque caractère du texte original
Informations d’horodatage pour chaque caractère du texte normalisé