Modification de transcriptions
Ce guide explique comment modifier des transcriptions à l’aide d’instructions en langage naturel avec l’API Speech to Text.
Guide pratique · Suppose que vous avez suivi le guide de démarrage rapide de Speech to Text .
Vue d’ensemble
La modification de transcriptions est une fonctionnalité expérimentale qui entraîne un coût supplémentaire de 30 % par rapport au coût de base de la transcription. La facturation porte sur un minimum de 10 secondes d’audio par requête. Consultez la page des tarifs de l’API pour obtenir des informations détaillées sur les tarifs.
La modification de transcriptions vous permet d’ajouter une instruction en langage naturel à une requête de transcription. Une fois l’audio transcrit, votre instruction est appliquée à la transcription et le texte modifié est renvoyé avec l’original.
Elle remplace une étape distincte de post-traitement dans votre propre pipeline. Les utilisations courantes comprennent la normalisation de l’écriture des dates, heures ou unités, le développement d’abréviations, la suppression de contenu inutile, l’application d’un style ou d’un ton différent, ou le reformatage de la transcription.
Par exemple, transcrire un message vocal avec l’instruction Write all dates in ISO 8601 format (YYYY-MM-DD) renvoie les deux versions du texte :
Les champs text et words décrivent toujours la transcription originale. La version modifiée est renvoyée séparément dans edited_transcript.
Intégrer la modification de transcriptions
La modification de transcriptions s’intègre à l’API Speech to Text en transmettant le paramètre transcript_edit à la méthode convert. L’instruction peut contenir jusqu’à 2 000 caractères.
La modification de transcriptions fonctionne avec les requêtes synchrones comme avec les requêtes webhook. Pour les requêtes webhook, edited_transcript est inclus dans l’objet transcription de la charge utile du webhook.
Scribe v2 Realtime prend en charge les mêmes instructions pour chaque transcription validée. Consultez le guide de modification de transcription en temps réel.
Rédiger des instructions
L’instruction est appliquée à l’ensemble de la transcription partout où elle est pertinente, et chaque occurrence correspondante est modifiée, pas seulement la première. Une instruction peut modifier des mots ou expressions précis et laisser tout le reste intact, ou réécrire ou annoter l’intégralité du texte. Une seule instruction peut combiner plusieurs modifications.
Les exemples suivants illustrent l’éventail des instructions prises en charge :
Certains ajustements disposent de paramètres dédiés, moins coûteux et plus prévisibles qu’une instruction de
modification. Utilisez le prompting de termes clés
pour orienter la
reconnaissance vers des noms et termes précis, no_verbatim pour supprimer les mots de remplissage et les
disfluences, et numbers_format (lorsqu’il est pris en charge) pour choisir entre chiffres et mots. Réservez la
modification de transcriptions aux changements que ces options ne couvrent pas.
Gardez les points suivants à l’esprit lors de la rédaction d’instructions :
- Soyez explicite sur le résultat souhaité.
Write all dates in ISO 8601 format (YYYY-MM-DD)est plus fiable quefix the dates. - L’instruction peut être rédigée dans n’importe quelle langue, bien que les instructions en anglais donnent les meilleurs résultats. La transcription modifiée reste dans la langue de l’original.
- Seule l’instruction est exécutée. Le contenu prononcé dans l’audio est traité comme des données et ne peut pas modifier la manière dont l’instruction est appliquée.
- Si aucun élément de la transcription n’est concerné par l’instruction, la transcription modifiée est identique à l’originale.
Format de réponse
Lorsque transcript_edit est défini, la réponse contient un objet edited_transcript. Son champ kind indique si la modification a réussi :
Le champ est absent lorsqu’aucun transcript_edit n’a été demandé.
Comportements à connaître :
- La transcription modifiée est du texte brut. Les horodatages au niveau des mots, les étiquettes de locuteurs et
additional_formatscontinuent de décrire la transcription originale. - La modification s’exécute après la transcription, elle ajoute donc une latence qui augmente avec la longueur de la transcription.
- Le supplément est appliqué à la durée audio de la requête, avec un minimum de 10 secondes facturées par requête.
La modification de transcriptions ne peut pas être combinée avec entity_detection, entity_redaction ou
use_multi_channel. Les requêtes qui les combinent sont rejetées avec une erreur de paramètres non valides.