Guidage par termes clés
Guidage par termes clés
Ce guide explique comment utiliser le guidage par termes clés avec l’API Speech to Text.
Guide pratique · Suppose que vous avez suivi le guide de démarrage rapide de Speech to Text .
Vue d’ensemble
L’incitation par termes clés est disponible avec Scribe v2, Scribe v2 Medical (batch) et Scribe v2 Realtime, et entraîne un coût supplémentaire. Consultez la page de tarification de l’API pour obtenir des informations tarifaires détaillées.
L’incitation par termes clés est une fonctionnalité qui vous permet de mettre en évidence des mots ou des expressions afin d’orienter le modèle vers leur transcription. Elle est utile pour transcrire des mots ou des phrases spécifiques peu fréquents dans l’audio, comme des noms de produits, des noms propres ou d’autres termes précis. Les termes clés sont plus efficaces que les mots-clés orientés ou les vocabulaires personnalisés proposés par d’autres modèles, car le modèle s’appuie sur le contexte pour déterminer s’il doit transcrire ce terme ou non.
Par exemple, si le nom de votre entreprise n’est pas une expression courante ou possède une orthographe ou une prononciation particulière, vous pouvez utiliser des termes clés pour garantir une transcription correcte par le modèle. Prenons l’audio suivant :
Sans incitation par termes clés, le modèle pourrait transcrire ce qui précède ainsi :
Cette transcription utilise un style incorrect pour le nom de l’entreprise. Avec l’incitation par termes clés, vous pouvez vous assurer que le modèle transcrit ce qui précède avec l’orthographe et le style corrects :
Contexte
Le modèle peut utiliser le contexte pour déterminer si un terme doit être transcrit ou non. Lorsque vous fournissez le terme clé « ElevenLabs », l’audio ci-dessus est transcrit comme prévu, mais le modèle peut toujours transcrire correctement l’exemple suivant grâce au contexte :
La transcription obtenue est la suivante :
Transcription par lot
L’incitation par termes clés est intégrée à l’API Speech to Text par lot en transmettant le paramètre keyterms à la méthode convert.
Streaming en temps réel
L’incitation par termes clés est également disponible avec l’API WebSocket Speech to Text en temps réel. Transmettez le paramètre keyterms lors de la connexion.
Lorsque vous utilisez directement l’API WebSocket, transmettez les termes clés sous forme de paramètres de requête :