Guidage par termes clés

Ce guide explique comment utiliser le guidage par termes clés avec l’API Speech to Text.

Guide pratique · Suppose que vous avez suivi le guide de démarrage rapide de Speech to Text .

Vue d’ensemble

L’incitation par termes clés est disponible avec Scribe v2, Scribe v2 Medical (batch) et Scribe v2 Realtime, et entraîne un coût supplémentaire. Consultez la page de tarification de l’API pour obtenir des informations tarifaires détaillées.

L’incitation par termes clés est une fonctionnalité qui vous permet de mettre en évidence des mots ou des expressions afin d’orienter le modèle vers leur transcription. Elle est utile pour transcrire des mots ou des phrases spécifiques peu fréquents dans l’audio, comme des noms de produits, des noms propres ou d’autres termes précis. Les termes clés sont plus efficaces que les mots-clés orientés ou les vocabulaires personnalisés proposés par d’autres modèles, car le modèle s’appuie sur le contexte pour déterminer s’il doit transcrire ce terme ou non.

Batch (Scribe v2 / Scribe v2 Medical)Temps réel (Scribe v2 Realtime)
Nombre maximal de termes clés100050
Nombre maximal de caractères par terme clé5020

Par exemple, si le nom de votre entreprise n’est pas une expression courante ou possède une orthographe ou une prononciation particulière, vous pouvez utiliser des termes clés pour garantir une transcription correcte par le modèle. Prenons l’audio suivant :

Sans incitation par termes clés, le modèle pourrait transcrire ce qui précède ainsi :

I work at eleven labs.

Cette transcription utilise un style incorrect pour le nom de l’entreprise. Avec l’incitation par termes clés, vous pouvez vous assurer que le modèle transcrit ce qui précède avec l’orthographe et le style corrects :

I work at ElevenLabs.

Contexte

Le modèle peut utiliser le contexte pour déterminer si un terme doit être transcrit ou non. Lorsque vous fournissez le terme clé « ElevenLabs », l’audio ci-dessus est transcrit comme prévu, mais le modèle peut toujours transcrire correctement l’exemple suivant grâce au contexte :

La transcription obtenue est la suivante :

I've worked at many labs. In fact I've worked at eleven labs.

Transcription par lot

L’incitation par termes clés est intégrée à l’API Speech to Text par lot en transmettant le paramètre keyterms à la méthode convert.

import os
from dotenv import load_dotenv
from io import BytesIO
import requests
from elevenlabs.client import ElevenLabs
load_dotenv()
elevenlabs = ElevenLabs(
api_key=os.getenv("ELEVENLABS_API_KEY"),
)
audio_url = (
"https://storage.googleapis.com/eleven-public-cdn/documentation_assets/audio/stt-keyterm-prompting.mp3"
)
response = requests.get(audio_url)
audio_data = BytesIO(response.content)
transcription = elevenlabs.speech_to_text.convert(
file=audio_data,
model_id="scribe_v2", # Model to use
# Keyterms to prompt the model with.
# Up to 1000 keyterms can be provided, with a maximum length of 50 characters each
keyterms=["ElevenLabs"],
)
print(transcription)

Streaming en temps réel

L’incitation par termes clés est également disponible avec l’API WebSocket Speech to Text en temps réel. Transmettez le paramètre keyterms lors de la connexion.

connection = await elevenlabs.speech_to_text.realtime.connect(RealtimeUrlOptions(
model_id="scribe_v2_realtime",
keyterms=["ElevenLabs"],
))

Lorsque vous utilisez directement l’API WebSocket, transmettez les termes clés sous forme de paramètres de requête :

wss://api.elevenlabs.io/v1/speech-to-text/realtime?model_id=scribe_v2_realtime&keyterms=ElevenLabs&keyterms=AnotherTerm

Étapes suivantes