Keyterm-Prompting

In diesem Leitfaden erfahren Sie, wie Sie Keyterm-Prompting mit der Speech-to-Text-API verwenden.

Anleitung · Setzt voraus, dass Sie den Speech to Text- Schnellstart abgeschlossen haben.

Überblick

Keyterm Prompting ist mit Scribe v2, Scribe v2 Medical (Batch) und Scribe v2 Realtime verfügbar und mit zusätzlichen Kosten verbunden. Detaillierte Preisinformationen finden Sie auf der API-Preisseite.

Keyterm Prompting ermöglicht es Ihnen, Wörter oder Ausdrücke hervorzuheben, damit das Modell diese bevorzugt transkribiert. Das ist nützlich für bestimmte Wörter oder Sätze, die in der Audiodatei nicht häufig vorkommen, etwa Produktnamen, Namen oder andere spezifische Begriffe. Keyterms sind leistungsfähiger als gewichtete Keywords oder benutzerdefinierte Vokabulare anderer Modelle, da sie den Kontext nutzen, um zu entscheiden, ob ein Begriff transkribiert werden soll.

Batch (Scribe v2 / Scribe v2 Medical)Echtzeit (Scribe v2 Realtime)
Maximale Anzahl Keyterms100050
Maximale Zeichen pro Keyterm5020

Wenn Ihr Unternehmensname beispielsweise kein gebräuchlicher Ausdruck ist oder eine besondere Schreibweise oder Aussprache hat, können Sie mit Keyterms sicherstellen, dass das Modell ihn korrekt transkribiert. Betrachten Sie die folgende Audiodatei:

Ohne Keyterm Prompting könnte das Modell den obigen Text wie folgt transkribieren:

I work at eleven labs.

Dabei wird der Unternehmensname falsch geschrieben. Mit Keyterm Prompting können Sie sicherstellen, dass das Modell den obigen Text mit der korrekten Schreibweise transkribiert:

I work at ElevenLabs.

Kontext

Das Modell kann den Kontext nutzen, um zu bestimmen, ob ein Begriff transkribiert werden soll. Wenn Sie den Keyterm „ElevenLabs“ angeben, wird die obige Audiodatei erwartungsgemäß transkribiert. Dennoch kann das Modell anhand des Kontexts auch Folgendes korrekt transkribieren:

Daraus ergibt sich folgende Transkription:

I've worked at many labs. In fact I've worked at eleven labs.

Batch-Transkription

Keyterm Prompting ist in die Batch-Speech-to-Text-API integriert. Übergeben Sie dazu den Parameter keyterms an die Methode convert.

import os
from dotenv import load_dotenv
from io import BytesIO
import requests
from elevenlabs.client import ElevenLabs
load_dotenv()
elevenlabs = ElevenLabs(
api_key=os.getenv("ELEVENLABS_API_KEY"),
)
audio_url = (
"https://storage.googleapis.com/eleven-public-cdn/documentation_assets/audio/stt-keyterm-prompting.mp3"
)
response = requests.get(audio_url)
audio_data = BytesIO(response.content)
transcription = elevenlabs.speech_to_text.convert(
file=audio_data,
model_id="scribe_v2", # Model to use
# Keyterms to prompt the model with.
# Up to 1000 keyterms can be provided, with a maximum length of 50 characters each
keyterms=["ElevenLabs"],
)
print(transcription)

Echtzeit-Streaming

Keyterm Prompting ist auch für die Echtzeit-Speech-to-Text-WebSocket-API verfügbar. Übergeben Sie beim Verbinden den Parameter keyterms.

connection = await elevenlabs.speech_to_text.realtime.connect(RealtimeUrlOptions(
model_id="scribe_v2_realtime",
keyterms=["ElevenLabs"],
))

Wenn Sie die WebSocket-API direkt verwenden, übergeben Sie Keyterms als Abfrageparameter:

wss://api.elevenlabs.io/v1/speech-to-text/realtime?model_id=scribe_v2_realtime&keyterms=ElevenLabs&keyterms=AnotherTerm

Nächste Schritte