कीटर्म प्रॉम्प्टिंग

यह गाइड दिखाती है कि स्पीच टू टेक्स्ट API के साथ कीटर्म प्रॉम्प्टिंग का इस्तेमाल कैसे करें।

कैसे करें गाइड · मान लिया गया है कि आपने स्पीच टू टेक्स्ट क्विकस्टार्ट पूरा कर लिया है।

ओवरव्यू

कीटर्म प्रॉम्प्टिंग Scribe v2, Scribe v2 Medical (बैच), और Scribe v2 Realtime के साथ उपलब्ध है और इसके लिए अतिरिक्त शुल्क लगता है। कीमत की विस्तृत जानकारी के लिए API प्राइसिंग पेज देखें।

कीटर्म प्रॉम्प्टिंग एक सुविधा है, जिससे आप शब्दों या वाक्यांशों को हाइलाइट करके मॉडल को उन्हें ट्रांसक्राइब करने के लिए प्रेरित कर सकते हैं। यह ऑडियो में कम आने वाले खास शब्दों या वाक्यों, जैसे प्रोडक्ट नाम, नामों या अन्य विशेष शब्दों को ट्रांसक्राइब करने के लिए उपयोगी है। कीटर्म, दूसरे मॉडलों के बायस्ड कीवर्ड या कस्टमर वोकैबुलरी से अधिक प्रभावी होते हैं, क्योंकि मॉडल संदर्भ के आधार पर तय करता है कि उस शब्द को ट्रांसक्राइब करना है या नहीं।

बैच (Scribe v2 / Scribe v2 Medical)रियलटाइम (Scribe v2 Realtime)
अधिकतम कीटर्म100050
प्रति कीटर्म अधिकतम वर्ण5020

उदाहरण के लिए, अगर आपकी कंपनी का नाम आम वाक्यांश नहीं है या उसकी स्पेलिंग या उच्चारण अलग है, तो मॉडल से सही ट्रांसक्रिप्शन पाने के लिए आप कीटर्म इस्तेमाल कर सकते हैं। यह ऑडियो देखें:

कीटर्म प्रॉम्प्टिंग के बिना, मॉडल ऊपर दिए गए ऑडियो को इस तरह ट्रांसक्राइब कर सकता है:

I work at eleven labs.

जिसमें कंपनी नाम का स्टाइल गलत है। कीटर्म प्रॉम्प्टिंग के साथ, आप यह सुनिश्चित कर सकते हैं कि मॉडल ऊपर दिए गए ऑडियो को सही स्पेलिंग और स्टाइल के साथ ट्रांसक्राइब करे:

I work at ElevenLabs.

संदर्भ

मॉडल संदर्भ का इस्तेमाल करके तय कर सकता है कि किसी शब्द को ट्रांसक्राइब करना है या नहीं। ElevenLabs कीटर्म देने पर, ऊपर दिए गए ऑडियो का ट्रांसक्रिप्शन अपेक्षा के अनुसार होता है, फिर भी मॉडल संदर्भ के आधार पर नीचे दिए गए ऑडियो को सही ढंग से ट्रांसक्राइब कर सकता है:

जिसका ट्रांसक्रिप्शन यह होता है:

I've worked at many labs. In fact I've worked at eleven labs.

बैच ट्रांसक्रिप्शन

कीटर्म प्रॉम्प्टिंग को बैच स्पीच टू टेक्स्ट API में convert मेथड के लिए keyterms पैरामीटर देकर इंटीग्रेट किया जाता है।

import os
from dotenv import load_dotenv
from io import BytesIO
import requests
from elevenlabs.client import ElevenLabs
load_dotenv()
elevenlabs = ElevenLabs(
api_key=os.getenv("ELEVENLABS_API_KEY"),
)
audio_url = (
"https://storage.googleapis.com/eleven-public-cdn/documentation_assets/audio/stt-keyterm-prompting.mp3"
)
response = requests.get(audio_url)
audio_data = BytesIO(response.content)
transcription = elevenlabs.speech_to_text.convert(
file=audio_data,
model_id="scribe_v2", # Model to use
# Keyterms to prompt the model with.
# Up to 1000 keyterms can be provided, with a maximum length of 50 characters each
keyterms=["ElevenLabs"],
)
print(transcription)

रियलटाइम स्ट्रीमिंग

कीटर्म प्रॉम्प्टिंग रियलटाइम स्पीच टू टेक्स्ट WebSocket API के लिए भी उपलब्ध है। कनेक्ट करते समय keyterms पैरामीटर पास करें।

connection = await elevenlabs.speech_to_text.realtime.connect(RealtimeUrlOptions(
model_id="scribe_v2_realtime",
keyterms=["ElevenLabs"],
))

WebSocket API को सीधे इस्तेमाल करते समय, कीटर्म को क्वेरी पैरामीटर के रूप में पास करें:

wss://api.elevenlabs.io/v1/speech-to-text/realtime?model_id=scribe_v2_realtime&keyterms=ElevenLabs&keyterms=AnotherTerm

अगले चरण