स्पीच टू टेक्स्ट क्विकस्टार्ट

बोले गए ऑडियो को टेक्स्ट में बदलना सीखें।

यह गाइड आपको स्पीच टू टेक्स्ट API का इस्तेमाल करके बोले गए ऑडियो को टेक्स्ट में बदलना दिखाएगी।

अपने AI कोडिंग असिस्टेंट से ऑडियो ट्रांसक्राइब करने के लिए ElevenLabs स्पीच-टू-टेक्स्ट स्किल इस्तेमाल करें:

npx skills add elevenlabs/skills --skill speech-to-text

यह ट्यूटोरियल बैच स्पीच टू टेक्स्ट API का इस्तेमाल दिखाएगा। रीयलटाइम स्पीच टू टेक्स्ट API इस्तेमाल करने की गाइड के लिए क्लाइंट-साइड स्ट्रीमिंग या सर्वर-साइड स्ट्रीमिंग गाइड देखें।

स्पीच टू टेक्स्ट API का इस्तेमाल

1

API कुंजी बनाएं

डैशबोर्ड में यहां API key बनाएं, जिसका इस्तेमाल आप API एक्सेस करने के लिए सुरक्षित रूप से करेंगे।

key को मैनेज्ड सीक्रेट के रूप में स्टोर करें और अपनी पसंद के अनुसार इसे SDKs को .env फ़ाइल के ज़रिए एनवायरनमेंट वेरिएबल के रूप में या सीधे अपने ऐप के कॉन्फ़िगरेशन में पास करें।

.env
ELEVENLABS_API_KEY=<your_api_key_here>
2

SDK इंस्टॉल करें

हम अपने API key को environment variable से लोड करने के लिए dotenv library का भी इस्तेमाल करेंगे।

pip install elevenlabs
pip install python-dotenv
3

API अनुरोध करें

अपनी चुनी हुई भाषा के अनुसार example.py या example.mts नाम की नई फ़ाइल बनाएं और इसमें यह कोड जोड़ें:

# example.py
import os
from dotenv import load_dotenv
from io import BytesIO
import requests
from elevenlabs.client import ElevenLabs
load_dotenv()
elevenlabs = ElevenLabs(
api_key=os.getenv("ELEVENLABS_API_KEY"),
)
audio_url = (
"https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
)
response = requests.get(audio_url)
audio_data = BytesIO(response.content)
transcription = elevenlabs.speech_to_text.convert(
file=audio_data,
model_id="scribe_v2", # Model to use
tag_audio_events=True, # Tag audio events like laughter, applause, etc.
language_code="eng", # Language of the audio file. If set to None, the model will detect the language automatically.
diarize=True, # Whether to annotate who is speaking
)
print(transcription)

फिर इसे चलाएं:

python example.py

आपको कंसोल में ऑडियो फ़ाइल का ट्रांसक्रिप्शन प्रिंट हुआ दिखेगा।

मेडिकल और क्लिनिकल ऑडियो के लिए model_id को scribe_v2_medical पर सेट करें। अनुरोध का स्वरूप scribe_v2 जैसा ही है और बिलिंग दर भी वही है। Scribe v2 Medical देखें।

अगले चरण