Speech to Text-Schnellstart

Erfahren Sie, wie Sie gesprochene Audiodaten in Text umwandeln.

Diese Anleitung zeigt Ihnen, wie Sie gesprochene Audiodaten mit der Speech to Text API in Text umwandeln.

Verwenden Sie den ElevenLabs-Speech-to-Text-Skill, um Audio mit Ihrem KI-Coding-Assistenten zu transkribieren:

npx skills add elevenlabs/skills --skill speech-to-text

Dieses Tutorial zeigt die Verwendung der Batch Speech to Text API. Eine Anleitung zur Verwendung der Echtzeit-Spracherkennung finden Sie in den Anleitungen zum clientseitigen Streaming oder serverseitigen Streaming.

Speech to Text API verwenden

1

API-Key erstellen

Erstellen Sie hier im Dashboard einen API-Schlüssel, den Sie für den sicheren Zugriff auf die API verwenden.

Speichern Sie den Schlüssel als verwaltetes Secret und übergeben Sie ihn je nach Präferenz an die SDKs entweder als Umgebungsvariable über eine .env-Datei oder direkt in der Konfiguration Ihrer App.

.env
ELEVENLABS_API_KEY=<your_api_key_here>
2

SDK installieren

Wir verwenden außerdem die Bibliothek dotenv, um unseren API-Schlüssel aus einer Umgebungsvariable zu laden.

pip install elevenlabs
pip install python-dotenv
3

API-Anfrage stellen

Erstellen Sie eine neue Datei namens example.py oder example.mts, je nach gewählter Sprache, und fügen Sie den folgenden Code hinzu:

# example.py
import os
from dotenv import load_dotenv
from io import BytesIO
import requests
from elevenlabs.client import ElevenLabs
load_dotenv()
elevenlabs = ElevenLabs(
api_key=os.getenv("ELEVENLABS_API_KEY"),
)
audio_url = (
"https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
)
response = requests.get(audio_url)
audio_data = BytesIO(response.content)
transcription = elevenlabs.speech_to_text.convert(
file=audio_data,
model_id="scribe_v2", # Model to use
tag_audio_events=True, # Tag audio events like laughter, applause, etc.
language_code="eng", # Language of the audio file. If set to None, the model will detect the language automatically.
diarize=True, # Whether to annotate who is speaking
)
print(transcription)

Führen Sie den Code anschließend aus:

python example.py

Die Transkription der Audiodatei sollte in der Konsole ausgegeben werden.

Setzen Sie für medizinische und klinische Audiodaten model_id auf scribe_v2_medical. Die Anfragestruktur ist dieselbe wie bei scribe_v2, und die Abrechnung erfolgt zum gleichen Preis. Siehe Scribe v2 Medical.

Nächste Schritte