Krótki przewodnik po Speech to Text

Dowiedz się, jak zamienić mówione audio na tekst.

Ten przewodnik pokaże ci, jak zamienić nagranie mowy na tekst za pomocą API Speech to Text.

Użyj umiejętności zamiany mowy na tekst ElevenLabs, aby transkrybować audio z pomocą asystenta AI do programowania:

npx skills add elevenlabs/skills --skill speech-to-text

Ten tutorial pokazuje, jak korzystać z API Batch Speech to Text. Przewodniki po API Realtime Speech to Text znajdziesz tutaj: streaming po stronie klienta lub streaming po stronie serwera.

Korzystanie z API Speech to Text

1

Utwórz klucz API

Utwórz klucz API w panelu tutaj, aby bezpiecznie uzyskać dostęp do API.

Przechowuj klucz jako zarządzany sekret i przekaż go do SDK jako zmienną środowiskową przez plik .env lub bezpośrednio w konfiguracji aplikacji — zależnie od preferencji.

.env
ELEVENLABS_API_KEY=<your_api_key_here>
2

Zainstaluj SDK

Użyjemy też biblioteki dotenv, aby wczytać klucz API ze zmiennej środowiskowej.

pip install elevenlabs
pip install python-dotenv
3

Wyślij żądanie API

Utwórz plik example.py lub example.mts, zależnie od wybranego języka, i dodaj ten kod:

# example.py
import os
from dotenv import load_dotenv
from io import BytesIO
import requests
from elevenlabs.client import ElevenLabs
load_dotenv()
elevenlabs = ElevenLabs(
api_key=os.getenv("ELEVENLABS_API_KEY"),
)
audio_url = (
"https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
)
response = requests.get(audio_url)
audio_data = BytesIO(response.content)
transcription = elevenlabs.speech_to_text.convert(
file=audio_data,
model_id="scribe_v2", # Model to use
tag_audio_events=True, # Tag audio events like laughter, applause, etc.
language_code="eng", # Language of the audio file. If set to None, the model will detect the language automatically.
diarize=True, # Whether to annotate who is speaking
)
print(transcription)

Następnie uruchom plik:

python example.py

W konsoli powinna pojawić się transkrypcja pliku audio.

W przypadku nagrań medycznych i klinicznych ustaw model_id na scribe_v2_medical. Format żądania jest taki sam jak dla scribe_v2, a cena również. Zobacz Scribe v2 Medical.

Kolejne kroki