スピーチtoテキスト クイックスタート

話されたオーディオをテキストに変換する方法を学びましょう。

このガイドでは、スピーチtoテキストAPIを使用して音声をテキストに変換する方法を説明します。

ElevenLabs speech-to-text skillを使用すると、AIコーディングアシスタントから音声を文字起こしできます。

npx skills add elevenlabs/skills --skill speech-to-text

このチュートリアルでは、バッチスピーチtoテキストAPIの使用方法を紹介します。リアルタイムスピーチtoテキストAPIの使用方法については、 クライアントサイドストリーミングまたは サーバーサイドストリーミングのガイドを参照してください。

スピーチtoテキストAPIを使用する

1

APIキーを作成する

ダッシュボードでAPIキーを作成し、安全にAPIへアクセスするために使用します。

キーは管理されたシークレットとして保存し、好みに応じて.envファイルによる環境変数として、またはアプリの設定で直接SDKに渡してください。

.env
ELEVENLABS_API_KEY=<your_api_key_here>
2

SDKをインストールする

dotenvライブラリも使用して、環境変数からAPIキーを読み込みます。

pip install elevenlabs
pip install python-dotenv
3

APIリクエストを送信する

使用する言語に応じて、example.pyまたはexample.mtsという新しいファイルを作成し、次のコードを追加します。

# example.py
import os
from dotenv import load_dotenv
from io import BytesIO
import requests
from elevenlabs.client import ElevenLabs
load_dotenv()
elevenlabs = ElevenLabs(
api_key=os.getenv("ELEVENLABS_API_KEY"),
)
audio_url = (
"https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
)
response = requests.get(audio_url)
audio_data = BytesIO(response.content)
transcription = elevenlabs.speech_to_text.convert(
file=audio_data,
model_id="scribe_v2", # Model to use
tag_audio_events=True, # Tag audio events like laughter, applause, etc.
language_code="eng", # Language of the audio file. If set to None, the model will detect the language automatically.
diarize=True, # Whether to annotate who is speaking
)
print(transcription)

次に、実行します。

python example.py

コンソールに音声ファイルの文字起こしが出力されます。

医療・臨床音声では、model_idをscribe_v2_medicalに設定してください。リクエスト形式はscribe_v2と同じで、料金も同額です。Scribe v2 Medicalを参照してください。

次のステップ