Guide de démarrage rapide de Speech to Text

Découvrez comment convertir l’audio parlé en texte.

Ce guide vous explique comment convertir l’audio parlé en texte avec l’API Speech to Text.

Utilisez la compétence Speech to Text d’ElevenLabs pour transcrire de l’audio depuis votre assistant de programmation IA :

npx skills add elevenlabs/skills --skill speech-to-text

Ce tutoriel explique comment utiliser l’API Speech to Text par lot. Pour apprendre à utiliser l’API Realtime Speech to Text, consultez les guides sur le streaming côté client ou le streaming côté serveur.

Utiliser l’API Speech to Text

1

Créez une clé API

Créez une clé API dans le Dashboard ici, que vous utiliserez pour accéder à l’API de manière sécurisée.

Stockez la clé comme secret géré et transmettez-la aux SDK soit en tant que variable d’environnement via un fichier .env, soit directement dans la configuration de votre application, selon vos préférences.

.env
ELEVENLABS_API_KEY=<your_api_key_here>
2

Installez le SDK

Nous utiliserons également la bibliothèque dotenv pour charger notre clé API depuis une variable d’environnement.

pip install elevenlabs
pip install python-dotenv
3

Effectuez la requête API

Créez un fichier nommé example.py ou example.mts, selon le langage de votre choix, puis ajoutez le code suivant :

# example.py
import os
from dotenv import load_dotenv
from io import BytesIO
import requests
from elevenlabs.client import ElevenLabs
load_dotenv()
elevenlabs = ElevenLabs(
api_key=os.getenv("ELEVENLABS_API_KEY"),
)
audio_url = (
"https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
)
response = requests.get(audio_url)
audio_data = BytesIO(response.content)
transcription = elevenlabs.speech_to_text.convert(
file=audio_data,
model_id="scribe_v2", # Model to use
tag_audio_events=True, # Tag audio events like laughter, applause, etc.
language_code="eng", # Language of the audio file. If set to None, the model will detect the language automatically.
diarize=True, # Whether to annotate who is speaking
)
print(transcription)

Exécutez-le ensuite :

python example.py

La transcription du fichier audio devrait s’afficher dans la console.

Pour l’audio médical et clinique, définissez model_id sur scribe_v2_medical. Le format de la requête est le même que pour scribe_v2 et la tarification est identique. Consultez Scribe v2 Medical.

Étapes suivantes