Vai alla navigazione

Guida rapida a Speech to Text

Scopri come convertire l'audio parlato in testo.

Questa guida ti mostrerà come convertire l’audio parlato in testo utilizzando l’API Speech to Text.

Usa la skill speech-to-text di ElevenLabs per trascrivere l’audio dal tuo assistente di coding IA:

npx skills add elevenlabs/skills --skill speech-to-text

Questo tutorial mostrerà come usare l’API batch Speech to Text. Per una guida su come usare l’API Speech to Text Realtime, consulta le guide su streaming lato client o streaming lato server.

Utilizzo dell’API Speech to Text

1

Crea una chiave API

Crea qui una chiave API nella dashboard, che userai per accedere all’API in modo sicuro.

Archivia la chiave come secret gestito e passala agli SDK come variabile d’ambiente tramite un file .env oppure direttamente nella configurazione della tua app, a seconda delle tue preferenze.

.env
ELEVENLABS_API_KEY=<your_api_key_here>
2

Installa l'SDK

Useremo anche la libreria dotenv per caricare la nostra chiave API da una variabile d’ambiente.

pip install elevenlabs
pip install python-dotenv
3

Effettua la richiesta API

Crea un nuovo file denominato example.py o example.mts, a seconda del linguaggio che preferisci, e aggiungi il seguente codice:

# example.py
import os
from dotenv import load_dotenv
from io import BytesIO
import requests
from elevenlabs.client import ElevenLabs
load_dotenv()
elevenlabs = ElevenLabs(
api_key=os.getenv("ELEVENLABS_API_KEY"),
)
audio_url = (
"https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
)
response = requests.get(audio_url)
audio_data = BytesIO(response.content)
transcription = elevenlabs.speech_to_text.convert(
file=audio_data,
model_id="scribe_v2", # Model to use
tag_audio_events=True, # Tag audio events like laughter, applause, etc.
language_code="eng", # Language of the audio file. If set to None, the model will detect the language automatically.
diarize=True, # Whether to annotate who is speaking
)
print(transcription)

Quindi eseguilo:

python example.py

Dovresti vedere la trascrizione del file audio stampata nella console.

Per l’audio medico e clinico, imposta model_id su scribe_v2_medical. La struttura della richiesta è la stessa di scribe_v2 e viene fatturata alla stessa tariffa. Consulta Scribe v2 Medical.

Passaggi successivi