Guia de início rápido de Speech to Text

Aprenda a converter áudio falado em texto.

Este guia mostra como converter áudio falado em texto usando a API Speech to Text.

Use a skill de speech-to-text da ElevenLabs para transcrever áudio com seu assistente de programação com IA:

npx skills add elevenlabs/skills --skill speech-to-text

Este tutorial demonstra como usar a API Speech to Text em lote. Para saber como usar a API de Transcrição de Voz em Tempo Real, consulte os guias de streaming do lado do cliente ou de streaming do lado do servidor.

Como usar a API Speech to Text

1

Criar uma chave de API

Crie uma chave de API no painel aqui, que você usará para acessar a API com segurança.

Armazene a chave como um segredo gerenciado e passe-a aos SDKs como uma variável de ambiente por meio de um arquivo .env ou diretamente na configuração do seu app, conforme sua preferência.

.env
ELEVENLABS_API_KEY=<your_api_key_here>
2

Instalar o SDK

Também usaremos a biblioteca dotenv para carregar nossa chave de API de uma variável de ambiente.

pip install elevenlabs
pip install python-dotenv
3

Fazer a solicitação à API

Crie um novo arquivo chamado example.py ou example.mts, dependendo da linguagem escolhida, e adicione o código a seguir:

# example.py
import os
from dotenv import load_dotenv
from io import BytesIO
import requests
from elevenlabs.client import ElevenLabs
load_dotenv()
elevenlabs = ElevenLabs(
api_key=os.getenv("ELEVENLABS_API_KEY"),
)
audio_url = (
"https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
)
response = requests.get(audio_url)
audio_data = BytesIO(response.content)
transcription = elevenlabs.speech_to_text.convert(
file=audio_data,
model_id="scribe_v2", # Model to use
tag_audio_events=True, # Tag audio events like laughter, applause, etc.
language_code="eng", # Language of the audio file. If set to None, the model will detect the language automatically.
diarize=True, # Whether to annotate who is speaking
)
print(transcription)

Em seguida, execute-o:

python example.py

Você verá a transcrição do arquivo de áudio impressa no console.

Para áudio médico e clínico, defina model_id como scribe_v2_medical. O formato da solicitação é o mesmo de scribe_v2 e a cobrança é feita pela mesma tarifa. Consulte Scribe v2 Medical.

Próximas etapas