Python SDK

ElevenAgents SDK: 맞춤형 대화형 음성 에이전트를 몇 분 만에 배포하세요.

ElevenAgents 개요도 참고하세요

설치

프로젝트에 elevenlabs Python 패키지를 설치하세요.

pip install elevenlabs
# or
poetry add elevenlabs

기본 오디오 입력/출력 구현을 사용하려면 pyaudio extra도 필요합니다.

pip install "elevenlabs[pyaudio]"
# or
poetry add "elevenlabs[pyaudio]"

pyaudio 패키지를 설치하려면 추가 시스템 종속성이 필요할 수 있습니다.

자세한 내용은 PyAudio 패키지 README를 참조하세요.

Debian 기반 시스템에서는 다음 명령으로 종속성을 설치할 수 있습니다.

sudo apt-get update
sudo apt-get install libportaudio2 libportaudiocpp0 portaudio19-dev libasound-dev libsndfile1-dev -y

사용법

이 예제에서는 ElevenLabs Agents 에이전트와 대화하는 간단한 스크립트를 만듭니다.

먼저 필요한 종속성을 import합니다.

import os
import signal
from elevenlabs.client import ElevenLabs
from elevenlabs.conversational_ai.conversation import Conversation
from elevenlabs.conversational_ai.default_audio_interface import DefaultAudioInterface

다음으로 환경 변수에서 에이전트 ID와 API 키를 불러옵니다.

agent_id = os.getenv("AGENT_ID")
api_key = os.getenv("ELEVENLABS_API_KEY")

API 키는 인증이 활성화된 비공개 에이전트에만 필요합니다. 공개 에이전트에는 설정할 필요가 없으며, 없어도 코드가 정상적으로 작동합니다.

그런 다음 ElevenLabs 클라이언트 인스턴스를 만듭니다.

elevenlabs = ElevenLabs(api_key=api_key)

이제 Conversation 인스턴스를 초기화합니다.

conversation = Conversation(
# API client and agent ID.
elevenlabs,
agent_id,
# Assume auth is required when API_KEY is set.
requires_auth=bool(api_key),
# Use the default audio interface.
audio_interface=DefaultAudioInterface(),
# Simple callbacks that print the conversation to the console.
callback_agent_response=lambda response: print(f"Agent: {response}"),
callback_agent_response_correction=lambda original, corrected: print(f"Agent: {original} -> {corrected}"),
callback_user_transcript=lambda transcript: print(f"User: {transcript}"),
# Uncomment if you want to see latency measurements.
# callback_latency_measurement=lambda latency: print(f"Latency: {latency}ms"),
# Uncomment if you want to receive audio alignment data with character-level timing.
# callback_audio_alignment=lambda alignment: print(f"Alignment: {alignment.chars}"),
)

대화에는 기본 시스템 오디오 입력/출력 장치를 사용하는 DefaultAudioInterface를 사용합니다. elevenlabs.conversational_ai.conversation.AudioInterface를 서브클래싱하여 자체 오디오 인터페이스를 구현할 수도 있습니다.

이제 대화를 시작할 수 있습니다. 선택적으로 대화를 사용자에게 매핑하기 위해 자체 최종 사용자 ID를 전달하는 것이 좋습니다.

conversation.start_session(
user_id=user_id # optional field
)

사용자가 Ctrl+C를 누를 때 정상적으로 종료하려면 end_session()을 호출하는 시그널 핸들러를 추가할 수 있습니다.

signal.signal(signal.SIGINT, lambda sig, frame: conversation.end_session())

마지막으로 대화가 끝날 때까지 기다린 후 대화 ID를 출력합니다. 이 ID는 대화 기록을 검토하고 디버깅하는 데 사용할 수 있습니다.

conversation_id = conversation.wait_for_session_end()
print(f"Conversation ID: {conversation_id}")

이제 남은 것은 스크립트를 실행하고 에이전트와 대화를 시작하는 것입니다.

# For public agents:
AGENT_ID=youragentid python demo.py
# For private agents:
AGENT_ID=youragentid ELEVENLABS_API_KEY=yourapikey python demo.py