데모
코드
고대의 땅 엘도리아에서, 하늘은 반짝이고 숲은 바람에게 비밀을 속삭이던 곳에 제피로스라는 용이 살고 있었습니다. [sarcastically] ‘모두 불태워 버리는’ 그런 종류는 아니었죠... [giggles] 하지만 그는 부드럽고 현명했으며, 눈은 오래된 별처럼 빛났습니다. [whispers] 그가 지나갈 때면 새들도 조용해졌습니다.
- Lovable
- Synthesia
- Stripe
- Perplexity
- Twilio

v3 Conversational
실시간 음성을 위한 가장 표현력 풍부한 모델입니다.
- 낮은 지연 시간(~280ms)
- 고품질의 표현력 있는 전달
- 70개 이상 언어 지원
- 맞춤형 오디오 태그
- 분당 약 $0.05
프로덕션용 음성 구축에 필요한 모든 것
실시간, 장문 콘텐츠, 프로덕션 환경에 맞춰 설계된 모델로 표현력 풍부하고 제어 가능한 음성을 생성하세요.
감정과 전달 방식 제어
감정, 오디오 이벤트, 몰입감 있는 사운드스케이프를 더해 제어 가능하고 표현력 풍부한 음성을 만드세요.

11,000개 이상의 음성 이용
어떤 사용 사례에도 활용할 수 있는 표현력 풍부하고 생생한 음성 컬렉션을 만나보세요.

보이스 디자인 및 음성 복제
자연스러운 음성, 표현력 있는 억양, 대상 사용자에 맞춘 현지화 오디오로 30개 이상의 언어로 제작하세요.

다화자 대화
표현력 있고 제어 가능한 음성으로 70개 이상의 언어에서 자연스러운 다화자 대화를 만드세요.

오디오 이벤트 및 연출
음성에 포함된 오디오 태그, 타이밍 신호, 내러티브 연출로 전달 방식을 제어하세요.

발음 사전
이름과 전문 용어를 일관되고 정확하게 발음하도록 맞춤 발음을 정의하세요.

세계 유수의 기업과 브랜드를 지원합니다
“현지 언어로 Reels를 더빙하는 것부터 Horizon에서 음악과 캐릭터 음성을 생성하는 것까지, ElevenLabs 플랫폼은 전 세계 크리에이터, 기업, 엔터프라이즈가 음성, 음악, 사운드를 대규모로 활용해 구축할 수 있도록 지원합니다.”
“수백만 명의 사람들이 매일 YouTube와 Twitch에서 Hikaru, Levy, Magnus 같은 크리에이터를 통해 체스를 배웁니다. 이제 Chess.com 안에서 몰입감 있고 개인적이며 개성 넘치는 방식으로 이들에게 배울 수 있습니다. 우리의 목표는 적절한 수준에서 가르치고, 모든 실력의 플레이어를 환영하며, 체스를 재미있고 개성 있게 유지하면서 어렵게 느껴지는 부분을 풀어 주는 체스 코치를 만드는 것입니다. ElevenLabs와 이 놀라운 새 음성을 통해 그 비전을 현실로 만드는 데 큰 걸음을 내디뎠습니다.”
“ElevenLabs 덕분에 강력한 텍스트 음성 변환 기능을 SDK에 빠르게 도입할 수 있었습니다. 이를 통해 에이전트는 사용자 질문에 표현력 있는 음성으로 실시간 응답하거나, 보고 있는 내용에 대한 피드백을 제공할 수 있습니다.”

“Twilio는 ElevenLabs의 생성형 AI 음성 기술을 CPaaS에 통합해 ConversationRelay를 강화했습니다. 이 통합으로 기업과 개발자는 Twilio CPaaS 플랫폼에서 직접 사람처럼 자연스럽고 표현력 있으며 실시간으로 응답하는 대화형 AI 음성 상호작용을 만들 수 있습니다. Twilio가 제공 가능한 가장 표현력 있고 사람 같은 음성으로 ConversationRelay를 강화하기 위해 ElevenLabs를 선택한 것을 기쁘게 생각합니다. ”
프로덕션 환경을 위한 API

전송 중과 저장 시 데이터를 암호화하며, SOC 2, HIPAA, GDPR 규정 준수를 지원합니다. 더욱 엄격한 데이터 제어를 위해 EU 데이터 레지던시 및 제로 리텐션 모드를 제공합니다.
전송 중과 저장 시 데이터를 암호화하며, SOC 2, HIPAA, GDPR 규정 준수를 지원합니다. 더욱 엄격한 데이터 제어를 위해 EU 데이터 레지던시 및 제로 리텐션 모드를 제공합니다.
타입 안전성, 스트리밍 지원, 명확한 예시를 갖춘 공식 Python 및 TypeScript SDK를 제공합니다.
타입 안전성, 스트리밍 지원, 명확한 예시를 갖춘 공식 Python 및 TypeScript SDK를 제공합니다.
전문 팀이 원활한 출시를 지원하고 안정적인 운영을 유지해 일관된 성능과 안심할 수 있는 환경을 제공합니다.
전문 팀이 원활한 출시를 지원하고 안정적인 운영을 유지해 일관된 성능과 안심할 수 있는 환경을 제공합니다.
자주 묻는 질문
- Flash v2.5 - 실시간 음성 에이전트 등 초저지연(~75ms) 애플리케이션용
- Turbo v2.5 - 상호작용에 적합한 품질과 속도 균형(~250-300ms)
- Multilingual v2 - 최대 10,000자 장문 콘텐츠에 일관된 품질 제공
- Eleven v3 - 창의적 용도의 최대 감정 표현 및 폭넓은 감정 범위
Flash v2.5는 약 75ms의 지연 시간을 제공합니다.
Turbo v2.5는 일반적으로 250-300ms 내에 응답합니다.
두 모델 모두 스트리밍 출력을 지원해, 생성이 끝나기 전에 재생을 시작할 수 있습니다.
Eleven v3는 70개 이상의 언어를 지원합니다.
Flash v2.5와 Turbo v2.5는 32개 언어를 지원합니다.
Multilingual v2는 29개 언어를 지원합니다.
Flash v2.5 및 Turbo v2.5: 40,000자
Multilingual v2: 10,000자
Eleven v3: 3,000자
오디오 태그([laughs], [whispers], [sighs], [door slam])를 사용해 전달 방식, 감정, 강조, 멈춤, 음향 효과 등을 제어할 수 있습니다. Eleven v3가 가장 풍부한 감정 제어를 제공합니다.
보이스 라이브러리에는 10,000개 이상의 보이스가 포함되어 있습니다. 텍스트 프롬프트로 보이스를 복제하거나 직접 디자인할 수도 있습니다.
네. 스트리밍을 사용하면 전체 오디오가 생성되기 전에 재생을 시작할 수 있어, 실시간 애플리케이션에서 체감 지연이 줄어듭니다.
네. 보이스 ID로 라이브러리 내 모든 보이스를 참조할 수 있으며, 프로페셔널 음성 복제, 즉시 복제, 직접 디자인한 보이스도 포함됩니다.
API는 기본적으로 MP3를 출력합니다. 추가 포맷으로 PCM과 μ-law도 지원합니다.
스트리밍이 활성화된 Flash v2.5를 사용하세요. 요청은 1,000자 미만으로 유지하고, 실시간 애플리케이션에는 WebSocket 연결을 사용하세요.
네. 음성 철자 또는 발음 사전을 사용해 특정 단어의 발음을 제어할 수 있습니다.
Python, JavaScript/TypeScript용 공식 SDK가 제공됩니다. HTTP API도 사용할 수 있습니다.
전체 API 레퍼런스, 코드 예제, 통합 가이드는 elevenlabs.io/docs/api-reference에서 확인할 수 있습니다.
네. 엔터프라이즈 요금제에는 SOC 2 준수, HIPAA 지원, GDPR 준수, EU 데이터 레지던시, 제로 보관 모드, 전담 지원, 맞춤 SLA가 포함됩니다.



