데모
코드
고대의 땅 엘도리아에서, 하늘은 반짝이고 숲은 바람에게 비밀을 속삭이던 곳에 제피로스라는 용이 살고 있었습니다. [sarcastically] ‘모두 불태워 버리는’ 그런 종류는 아니었죠... [giggles] 하지만 그는 부드럽고 현명했으며, 눈은 오래된 별처럼 빛났습니다. [whispers] 그가 지나갈 때면 새들도 조용해졌습니다.
- Lovable
- Synthesia
- Stripe
- Perplexity
- Twilio
실제 서비스에 바로 적용 가능한 음성 구축에 필요한 모든 것
실시간, 장문, 실제 서비스에 적합한 모델로 감정 표현과 제어가 가능한 음성 생성.
감정과 전달 방식 제어
감정, 오디오 이벤트, 몰입감 있는 사운드스케이프가 어우러진 제어 가능한 감정 표현 음성 생성.

10,000개 이상의 보이스 이용
다양한 용도에 맞는 생생하고 자연스러운 보이스를 계속해서 확장 중인 라이브러리에서 탐색하세요.

보이스 디자인 & 복제
30개 이상의 언어로 자연스러운 보이스, 다양한 억양, 현지화된 오디오를 청중에 맞게 제작.

다중 화자 대화
70개 이상의 언어로 자연스러운 다중 화자 대화를 표현력 있고 조절 가능한 음성으로 생성하세요.

오디오 이벤트 및 연출
오디오 태그, 타이밍 신호, 내러티브 연출로 전달 방식을 세밀하게 제어.

발음 사전
이름이나 용어 등 특정 단어의 발음을 직접 정의해 일관되고 정확한 음성 제공.

세계 최고의 기업과 브랜드가 선택한 기술
“현지 언어로 Reels 더빙부터 Horizon에서 음악 및 캐릭터 보이스 생성까지, ElevenLabs 플랫폼은 전 세계 크리에이터, 기업, 엔터프라이즈가 보이스, 음악, 사운드를 대규모로 활용할 수 있게 합니다.”
“수백만 명이 YouTube와 Twitch에서 Hikaru, Levy, Magnus 같은 크리에이터에게 체스를 배우고 있습니다. 이제 Chess.com 안에서 이들과 함께 몰입감 있고, 개인적이며, 개성 넘치는 방식으로 배울 수 있습니다. 우리의 목표는 모든 실력의 플레이어를 환영하고, 체스를 쉽게 풀어주며, 재미와 개성을 유지하는 체스 코치를 만드는 것입니다. ElevenLabs와 이 놀라운 새로운 보이스 덕분에 그 비전을 현실로 한 걸음 더 다가갔습니다.”
“ElevenLabs 덕분에 강력한 텍스트 음성 변환 기능을 SDK에 빠르게 적용할 수 있었고, 에이전트가 사용자 질문이나 인식한 내용에 대해 실시간으로 감정 표현이 풍부한 음성으로 응답할 수 있게 되었습니다.”

“Twilio는 ElevenLabs의 생성형 AI 음성 기술을 CPaaS에 통합해 ConversationRelay를 강화했습니다. 이 통합으로 기업과 개발자는 Twilio CPaaS 플랫폼에서 바로 사람처럼 자연스럽고 감정이 풍부하며 실시간으로 반응하는 대화형 AI 음성 상호작용을 만들 수 있습니다. ElevenLabs는 Twilio가 가장 인간적인 보이스로 ConversationRelay를 강화하기 위해 ElevenLabs를 선택한 것을 매우 기쁘게 생각합니다.”
실제 서비스용으로 설계된 API

자주 묻는 질문
- Flash v2.5 - 실시간 음성 에이전트 등 초저지연(~75ms) 애플리케이션용
- Turbo v2.5 - 상호작용에 적합한 품질과 속도 균형(~250-300ms)
- Multilingual v2 - 최대 10,000자 장문 콘텐츠에 일관된 품질 제공
- Eleven v3 - 창의적 용도의 최대 감정 표현 및 폭넓은 감정 범위
Flash v2.5는 약 75ms의 지연 시간을 제공합니다.
Turbo v2.5는 일반적으로 250-300ms 내에 응답합니다.
두 모델 모두 스트리밍 출력을 지원해, 생성이 끝나기 전에 재생을 시작할 수 있습니다.
Eleven v3는 70개 이상의 언어를 지원합니다.
Flash v2.5와 Turbo v2.5는 32개 언어를 지원합니다.
Multilingual v2는 29개 언어를 지원합니다.
Flash v2.5 및 Turbo v2.5: 40,000자
Multilingual v2: 10,000자
Eleven v3: 3,000자
오디오 태그([laughs], [whispers], [sighs], [door slam])를 사용해 전달 방식, 감정, 강조, 멈춤, 음향 효과 등을 제어할 수 있습니다. Eleven v3가 가장 풍부한 감정 제어를 제공합니다.
보이스 라이브러리에는 10,000개 이상의 보이스가 포함되어 있습니다. 텍스트 프롬프트로 보이스를 복제하거나 직접 디자인할 수도 있습니다.
네. 스트리밍을 사용하면 전체 오디오가 생성되기 전에 재생을 시작할 수 있어, 실시간 애플리케이션에서 체감 지연이 줄어듭니다.
네. 보이스 ID로 라이브러리 내 모든 보이스를 참조할 수 있으며, 프로페셔널 음성 복제, 즉시 복제, 직접 디자인한 보이스도 포함됩니다.
API는 기본적으로 MP3를 출력합니다. 추가 포맷으로 PCM과 μ-law도 지원합니다.
스트리밍이 활성화된 Flash v2.5를 사용하세요. 요청은 1,000자 미만으로 유지하고, 실시간 애플리케이션에는 WebSocket 연결을 사용하세요.
네. 음성 철자 또는 발음 사전을 사용해 특정 단어의 발음을 제어할 수 있습니다.
Python, JavaScript/TypeScript용 공식 SDK가 제공됩니다. HTTP API도 사용할 수 있습니다.
전체 API 레퍼런스, 코드 예제, 통합 가이드는 elevenlabs.io/docs/api-reference에서 확인할 수 있습니다.
네. 엔터프라이즈 요금제에는 SOC 2 준수, HIPAA 지원, GDPR 준수, EU 데이터 레지던시, 제로 보관 모드, 전담 지원, 맞춤 SLA가 포함됩니다.




