ElevenLabs, 베타 종료 및 Eleven Multilingual v2 출시 - 약 30개 언어를 지원하는 혁신적인 AI 음성 모델
- 게시일
- 음성 AI 플랫폼 ElevenLabs는 다국어 기능을 지원하는 새로운 기반 딥러닝 모델을 출시하며 콘텐츠의 언어 장벽을 없애기 위한 노력에서 획기적인 도약을 이뤘습니다. 지원 언어는 28개이며 - 바로 Eleven Multilingual v2
- 이번 발전으로 전 세계 미디어 기업, 게임 개발자, 출판사, 독립 크리에이터는 콘텐츠 접근성을 크게 개선할 수 있습니다
- 1월 플랫폼 출시 이후 이어진 다양한 신규 기능 출시와 개선에 뒤이은 이 새로운 기능은 회사의 베타 단계가 공식적으로 종료되었음을 의미하기도 합니다
- ElevenLabs의 미션은 모든 콘텐츠를 모든 언어와 모든 목소리로 누구나 이용할 수 있게 만드는 것입니다
ElevenLabs, 음성 AI 소프트웨어 분야의 세계적 선도 기업이 오늘 새로운 다국어 음성 생성 모델을 출시했습니다 이 모델은 약 30개 언어로 감정이 풍부한 AI 오디오를 정확하게 생성할 수 있습니다.
전적으로 자체 연구를 바탕으로 한 이번 발전을 통해 크리에이터는 유럽, 아시아, 중동 전역의 해외 시장을 위한 현지화 오디오 콘텐츠를 제작할 수 있습니다. ElevenLabs는 지난 18개월 동안 인간 음성의 특징을 분석하고, 음성 생성에서 맥락을 이해하고 감정을 전달하기 위한 새로운 메커니즘을 구축했으며, 새롭고 고유한 음성을 합성해 왔습니다.
Eleven Multilingual v2를 사용하면 ElevenLabs 텍스트 음성 변환 플랫폼에 텍스트를 입력할 때 새 모델이 약 30개의 작성 언어를 자동으로 식별하고, 전례 없는 수준의 자연스러움으로 해당 언어의 음성을 생성합니다.
동시에 합성 음성이든 복제 음성이든 관계없이 원래 억양을 포함한 화자의 고유한 음성 특성이 모든 언어에서 유지됩니다. 즉, 하나의 동일한 음성으로 28개 언어의 콘텐츠를 생생하게 구현할 수 있습니다.
이번 출시는 플랫폼의 모든 크리에이터를 대상으로 한 프로페셔널 음성 복제의 정식 공개에 이은 것입니다. 추가 안전 및 보안 기능과 함께 제공된 이 제품 업데이트로 사용자는 원본과 사실상 구별할 수 없는 자신의 목소리를 완벽한 디지털 사본으로 만들 수 있습니다. 오늘 출시로 다국어 모델이 제공하는 약 30개 언어로 자신의 목소리를 말하게 할 수 있습니다.
이제 지원되는 언어는 다음과 같습니다; 중국어, 한국어, 네덜란드어, 터키어, 스웨덴어, 인도네시아어, 필리핀어, 일본어, 우크라이나어, 그리스어, 체코어, 핀란드어, 루마니아어, 덴마크어, 불가리아어, 말레이어, 슬로바키아어, 크로아티아어, 표준 아랍어 및 타밀어.
이 언어들은 기존에 제공되던 언어에 추가됩니다 여기에는 영어, 폴란드어, 독일어, 스페인어, 프랑스어, 이탈리아어, 힌디어 및 포르투갈어가 있습니다.
최근 기능 출시와 지속적인 플랫폼 개선에 이어, ElevenLabs는 오늘 플랫폼이 공식적으로 베타 단계를 마친다고 발표했습니다. 이번 전환은 전 세계 100만 명 이상의 사용자에게 신뢰할 수 있는 최첨단 도구를 제공하려는 회사의 노력에서 중요한 이정표입니다.
앞으로 ElevenLabs는 사용자가 플랫폼에서 음성을 공유하고 새로운 오디오 개발의 혜택을 누릴 수 있는 기능을 도입해, 인간과 AI의 협업 기회를 확대할 계획입니다.
ElevenLabs의 CEO 겸 공동 창업자 Mati Staniszewski는 다음과 같이 말했습니다:
ElevenLabs는 모든 콘텐츠를 모든 언어와 모든 목소리로 누구나 이용할 수 있게 하겠다는 꿈에서 시작됐습니다. Eleven Multilingual v2 출시로 이 꿈을 현실로 만들고, 사람과 같은 품질의 AI 음성을 모든 방언으로 제공하는 데 한 걸음 더 다가섰습니다.
“텍스트 음성 변환 도구는 경쟁의 장을 평평하게 만들고, 모든 크리에이터에게 최고 품질의 음성 오디오 기능을 제공합니다. 이제 이러한 이점은 약 30개 언어에 걸친 다국어 애플리케이션으로 확장됩니다. 궁극적으로는 AI의 도움으로 더 많은 언어와 음성을 지원하고 콘텐츠의 언어 장벽을 없애고자 합니다. ElevenLabs는 이러한 접근성의 도약이 궁극적으로 더 큰 창의성, 혁신, 다양성을 촉진할 것이라 믿습니다.
ElevenLabs는 여러 언어로 고품질 오디오 콘텐츠를 만드는 데 필요한 비용과 자원을 낮춤으로써, 기업과 크리에이터가 문화와 언어를 아우르며 공감을 얻는 더욱 창의적이고 접근성 높은 콘텐츠를 제작할 수 있도록 지원합니다.
독립 게임 개발자와 퍼블리셔에게 다국어 음성 생성 도구는 게임 경험과 오디오 콘텐츠를 해외 시청자에게 맞게 번역할 새로운 기회를 제공합니다. 음성 오디오의 품질이나 정확성을 저해하지 않으면서 플레이어와 청취자가 자신의 언어로 콘텐츠를 즐길 수 있게 합니다.
마찬가지로, 교육 기관은 이제 학습자에게 목표 언어의 정확한 오디오 콘텐츠를 즉시 제공할 수 있습니다. 이를 통해 언어 이해와 발음 능력을 높이고, 유학생의 다양한 교수 방식과 학습 요구도 충족할 수 있습니다.
모든 유형의 크리에이터는 ElevenLabs 도구를 사용해 콘텐츠 접근성을 개선할 수 있습니다. 여러 언어로 제공되는 음성을 시각 콘텐츠에 보완하여 시각 장애인이나 추가적인 학습 지원이 필요한 사람들을 도울 수 있습니다.
2023년 1월 공개된 초기 AI 음성 도구 제품군에는 미리 설계된 합성 음성 중에서 선택해 모든 텍스트를 음성으로 변환하는 기능과 자신의 목소리를 복제하는 기능이 포함됐습니다. 다국어 음성 합성 도구는 모든 콘텐츠를 모든 언어와 모든 목소리로 누구나 이용할 수 있게 하려는 ElevenLabs의 미션을 향한 또 하나의 진전입니다.
이 기술은 이미 다양한 창작 분야와 업계에서 채택됐습니다. 인디 작가의 오디오북 제작, 비디오 게임 속 조연 캐릭터 음성 구현, 시각 장애인의 온라인 텍스트 콘텐츠 접근 지원, 세계 최초의 AI 라디오 채널 운영 등에 활용되고 있습니다. ElevenLabs는 다음을 비롯한 다양한 선도적 콘텐츠 크리에이터 및 스튜디오와도 파트너십을 맺었습니다. AI 비디오 생성기 D-ID, 세계 최대 오디오북 출판사 중 하나인 Storytel, 오픈 액세스 과학 비디오 플랫폼 ScienceCast 및 이들의 비디오 생성 도구는 arXiv에 출판된 과학 연구 논문을 요약하며, 글로벌 선도 콘텐츠 크리에이터 플랫폼 TheSoul Publishing, 그리고 뛰어난 게임 개발사인 Embark Studios 및 Paradox Interactive, 그리고 미디어 플랫폼 MNTN입니다.




