콘텐츠로 건너뛰기

Eleven Multilingual v1 출시: 새로운 음성 합성 모델

게시일

듣기이 글 오디오로 듣기

오늘, 새로운 7개 언어를 지원하는 고급 음성 합성 모델 Eleven Multilingual v1을 선보이게 되어 매우 기쁩니다: 프랑스어, 독일어, 힌디어, 이탈리아어, 폴란드어, 포르투갈어, 그리고 스페인어. Eleven Monolingual v1을 구현한 연구를 기반으로, 현재의 딥러닝 접근 방식은 더욱 정교해지는 모델에 더 많은 데이터와 컴퓨팅 성능, 새로운 기술을 활용합니다. 이 모델은 텍스트의 미묘한 차이를 이해하고 감정적으로 풍부한 표현을 구현할 수 있습니다. 이러한 발전은 크리에이터, 게임 개발자, 퍼블리셔의 창작 가능성을 넓히고, 더욱 현지화되고 접근성이 높으며 상상력 넘치는 콘텐츠를 생성형 미디어로 만들 수 있는 길을 열어 줍니다.

새 모델은 모든 구독 플랜에서 이용할 수 있으며, 지금 Beta 플랫폼에서 사용해 보실 수 있습니다.

사용하려면 음성 합성 패널에 새로 추가된 드롭다운 메뉴에서 선택하기만 하면 됩니다.

연구 개요

이전 모델과 마찬가지로, 새 모델은 전적으로 ElevenLabs의 자체 연구를 기반으로 합니다. Eleven Monolingual v1을 뛰어난 스토리텔링 도구로 만든 모든 강점도 그대로 유지합니다. 여기에는 문맥에 따라 전달 방식을 조절하고 의도와 감정을 매우 사실적으로 표현하는 능력이 포함됩니다. 이제 이러한 기능은 다국어 데이터 학습을 통해 새롭게 지원되는 언어로 확장되었습니다.

이 모델의 주목할 만한 기능은 다국어 텍스트를 식별하고 적절하게 발화하는 능력입니다. 이제 하나의 프롬프트로 여러 언어의 음성을 생성하면서 각 화자의 고유한 음성 특성을 유지할 수 있습니다. 최상의 결과를 위해 단일 언어로 된 프롬프트를 제공하는 것을 권장합니다. 모델은 이미 여러 언어를 동시에 처리해도 상당히 좋은 성능을 보이지만, 추가적인 개선이 필요합니다.

새 모델은 다른 VoiceLab 기능, 즉 Instant 음성 복제보이스 디자인과 호환됩니다. 생성된 모든 음성은 원래 억양을 포함한 대부분의 원래 음성 특성을 모든 언어에서 유지합니다.

다만, 이 모델에는 알려진 한계가 있습니다: 다른 언어로 프롬프트를 입력해도 숫자, 약어, 외래어가 때때로 영어식으로 발음됩니다. 예를 들어 스페인어 프롬프트에 숫자 "11"이나 “radio”라는 단어를 입력하면 영어식으로 발음될 수 있습니다. 개선 작업을 진행하는 동안 약어와 숫자는 대상 언어로 풀어 쓰는 것을 권장합니다.

음성의 민주화

ElevenLabs는 모든 콘텐츠를 모든 언어와 모든 목소리로 누구나 이용할 수 있게 하겠다는 꿈에서 시작되었습니다. ElevenLabs 팀원들은 유럽, 아시아, 미국 전역에서 모였습니다. 팀과 세상이 점점 더 다국어화됨에 따라, 사람과 같은 품질의 AI 음성을 모든 언어로 제공한다는 비전 아래 더욱 굳게 뭉치고 있습니다.

ElevenLabs의 최신 텍스트 음성 변환(TTS) 모델은 이 비전을 실현하기 위한 여정의 첫걸음일 뿐입니다. 사람과 같은 품질의 AI 음성이 등장하면서, 이제 사용자와 기업은 필요, 우선순위, 선호도에 맞춰 오디오 콘텐츠를 제작하고 맞춤 설정할 수 있습니다. 이는 크리에이터, 소규모 기업, 독립 예술가에게 더욱 공정한 경쟁 환경을 만들 잠재력을 이미 보여 주었습니다. AI 오디오의 힘을 활용하면, 이제 더 많은 자원을 보유한 대규모 조직이 제작한 콘텐츠에 견줄 만한 고품질 청각 경험을 개발할 수 있습니다.

이러한 이점은 이제 다국어, 다문화 및 교육 분야의 활용으로도 확장됩니다. 사용자, 기업, 기관이 더 폭넓은 청중의 공감을 얻는 진정성 있는 오디오를 제작할 수 있도록 지원합니다. 폭넓은 음성, 억양, 언어를 제공함으로써 AI는 문화적 격차를 좁히고 세계적 이해를 촉진합니다. ElevenLabs는 이렇게 새롭게 확보된 접근성이 궁극적으로 더 큰 창의성, 혁신, 다양성을 이끈다고 믿습니다.

콘텐츠 크리에이터는 다양한 청중과 소통하고자 할 때 이제 문화적 격차를 좁히고 포용성을 높일 도구를 활용할 수 있습니다.

게임 개발자퍼블리셔는 품질이나 정확성을 전혀 희생하지 않고 언어 장벽을 넘어 플레이어와 청취자를 연결해 몰입도와 효율성을 극대화하는, 몰입감 높은 현지화 경험을 전 세계 청중에게 제공할 수 있습니다.

교육 기관은 이제 대상 언어로 다양한 사용자를 위한 오디오 콘텐츠를 제작할 수 있으며, 언어 이해력과 발음 능력을 높이고 다양한 교수 방식과 학습 요구도 충족할 수 있습니다.

접근성 기관은 이제 시각 장애나 학습 어려움이 있는 사람들이 접근하기 어려운 자료를 내용과 형식 모두에서 필요에 맞는 매체로 쉽게 변환할 수 있도록 지원해, 이들의 역량을 더욱 강화할 수 있습니다.

현재와 미래의 크리에이터 및 개발자들이 가능성의 한계를 넓혀 가는 모습을 빨리 보고 싶습니다!

유사한 기사

최고 품질의 AI 오디오로 창작하세요