존재하지 않는 목소리 - 생성형 음성 AI
- 게시일
최근에는 모두가 생성형 AI에 대해 이야기하는 듯합니다. ChatGPT, Stable Diffusion, DALL-E, Midjourney와 같은 딥러닝 기반 대규모 언어 모델 및 텍스트-이미지 모델은 기술 업계는 물론 그 밖의 분야에서도 큰 화제를 불러일으켰습니다. 많은 사람이 이를 최근 AI 분야에서 가장 중요한 발전 중 하나로 꼽습니다. 이에 동의하든 그렇지 않든, 전반적인 분위기는 매우 강력한 무언가가 등장했다는 것입니다. 2023년에는 그림을 그리거나 비디오를 제작하도록 도와주는 모델에 관한 이야기를 듣게 될 것입니다. 최신 최고급 스마트폰이 무엇인지 묻는 것처럼, 머지않아 최신 최고급 파운데이션 모델이 무엇인지 묻게 될 것입니다. 하지만 이런 기대감 속에서도 생성형 미디어 분야에서 여전히 크게 주목받지 못하는 영역이 하나 있다고 생각합니다. 바로 AI 음성입니다. Eleven이 선도하고자 하는 분야이기도 합니다. Eleven은 매일 딥러닝 기술이 열어 준 잠재력을 활용해 사실적인 텍스트 음성 변환 및 음성 복제 도구를 구동합니다. 이제는 처음부터 완전히 새로운 합성 음성을 디자인할 수 있는 자체 생성형 모델도 도입하고 있습니다.
음성 생성기 - 음성 디자인
사용자들은 매일 플랫폼에서 캐릭터에 생명을 불어넣습니다. 오디오북, 게임, 팬 픽션 등 다양한 콘텐츠를 위해서입니다. 모든 사용자가 콘텐츠에 맞으면서도 자신만 사용할 수 있는 음성을 찾기에는 현재의 화자 뱅크가 너무 작다는 점을 깨달았습니다. 그래서 누구나 완전히 새로운 합성 음성을 직접 디자인할 수 있도록 했습니다.
음성 합성과 음성 복제에 현재 사용하는 방식을 살펴보면서, 이를 어떻게 구현할지에 대한 아이디어를 얻었습니다. 두 과정 모두 특정 음성의 특성을 인코딩하는 방법이 필요합니다. 화자 임베딩은 이러한 정체성을 담는 요소로, 화자의 음성을 벡터로 표현한 것입니다. 전용 모델을 학습시켜 화자 임베딩의 분포에서 샘플링하면 무한히 많은 새 음성을 만들 수 있다는 사실을 발견했습니다.
사용자들은 주로 특정 음성 특성을 찾기 때문에, 이 과정에 어느 정도의 제어 기능을 추가해야 했습니다. 특성에 따라 음성을 생성할 수 있도록 조건부 생성 기능을 모델에 확장했습니다. 이제 새 음성의 핵심 정체성을 결정하는 몇 가지 기본 파라미터, 즉 성별, 연령, 억양, 음높이, 말하기 스타일을 설정할 수 있습니다. 다시 말해, 동일한 기본 파라미터를 선택하더라도 ‘생성’을 누를 때마다 이전에 존재하지 않았던 완전히 새로운 음성을 얻을 수 있습니다.
아래는 이런 방식으로 디자인할 수 있는 음성의 몇 가지 예시입니다:
'음성 디자인'은 2월부터 보이스 랩의 일부로 플랫폼에서 이용할 수 있습니다.
어디에 활용할 수 있나요?
이미 도구를 통해 사람의 음성만큼 사실적인 음성을 만들 수 있으며, 인공 음성의 활용 가능성은 앞으로 더욱 넓어질 것으로 예상합니다. 뉴스 매체나 광고용 오디오 녹음 등 이러한 새로운 활용 사례 중 다수는 하나의 음성이 특정 브랜드나 사용 사례에만 귀속되고 식별되어야 하며, 다른 곳에서는 사용되지 않아야 합니다. 반면 스토리텔링이나 비디오 게임과 같은 활용 사례에서는 개발 초기부터 유연성과 자유로운 실험이 더 중요합니다. 따라서 방대한 가상 화자 세트를 만드는 대신, 각자의 목적에 가장 잘 맞는 음성을 사용자가 최종적으로 선택할 수 있게 하고자 했습니다.
도서 저자는 이제 자신의 작품을 손쉽게 오디오로 전환할 수 있을 뿐 아니라, 맞춤형 내레이션 디자인에 대한 창작 नियंत्रण권도 유지할 수 있습니다. 이는 독자에게 출판물과 상호작용하는 흥미로운 새로운 방식을 제공하는 동시에, 우리가 즐겨 들을 수 있는 책의 수를 크게 늘려 줍니다.
뉴스 발행사는 점점 더 오디오 분야로 진출하고 있으며, 출판물을 대표할 독특한 음성을 선택하는 일은 중요한 과제입니다. 많은 청취자는 내용뿐 아니라 형식도 중요하게 생각합니다. 마찬가지로 중요한 점은 이제 발행사가 특정 음성이 자신들만을 대표한다는 확신을 가질 수 있다는 것입니다.
비디오 게임 개발자는 이제 필요한 모든 도구를 손쉽게 활용해, 기존에는 대사가 없던 수많은 NPC에게 음성을 부여할 수 있습니다. 품질 저하 없이 비용 효율성을 높일 수 있을 뿐 아니라, 자신이 만드는 가상 세계에만 존재하는 고유한 음성도 디자인할 수 있습니다.
광고 크리에이티브 담당자는 특정 캠페인에 어울리는 보이스오버가 필요합니다. 따라서 개발 초기부터 공감을 불러일으키고 목적에 맞는 내레이션을 디자인할 수 있다는 것은 큰 장점입니다. 추가 리소스 없이도 여러 음성과 전달 스타일을 즉시 실험할 수 있습니다.
모든 종류의 오디오 및 비디오 콘텐츠를 제작하는 크리에이터부터 기업 커뮤니케이션에 음성을 더하려는 임직원까지, 고유하면서 특정 사용 사례에 맞춘 매력적인 오디오를 디자인할 기회는 이제 무한합니다.
윤리적 AI
음성 복제가 악용될 경우의 결과에 대한 우려를 불러일으키는 것처럼, AI 기술의 확산이 전문가들의 생계를 위협할 수 있다고 걱정하는 사람도 점점 늘고 있습니다. Eleven은 성우가 특정 용도의 음성 모델 학습을 위해 자신의 음성을 라이선스하고 그 대가로 보수를 받는 미래를 생각합니다. 고객과 스튜디오는 여전히 프로젝트에 전문 성우의 목소리를 기꺼이 활용할 것이며, AI는 더 빠른 작업 완료와 개발 초기의 실험 및 방향 설정에 있어 더 큰 자유를 제공할 뿐입니다. 이 기술은 음성 오디오를 디자인하고 녹음하는 방식을 바꾸겠지만, 성우가 더 이상 모든 세션에 직접 참석할 필요가 없다는 점은 한 번에 더 많은 프로젝트에 참여하고 자신의 목소리를 진정으로 영속시킬 자유를 제공합니다.
또한 저희가 기대하는 이유는, 기존에는 저자와 개발자가 녹음 비용을 감당할 수 없었던 수많은 도서, 뉴스, 독립 게임 및 기타 콘텐츠를 이제 다른 매체를 통해 접할 수 있게 되기 때문입니다. 이러한 접근성 향상은 각각의 콘텐츠가 더 넓은 독자와 청취자층을 만날 기회로 이어집니다.
Eleven은 지식 재산권을 존중하고 기술의 잠재적 악용을 방지하기 위한 안전장치를 구현하는 데 전적으로 힘쓰고 있습니다:
- 불법적이거나 유해하다고 판단될 수 있는 목적으로 기술을 악의적으로 사용하는 행위를 금지하는 이용약관을 준수하는 고객과만 협력합니다;
- 모델이 생성한 모든 오디오에 워터마크를 적용해 즉시 출처를 추적할 수 있도록 작업하고 있습니다;
- 식별 가능한 음성을 사용할 때는 시연 목적으로만 사용하며, 이해관계 충돌이 발생하지 않는 맥락에서 활용합니다;
- 동시에 음성 소유자와 라이선스 제공자가 권리를 주장할 수 있도록 지원하며, 알려진 모든 침해 사례를 검토하고 조치합니다.
앞으로의 계획 - 내 목소리 향상하기
앞으로는 음성 생성 모델과 음성 복제 모델의 기능을 결합해 사용자가 자신의 목소리를 향상할 수 있도록 할 계획입니다. 자신의 목소리를 복제한 뒤 원하는 효과를 내도록 조정할 수 있게 됩니다. 원래 말하기 스타일이 다소 단조롭다고 느낀다면, 더 다양한 변화를 줄 수 있습니다. 녹음되는 것이 정말 싫다면, 결과물을 더 자연스럽게 들리도록 조정할 수 있습니다. 사전 녹화 프레젠테이션이나 음성 메시지 등 어떤 목적이든 자신의 목소리가 담긴 오디오를 제작해야 하는 사람이라면, 버튼 클릭 한 번으로 도구 모음을 사용해 이를 실현할 수 있습니다.
새해 복 많이 받으세요
2022년이 저물어 가는 지금, 계속해서 참여해 주시고 피드백을 보내 주신 베타 사용자 여러분께 감사드립니다. 현재 개발 중인 많은 기능은 여러분의 의견과 제안에서 비롯되었습니다. 함께하게 되어 이보다 더 기쁠 수 없으며, 모두 새해 복 많이 받으시길 바랍니다.
Eleven Labs 베타
베타 플랫폼에 가입하고 직접 사용해 보려면 여기를 클릭하세요. 지속적으로 개선하고 있으며, 이 초기 단계에서 모든 사용자 인사이트는 Eleven에 매우 소중합니다.

.jpg&w=3840&q=80)


