콘텐츠로 건너뛰기

음성 변환

게시일
최종 업데이트

듣기이 글 오디오로 듣기

음성 변환이란 무엇인가요?

음성 변환을 사용하면 한 사람의 목소리를 다른 사람의 목소리로 바꿀 수 있습니다. 이를 위해 음성 복제라는 과정을 활용해 대상 음성, 즉 변환할 목소리를 인코딩하고, 원래 억양은 유지하면서 대상 화자의 정체성에 맞는 방식으로 동일한 메시지를 생성합니다.

활용 사례

고품질 음성 변환 및 음성 복제 기술은 다양한 산업에서 콘텐츠를 제작, 제공하고 상호작용하는 방식을 혁신할 잠재력이 있습니다. 제작 시간과 비용을 최적화하고, 변환 알고리즘 학습을 위해 자신의 목소리를 제공하는 사람에게는 지속적인 수익을 얻을 방법을 제공합니다.

  • 영화 제작에서는 배우가 촬영장이나 스튜디오로 이동하지 않고도 오디오 트랙을 만들 수 있도록 자신의 음성 데이터베이스를 제작자와 공유할 수 있습니다;
  • 잘못 말한 대사는 후반 작업에서 훨씬 효과적으로 다시 녹음할 수 있습니다;
  • 이 기술은 허구의 시나리오에서 역사적 인물의 목소리를 충실하게 재현하거나, 고인이 된 배우를 되살리는 데에도 활용할 수 있습니다;
  • 비디오 게임 개발에서도 비슷하게 유용합니다. 배우가 녹음을 위해 현장에 직접 उपस्थित하지 않아도 즉시 대사를 수정하거나 실험할 수 있습니다;
  • 의학 분야에서는 예를 들어 후두암 치료로 말하는 능력을 잃은 환자가 자신의 목소리로 다시 소통할 기회를 얻을 수 있습니다;
  • 가정의 사용자는 가상의 낯선 이보다 사랑하는 사람의 목소리와 상호작용하는 편이 더 자연스럽다고 느낄 수 있으므로, 가상 비서를 개인화할 수 있습니다;
  • 반대로 광고 업계는 사람의 목소리만큼 자연스럽지만 권리 소유와 로열티 문제를 피할 수 있는 합성 보이스오버를 도입해 혜택을 얻을 수 있습니다. 한편, 정확히 알아볼 수 있는 목소리가 필요하다면 광고 제작자는 긴 녹음 세션에 배우가 직접 참석하지 않아도, 동의를 바탕으로 특정 배우의 목소리를 복제하는 데 이 기술을 활용할 수 있습니다;
  • 오디오북과 팟캐스트 산업은 음성 복제 및 음성 변환 기술을 적용해 몰입감 있는 콘텐츠의 제작과 편집을 최적화할 수 있는, 성장 중인 산업의 두 가지 예에 불과합니다.

ElevenLabs 음성 변환

ElevenLabs는 도구 패키지의 일부로 음성 변환 소프트웨어를 개발하고 있지만, 음성 복제 및 음성 합성 연구는 주로 내년 초 출시 예정인 핵심 제품, 즉 화자 정체성을 보존하는 자동 더빙 도구 개발의 기반이 됩니다.

목표는 버튼 클릭 한 번으로 모든 음성 콘텐츠를 원래 화자의 목소리 그대로 다양한 언어로 이용할 수 있게 만드는 것입니다. 영어로 된 교육용 YouTube 동영상을 생각해 보세요. 누군가 스페인어만 구사한다면(언어만 알았다면 주제에 흥미를 느꼈을 텐데), 이는 문제가 됩니다. 물론 자막도 해결책이지만, 콘텐츠에 훨씬 더 몰입감 있고 즐겁게 참여할 수 있는 방법을 제공하는 것이 목표입니다. 실제로 그 사람이 스페인어를 전혀 못하더라도, 동일한 사람이 같은 메시지를 원어민 수준의 자연스러운 스페인어로 말하도록 생성하고자 합니다.

이를 위해 음성 복제를 사용해 화자의 정체성, 즉 목소리의 소리를 보존합니다. 다른 언어로 새로운 발화를 생성하여 같은 사람이 말하는 것처럼 들리게 합니다.

음성 변환은 최대한의 몰입감을 위해 화자의 감정, 의도, 전달 방식을 보존하고자 할 때 활용됩니다. 강력한 다국어 모델을 학습해 원본 언어의 발화를 분석하고, 적절한 억양을 적용해 대상 언어로 매핑합니다.

과정

한 사람의 목소리, 즉 원본 음성을 대상 음성으로 변환하려면 원본 음성의 콘텐츠를 대상 음성의 특성으로 표현하는 알고리즘이 필요합니다. 얼굴 바꾸기 앱을 떠올리면 이해하기 쉽습니다. 이런 앱은 자신의 얼굴과 다른 사람의 얼굴을 섞어 두 사람이 하나가 된 이미지를 만들 수 있게 해 줍니다.

이 과정에서는 얼굴 이미지를 վերց어 그 속성을 매핑합니다. 아래 예시의 점들이 바로 그런 역할을 합니다. 다른 얼굴의 특징이 렌더링될 범위를 나타냅니다.

음성 변환에서는 알고리즘이 대상 음성의 특성을 인코딩할 방법이 필요합니다. 알고리즘은 해당 음성의 수많은 예시로 구성된 데이터 세트로 학습됩니다. 그리고 이 샘플을 말하자면 음성의 "원자"와 같은 가장 기본적인 단위로 분해합니다. 음성은 문장으로 이루어지고, 문장은 단어로 구성됩니다. 단어는 음소로 이루어지며, 음소는 대상 음성의 특성을 나타냅니다. 음소는 알고리즘이 작동하는 가장 기본적인 단위입니다.

음성 변환의 핵심은 대상 음성의 음소를 사용해 원본 음성의 콘텐츠를 구현하는 것입니다. 하지만 얼굴 바꾸기 예시처럼 여기에도 절충점이 있습니다. 한 얼굴의 속성을 매핑하는 데 사용하는 기준점이 많을수록, 그 안에 매핑하는 얼굴에 더 많은 제약이 가해집니다. 기준점이 적으면 제약도 줄어듭니다. 음성 변환도 마찬가지입니다. 대상 음성에 더 큰 비중을 둘수록 원본 음성과 동기화되지 않을 위험이 커집니다. 반대로 대상 음성에 충분한 비중을 두지 않으면 그 음성만의 특징을 상당 부분 잃을 수 있습니다. 예를 들어 누군가가 화난 목소리로 소리치는 녹음을 Morgan Freeman의 목소리로 구현한다고 해 보겠습니다. 원본 음성의 감정에 너무 큰 비중을 두면 실제로 Morgan Freeman이 말하는 듯한 인상이 사라집니다. 그의 말투를 지나치게 강조하면 원본 음성의 감정적 강도가 사라집니다.

윤리

기술 오용 가능성에 대한 우려가 커지고 있는 만큼, 음성 복제를 둘러싼 윤리적 문제는 반드시 다뤄야 합니다. 2020년에는 사기꾼들이 전화로 CEO를 사칭한 오디오 딥페이크를 사용해 3,500만 달러의 은행 송금을 승인받았습니다. 누군가 실제로 하지 않은 말을 한 것처럼 그럴듯하게 만들 수 있는 기술은 허위 정보 유포, 명예훼손 또는 사기에 악용될 수 있다는 우려를 낳습니다. 마찬가지로 음성 변환이 음성 소유자의 동의 없이 생성된 콘텐츠로 사용자가 수익을 얻도록 한다면, 저작권 침해와 관련한 중요한 문제를 제기합니다.

ElevenLabs는 기술이 악의적인 목적으로 사용되지 않도록 할 수 있는 모든 노력을 기울이고, 그 위험으로부터 보호하기 위한 안전장치를 마련해야 한다고 생각합니다:

  • 허위 정보 유포, 명예훼손, 사기 또는 불법적이거나 유해하다고 간주될 수 있는 기타 목적으로 기술을 악의적으로 사용하는 것을 금지하는 이용약관을 준수하는 고객과만 협력합니다;
  • ElevenLabs가 제작한 합성 비디오 콘텐츠에는 AI로 생성되었음을 명확히 알리는 워터마크가 포함됩니다. 오디오 콘텐츠에는 명확한 파일 설명이 포함됩니다. 알아볼 수 있는 목소리를 사용할 때는 시연 목적이며 이해 충돌이 발생하지 않는 맥락에서만 사용합니다;
  • 동시에 음성 소유자와 라이선스 보유자가 자신의 권리를 주장할 수 있도록 지원하고자 합니다.
  • ElevenLabs의 입장을 개선할 방법에 대한 의견이 있다면 다음으로 알려주세요: ethics@elevenlabs.io

강력한 신기술에 대한 우리의 태도를 결정하는 가장 중요한 요인이 악용에 대한 두려움이어서는 안 된다고 믿습니다. 대신 기술이 더 넓은 공동체에 제공하는 잠재력을 최대한 활용하는 동시에, 피해 위험을 최소화할 수 있도록 개발 단계에서 적절한 안전장치를 도입하기 위해 노력해야 합니다.

미래

음성 변환과 음성 복제 기술은 영화 제작, 텔레비전, 콘텐츠 제작, 게임 개발, 팟캐스트와 오디오북은 물론 광고 산업까지 혁신할 잠재력이 있습니다. 하지만 그 활용 분야는 상업적 영역을 넘어 의학, 교육, 커뮤니케이션에도 이릅니다.

음성 복제는 전 세계 수백만 명에게 다가가고 완전히 새로운 경제를 만들기 위해, 모든 콘텐츠를 어떤 언어와 목소리로든 생성할 수 있는 미래를 열고 있습니다. ElevenLabs의 목표는 이 미래를 실현하는 데 기여하는 것입니다.

유사한 기사

최고 품질의 AI 오디오로 창작하세요