즉시 음성 복제

업계 최고 수준의 모델로 음성을 즉시 복제하는 방법을 알아보세요.

음성 복제 제품 기능

즉석 음성 복제 만들기

음성을 복제할 때는 AI가 어떤 언어와 어떤 유형의 데이터셋으로 학습되었는지 고려하는 것이 중요합니다. 각 모델과 그 강점에 관한 자세한 내용은 모델 페이지에서 확인하세요.

가이드

법적으로 허용되는 범위가 확실하지 않은 경우 서비스 약관과 AI 안전 정보를 참고하세요.

1

즉석 음성 복제 페이지로 이동

ElevenLabs 대시보드에서 왼쪽의 Voices 섹션을 선택한 다음 더하기 아이콘을 클릭하세요.

모달에서 Instant Voice Clone을 선택하세요.

2

오디오 업로드 또는 녹음

화면의 안내에 따라 오디오를 업로드하거나 녹음하세요.

3

음성 세부 정보 확인

음성 복제 IVC 모달

음성 복제본의 이름과 레이블을 지정하고, 해당 음성을 복제할 권리와 동의가 있음을 확인한 후 Save voice를 클릭하세요.

4

음성 복제본 사용

대시보드의 Voices 섹션에서 My Voices를 클릭한 다음 Use voice를 클릭해 사용을 시작하세요.

모범 사례

최소 1분 분량의 오디오 녹음

3분을 초과해 녹음하지 마세요. 개선 효과는 거의 없으며, 경우에 따라 복제 품질에 오히려 해로울 수 있습니다.

오디오를 어떻게 녹음했는지가 샘플의 총 길이(총 재생 시간)보다 더 중요합니다. 사용하는 샘플 수는 중요하지 않으며, 중요한 것은 합산된 총 길이(총 재생 시간)입니다.

리버브, 아티팩트 또는 어떤 종류의 배경 소음도 없는 선명한 오디오를 약 1~2분 사용하는 것이 좋습니다. 여기서 “오디오 또는 녹음 품질”이란 MP3나 WAV 같은 코덱을 뜻하는 것이 아니라 오디오를 캡처한 방식을 뜻합니다. 다만 오디오 코덱의 경우 128kbps 이상의 MP3 사용을 권장합니다. 더 높은 비트레이트는 복제 품질에 큰 영향을 주지 않습니다.

오디오의 일관성 유지

AI는 오디오에서 들리는 모든 것을 모방하려고 합니다. 여기에는 화자의 말하기 속도, 억양, 액센트, 음색, 호흡 패턴과 강도는 물론 노이즈와 입소리도 포함됩니다. 혼란을 줄 수 있는 노이즈와 아티팩트도 반영됩니다.

음성이 일관된 톤과 퍼포먼스를 유지하도록 하세요. 또한 모든 샘플에서 음성의 오디오 품질이 일관되게 유지되도록 하세요. 샘플을 하나만 사용하더라도 전체 샘플에 걸쳐 일관성을 유지해야 합니다. 음높이와 볼륨의 변동 폭이 큰 매우 역동적인 오디오를 AI에 입력하면 결과 예측성이 낮아집니다.

퍼포먼스 재현

또 하나 기억할 점은 AI가 제공한 음성의 퍼포먼스를 재현하려 한다는 것입니다. 감정 표현이 거의 없는 느리고 단조로운 목소리로 말하면 AI도 그렇게 모방합니다. 반대로 감정을 많이 담아 빠르게 말하면 AI는 그 방식을 재현하려고 합니다.

톤뿐 아니라 퍼포먼스 측면에서도 모든 샘플에서 음성이 일관되게 유지되는 것이 중요합니다. 편차가 너무 크면 AI가 혼란을 겪어 생성 결과 간 변동이 더 커질 수 있습니다.

적절한 볼륨 균형 찾기

오디오가 너무 작거나 크지 않도록 적절한 볼륨 균형을 맞추세요. 이상적인 수준은 실제 피크 -3dB 기준으로 -23dB~-18dB RMS입니다.

FAQ

2분 미만의 오디오로 음성을 빠르게 복제할 수 있는 인스턴트 음성 복제와 달리, 프로페셔널 음성 복제를 사용하면 더욱 사실적인 음성 모델을 학습할 수 있습니다. 대규모 음성 데이터로 전용 모델을 학습하여 원래 음성과 사실상 구분할 수 없는 모델을 만듭니다.

프로페셔널 음성 복제는 Finetune과 학습이 필요하므로 음성 복제를 사용하기까지 시간이 걸립니다. 앞선 대기열 인원과 기타 요인에 따라 달라 정확한 시간을 예측하기는 어렵지만, Finetune에는 보통 3~6시간이 걸립니다.

프로페셔널 음성 복제가 준비되면 이메일 알림을 받게 됩니다.

즉석 음성 복제는 다소 복잡할 수 있으며, 몇 가지 일반적인 가이드라인이 있습니다. 하지만 이는 어디까지나 가이드라인일 뿐입니다. 샘플 수나 길이에 대한 정해진 규칙은 없습니다. 30초짜리 샘플만 사용해도 뛰어난 결과를 얻은 사용자가 있는 반면, 10분 분량의 오디오를 사용하고도 결과가 좋지 않았던 사용자도 있었습니다. 다만 고려해야 할 사항이 몇 가지 있습니다.

  • 즉석 음성 복제에서 가장 중요한 요소는 오디오 품질입니다.
  • 샘플 수는 중요하지 않으며, 중요한 것은 총 재생 시간입니다. 2~3분이 넘는 오디오는 개선 효과가 거의 없고, 경우에 따라 복제 음성의 안정성에 오히려 부정적인 영향을 줄 수 있습니다.

인스턴트 음성 복제와 프로페셔널 음성 복제는 다양한 파일 형식을 지원합니다. 192kbps 이상의 MP3를 강력히 권장합니다.

권장 형식

  • MP3, 192kbps 이상

권장 길이

  • 인스턴트 음성 복제: 품질 좋은 오디오 1~2분
  • 프로페셔널 음성 복제: 품질 좋은 오디오 30~180분

WAV와 같은 무압축 형식은 일반적으로 복제 품질을 높이지 않으며 업로드 과정에서 문제가 발생할 수 있습니다. 대신 녹음 품질에 집중하세요. 배경 소음, 실내 잔향 또는 여러 화자가 없고, 음량과 톤이 일관되며, 긴 무음 구간이 없는 깨끗한 녹음을 사용하세요.

자세한 내용은 인스턴트 음성 복제(IVC) 및 프로페셔널 음성 복제(PVC)를 참고하세요.

ElevenLabs는 지식 재산권을 존중하고 기술의 잠재적 오용을 방지하기 위한 안전장치를 구현하는 데 모두 전념하고 있습니다.

  • 불법적이거나 유해하다고 간주될 수 있는 모든 목적을 위한 기술의 악의적 사용을 금지하는 서비스 약관 및 금지된 사용 정책을 준수하는 고객과만 협력합니다.
  • 보이스 소유자와 라이선스 제공자가 자신의 권리를 주장할 수 있도록 지원하며, 알려진 모든 침해 사례를 검토하고 조치를 취합니다.
  • 모델에서 생성된 모든 오디오는 생성 책임이 있는 사용자까지 즉시 추적할 수 있습니다.

개발 중인 기술은 새롭고 명확한 규제는 아직 도입되지 않았습니다. AI 연구소로서의 목표 중 하나는 이 기술의 존재와 잠재력, 그리고 한계에 대한 인식을 확산하는 것입니다.

자세한 가이드는 즉석 음성 복제 및 프로페셔널 음성 복제 문서를 참고하시기를 적극 권장합니다.

핵심은 다음과 같습니다. 일관된 고품질 입력 = 일관된 고품질 출력입니다.

길이

  • 즉석 음성 복제: 고품질 오디오 1~2분
  • 프로페셔널 음성 복제: 고품질 오디오 30~180분

찾을 수 있는 가장 좋은 품질의 선명한 오디오 클립을 사용하세요. 배경 소음이나 간섭 없이 화자가 한 명만 있어야 하며, 목소리는 크고 또렷해야 합니다.

길이를 늘리기 위해 품질이 제각각인 여러 클립을 사용하는 대신, 총 재생 시간을 늘리는 데 집중하기보다 마이크 품질이 확실히 높고 전체적으로 품질과 음색이 일관된 클립을 우선적으로 사용하세요.

클립의 대화 대부분이 가장 선호하는 화자의 말투와 억양에 맞도록 하세요. 원하는 음성 패턴에서 벗어난 대화 구간이 너무 많지 않도록 해야 합니다.

필요하다면 노이즈 제거 도구를 사용해 배경 소음을 줄이세요.

자세한 내용은 여기의 문서에서 확인할 수 있습니다.

네. Flash v2.5와 Multilingual v2에서 지원하는 모든 언어로 음성을 복제할 수 있습니다. 지원 언어 전체 목록은 여기에서 확인하세요.

AI가 지원하지 않는 언어를 말하는 음성도 복제할 수 있습니다. 복제된 음성이 화자의 음색을 담아낼 수는 있지만, 해당 언어를 구사할 수는 없으며 결과를 예측하기 어려울 수 있습니다. 이 방법은 권장하지 않습니다.

음성 복제를 독립 실행형 파일로 다운로드하거나 내보낼 수는 없습니다. 음성 복제는 ElevenLabs 계정에 유지됩니다.

ElevenLabs 웹사이트 외부에서도 ElevenLabs 음성을 사용할 수 있습니다. API 키를 사용하면 타사 서비스에서 ElevenLabs API를 호출하여 계정에 있는 음성으로 음성을 생성할 수 있습니다.

나중에 복제를 다시 만들고 싶다면, 생성에 사용한 원본 오디오 샘플을 보관하세요. 동일한 오디오를 사용하더라도 각 복제 음성은 조금씩 다르게 들립니다.

ElevenLabs는 두 가지 복제 옵션을 제공합니다.

  • 인스턴트 음성 복제: 약 1~3분의 오디오로 빠른 결과를 얻을 수 있습니다. 대부분의 음성에 잘 작동하지만, 흔하지 않은 억양이나 독특한 음성에서는 어려움을 겪을 수 있습니다.
  • 프로페셔널 음성 복제: 30분에서 약 3시간의 오디오를 사용하여 더 높은 충실도를 제공합니다. Finetune은 보통 3~6시간이 걸리며, 대기열에 음성이 많으면 더 오래 걸릴 수 있습니다.

인스턴트 음성 복제가 음성이나 억양을 잘 반영하지 못한다면 프로페셔널 음성 복제를 사용해 보세요.

복제를 만든 후에는 억양이나 톤을 변경할 수 없습니다. 결과를 개선하려면 사용하는 오디오 샘플을 바꾸세요. 샘플을 조금만 바꿔도 큰 차이가 날 수 있습니다.

프로페셔널 음성 복제(PVC)의 Finetune 과정이 완료되어 사용할 수 있게 되기 전에 사용하려 하면 이 오류가 표시됩니다.

PVC를 만들면 사용 가능해지기 전에 여러 과정을 거쳐야 합니다. 음성을 인증한 후 처리되고 Finetune 대기열에 추가됩니다. 현재 Finetune 대기열에 있는 다른 음성 수에 따라 다르지만, 이 과정은 보통 3~6시간이 걸리며 최대 24시간까지 걸릴 수 있습니다.

내 음성에서 음성 목록의 해당 음성을 찾은 다음 보기를 클릭하면 PVC의 진행 상황을 확인할 수 있습니다. 각 모델에 마우스를 올리면 현재 상태를 볼 수 있습니다.

각 상태의 의미에 관한 자세한 내용은 프로페셔널 음성 복제의 상태는 무엇을 의미하나요?를 참고하세요.

PVC의 Finetune이 완료되어 사용할 수 있게 되면 팝업 알림과 이메일로 안내해 드립니다.

No results