음성 복제

최고 수준의 모델을 사용해 음성을 복제하는 방법을 알아보세요.

개요

음성을 복제하는 방법에는 즉석 음성 복제와 프로페셔널 음성 복제라는 두 가지 주요 옵션이 있습니다. 즉석 음성 복제는 빠르고 간편하게 음성을 복제하는 방법이며, 프로페셔널 음성 복제는 더 정확하고 맞춤 설정이 가능한 옵션입니다.

즉석 음성 복제

즉석 음성
복제

즉석 음성 복제를 사용하면 짧은 샘플로 거의 즉시 음성 복제본을 만들 수 있습니다. 즉석 음성 복제(IVC)를 만들 때는 맞춤 AI 모델을 학습시키거나 생성하지 않습니다. 대신 정확한 음성을 학습하는 대신, 학습 데이터에서 얻은 사전 지식을 바탕으로 추론합니다.

이 방식은 많은 음성에서 매우 잘 작동합니다. 하지만 IVC의 가장 큰 한계는 매우 독특한 음성이나 AI가 학습 중 충분히 경험하지 못했을 수 있는 액센트가 있는 음성을 복제하려는 경우입니다. 이런 경우에는 명시적인 학습을 통해 맞춤 모델을 만드는 프로페셔널 음성 복제가 가장 적합할 수 있습니다.

프로페셔널 음성 복제

프로페셔널 음성
복제

프로페셔널 음성 복제는 크리에이터 요금제 이상에서 사용할 수 있는 기능입니다. 프로페셔널 음성 복제를 사용하면 더 많은 음성 데이터로 전용 모델을 학습해 더욱 사실적인 음성 모델을 만들 수 있으며, 원본 음성과 사실상 구분할 수 없는 모델을 생성할 수 있습니다.

맞춤 모델은 Finetune과 학습이 필요하므로, PVC 학습에는 IVC보다 더 많은 시간이 걸립니다. 일반적으로 Finetune은 완료까지 3~6시간이 걸리지만, Finetune 대기열에 있는 다른 PVC 수에 따라 때때로 조금 더 오래 걸릴 수 있습니다.

초보자를 위한 오디오 녹음 가이드

오디오 녹음이 처음이라면 시작하는 데 도움이 될 몇 가지 팁을 확인하세요.

녹음 장소

오디오를 녹음할 때는 적절한 장소를 선택하고, 실내 에코/리버브를 최소화하도록 환경을 구성하세요. 즉, 공간을 최대한 “데드하게” 만들어야 합니다. 이를 위해 음향 처리가 된 보컬 부스가 만들어졌으며, 보컬 부스를 바로 사용할 수 없다면 DIY 보컬 부스, “담요 요새”, 또는 옷장 같은 방법을 시도해 볼 수 있습니다.

다음은 DIY 음향 처리 아이디어를 소개하는 YouTube 예시입니다.

마이크, 팝 필터 및 오디오 인터페이스

좋은 마이크는 매우 중요합니다. 마이크 가격은 $100에서 $10,000까지 다양하지만, 대부분의 보이스오버 작업에는 $150~$300의 전문 XLR 마이크면 충분합니다.

합리적인 가격으로 고품질 보이스오버 환경을 구성하려면 Focusrite 인터페이스와 Audio-Technica AT2020 또는 Rode NT1 microphone을 함께 사용하는 것을 고려해 보세요. $300~$500 수준의 이 구성은 자체 노이즈가 적어 깨끗한 결과물을 제공하며, 전문적인 용도에 적합한 고품질 녹음이 가능합니다.

녹음할 때 파열음과 호흡, 공기가 다이어프램/마이크에 직접 닿는 것을 방지하려면 마이크 앞에 적절한 팝 필터를 설치하세요. 그렇지 않으면 소리가 좋지 않고 복제 과정에도 문제가 생길 수 있습니다.

디지털 오디오 워크스테이션(DAW)

오디오를 녹음하는 다양한 녹음 솔루션이 있습니다. 하지만 모두 같은 수준은 아닙니다. 최소 24비트 비트레이트로 44.1kHz 또는 48kHz WAV 파일을 녹음할 수 있다면 괜찮습니다. 오디오 녹음은 단순하게 유지해야 하므로, 복잡한 후처리, 플러그인, 노이즈 제거 도구 등은 필요하지 않습니다.

추천이 필요하다면 뛰어난 유연성을 제공하는 훌륭한 DAW인 REAPER를 제안합니다. 다양한 오디오 작업에서 업계 표준으로 사용됩니다. 또 다른 좋은 무료 옵션으로는 Audacity가 있습니다.

디지털 왜곡과 과도한 노이즈를 피하려면 최적의 녹음 레벨을 유지하세요. 너무 크거나 너무 작으면 안 됩니다. 보이스오버 작업에서는 노이즈 플로어를 최소화하면서 선명도를 유지하기 위해 피크 -6dB~-3dB, 평균 음량 -18dB를 목표로 하세요. 프로젝트와 녹음 환경에 따라 최상의 결과를 얻을 수 있도록 면밀히 모니터링하고 필요에 따라 레벨을 조정하세요.

위치

유용한 지침 중 하나는 마이크와 약 두 주먹 거리, 즉 약 20cm(7~8인치)를 유지하고, 자신과 마이크 사이에 팝 필터를 두는 것입니다. 어떤 사람들은 팝 필터를 맨 뒤로 배치해 팝 필터에 바짝 붙을 수 있도록 합니다. 이렇게 하면 마이크와의 거리를 더 쉽게 일정하게 유지할 수 있습니다.

마이크에 직접 숨을 내쉬거나 파열음을 내지 않기 위한 또 다른 일반적인 기법은 각도를 두고 말하는 것입니다. 각도를 두고 말하면 내쉰 공기가 마이크에 직접 닿을 가능성이 줄고, 대신 마이크 옆으로 지나갑니다.

퍼포먼스

녹음 세션 전체에서 제공하는 퍼포먼스는 가장 중요한 요소 중 하나입니다. AI는 매우 높은 수준의 역량으로 음성의 모든 특징을 복제하려고 합니다. 즉, 말의 리듬, 음색, 퍼포먼스 스타일, 쉼의 길이, 말을 더듬는지, 깊게 숨 쉬는지, 숨소리가 섞이는지, “음”이나 “어” 같은 추임새를 많이 쓰는지까지 재현하려고 합니다. 심지어 그런 특징도 복제할 수 있습니다. 따라서 오디오 파일에는 복제하고 싶은 퍼포먼스와 음성만 정확히 담겨야 합니다. 그렇기 때문에 목표로 하는 음색에 맞는 대본을 찾는 것도 매우 중요합니다.

AI용 녹음에서는 일관성을 유지하는 것이 매우 중요합니다. 음성을 녹음한다면 처음부터 끝까지 매우 생동감 있게 유지하거나, 처음부터 끝까지 매우 차분하게 유지하세요. 두 방식을 섞으면 AI가 음성의 어느 부분을 복제해야 할지 알 수 없어 불안정해질 수 있습니다. 액센트도 마찬가지로 녹음 전체에서 동일하게 유지하세요. 올바른 복제본을 만들기 위한 핵심은 일관성입니다!

FAQ

2분 미만의 오디오로 음성을 빠르게 복제할 수 있는 인스턴트 음성 복제와 달리, 프로페셔널 음성 복제를 사용하면 더욱 사실적인 음성 모델을 학습할 수 있습니다. 대규모 음성 데이터로 전용 모델을 학습하여 원래 음성과 사실상 구분할 수 없는 모델을 만듭니다.

프로페셔널 음성 복제는 Finetune과 학습이 필요하므로 음성 복제를 사용하기까지 시간이 걸립니다. 앞선 대기열 인원과 기타 요인에 따라 달라 정확한 시간을 예측하기는 어렵지만, Finetune에는 보통 3~6시간이 걸립니다.

프로페셔널 음성 복제가 준비되면 이메일 알림을 받게 됩니다.

인스턴트 음성 복제와 프로페셔널 음성 복제는 다양한 파일 형식을 지원합니다. 192kbps 이상의 MP3를 강력히 권장합니다.

권장 형식

  • MP3, 192kbps 이상

권장 길이

  • 인스턴트 음성 복제: 품질 좋은 오디오 1~2분
  • 프로페셔널 음성 복제: 품질 좋은 오디오 30~180분

WAV와 같은 무압축 형식은 일반적으로 복제 품질을 높이지 않으며 업로드 과정에서 문제가 발생할 수 있습니다. 대신 녹음 품질에 집중하세요. 배경 소음, 실내 잔향 또는 여러 화자가 없고, 음량과 톤이 일관되며, 긴 무음 구간이 없는 깨끗한 녹음을 사용하세요.

자세한 내용은 인스턴트 음성 복제(IVC) 및 프로페셔널 음성 복제(PVC)를 참고하세요.

ElevenLabs는 두 가지 복제 옵션을 제공합니다.

  • 인스턴트 음성 복제: 약 1~3분의 오디오로 빠른 결과를 얻을 수 있습니다. 대부분의 음성에 잘 작동하지만, 흔하지 않은 억양이나 독특한 음성에서는 어려움을 겪을 수 있습니다.
  • 프로페셔널 음성 복제: 30분에서 약 3시간의 오디오를 사용하여 더 높은 충실도를 제공합니다. Finetune은 보통 3~6시간이 걸리며, 대기열에 음성이 많으면 더 오래 걸릴 수 있습니다.

인스턴트 음성 복제가 음성이나 억양을 잘 반영하지 못한다면 프로페셔널 음성 복제를 사용해 보세요.

복제를 만든 후에는 억양이나 톤을 변경할 수 없습니다. 결과를 개선하려면 사용하는 오디오 샘플을 바꾸세요. 샘플을 조금만 바꿔도 큰 차이가 날 수 있습니다.

ElevenLabs는 지식 재산권을 존중하고 기술의 잠재적 오용을 방지하기 위한 안전장치를 구현하는 데 모두 전념하고 있습니다.

  • 불법적이거나 유해하다고 간주될 수 있는 모든 목적을 위한 기술의 악의적 사용을 금지하는 서비스 약관 및 금지된 사용 정책을 준수하는 고객과만 협력합니다.
  • 보이스 소유자와 라이선스 제공자가 자신의 권리를 주장할 수 있도록 지원하며, 알려진 모든 침해 사례를 검토하고 조치를 취합니다.
  • 모델에서 생성된 모든 오디오는 생성 책임이 있는 사용자까지 즉시 추적할 수 있습니다.

개발 중인 기술은 새롭고 명확한 규제는 아직 도입되지 않았습니다. AI 연구소로서의 목표 중 하나는 이 기술의 존재와 잠재력, 그리고 한계에 대한 인식을 확산하는 것입니다.

음성 복제를 독립 실행형 파일로 다운로드하거나 내보낼 수는 없습니다. 음성 복제는 ElevenLabs 계정에 유지됩니다.

ElevenLabs 웹사이트 외부에서도 ElevenLabs 음성을 사용할 수 있습니다. API 키를 사용하면 타사 서비스에서 ElevenLabs API를 호출하여 계정에 있는 음성으로 음성을 생성할 수 있습니다.

나중에 복제를 다시 만들고 싶다면, 생성에 사용한 원본 오디오 샘플을 보관하세요. 동일한 오디오를 사용하더라도 각 복제 음성은 조금씩 다르게 들립니다.

자세한 가이드는 즉석 음성 복제 및 프로페셔널 음성 복제 문서를 참고하시기를 적극 권장합니다.

핵심은 다음과 같습니다. 일관된 고품질 입력 = 일관된 고품질 출력입니다.

길이

  • 즉석 음성 복제: 고품질 오디오 1~2분
  • 프로페셔널 음성 복제: 고품질 오디오 30~180분

찾을 수 있는 가장 좋은 품질의 선명한 오디오 클립을 사용하세요. 배경 소음이나 간섭 없이 화자가 한 명만 있어야 하며, 목소리는 크고 또렷해야 합니다.

길이를 늘리기 위해 품질이 제각각인 여러 클립을 사용하는 대신, 총 재생 시간을 늘리는 데 집중하기보다 마이크 품질이 확실히 높고 전체적으로 품질과 음색이 일관된 클립을 우선적으로 사용하세요.

클립의 대화 대부분이 가장 선호하는 화자의 말투와 억양에 맞도록 하세요. 원하는 음성 패턴에서 벗어난 대화 구간이 너무 많지 않도록 해야 합니다.

필요하다면 노이즈 제거 도구를 사용해 배경 소음을 줄이세요.

자세한 내용은 여기의 문서에서 확인할 수 있습니다.

네. Flash v2.5와 Multilingual v2에서 지원하는 모든 언어로 음성을 복제할 수 있습니다. 지원 언어 전체 목록은 여기에서 확인하세요.

AI가 지원하지 않는 언어를 말하는 음성도 복제할 수 있습니다. 복제된 음성이 화자의 음색을 담아낼 수는 있지만, 해당 언어를 구사할 수는 없으며 결과를 예측하기 어려울 수 있습니다. 이 방법은 권장하지 않습니다.

아니요. 자신의 음성으로만 프로페셔널 음성 복제를 만들 수 있습니다. 상대방의 동의가 있더라도 다른 사람의 음성을 복제할 수 없습니다. 모든 프로페셔널 음성 복제에는 해당 음성이 본인의 것인지 확인하는 인증 절차가 필요합니다.

다른 사람이 자신의 음성을 공유하고 싶다면, 본인 계정에서 프로페셔널 음성 복제를 생성하고 인증한 다음 공유 링크를 사용해 비공개로 공유할 수 있습니다. 자세한 내용은 다음 문서를 참고하세요. 음성을 공유하려면 어떻게 하나요?

죄송하지만, 삭제할 수 없습니다. 프로페셔널 음성 복제(PVC) 설정 과정에서 안내된 것처럼, 인증 단계로 진행하면 음성을 인증할 때까지 변경할 수 없습니다.

프로페셔널 음성 복제와 관련해 도움이 필요하면 support@elevenlabs.io로 이메일을 보내 지원팀에 문의하세요.

모든 프로페셔널 음성 복제(PVC)는 Flash v2.5, Turbo v2.5 및 Multilingual v2 모델에서 자동으로 학습됩니다. 영어 오디오로 학습된 PVC는 Flash v2 및 Turbo v2 모델에서도 자동으로 학습됩니다.

기존 PVC가 있다면 이제 추가 모델에서 파인튜닝할 수 있습니다. 향후 파인튜닝을 지원하는 새 모델이 출시되면 알림을 받게 됩니다. 이 알림은 음성 목록의 내 음성.에서 음성 오른쪽에 표시되는 느낌표 아이콘으로 확인할 수 있습니다. 이 아이콘에 마우스를 올리면 알림이 표시됩니다.

파인튜닝을 시작하려면 내 음성, 목록에서 음성 이름에 마우스를 올리세요. 사용 가능한 모든 모델이 표시됩니다. 이미 해당 음성이 파인튜닝된 모델에는 체크 아이콘이 표시되고, 파인튜닝할 수 있는 모델에는 더하기 아이콘이 표시됩니다. 파인튜닝을 시작하려면 모델을 클릭하세요. 

음성이 파인튜닝되는 동안 모델 이름에 마우스를 올리면 진행 상황을 확인할 수 있습니다. 음성 캐싱으로 인해 최신 진행 상황을 확인하려면 페이지를 새로고침해야 할 수 있습니다. 파인튜닝이 완료되면 앱 내 알림과 이메일로 알려드립니다.

프로페셔널 음성 복제(PVC) 슬롯 수는 구독 등급에 따라 다릅니다.


기본 PVC 슬롯
  • 무료 및 스타터 플랜: PVC 슬롯 없음
  • 크리에이터, 프로 및 기존 스케일 플랜: PVC 슬롯 1개
  • 스케일 및 기존 비즈니스 플랜: PVC 슬롯 3개
  • 비즈니스 플랜: PVC 슬롯 10개
  • 엔터프라이즈 플랜: 맞춤형 PVC 슬롯 수

추가 PVC 슬롯

보이스 라이브러리에 공유한 프로페셔널 음성 복제가 스튜디오 품질로 선정되면 추가 PVC 슬롯을 받을 수 있습니다.

  • 스튜디오 품질 검토는 보이스 라이브러리에 공유한 음성에만 적용됩니다
  • 음성이 보이스 라이브러리에 등록된 후 스튜디오 품질 검토가 자동으로 진행됩니다. 즉시 완료되지는 않습니다
  • 공유한 PVC가 스튜디오 품질로 선정되면 추가 PVC 슬롯을 자동으로 받습니다
  • 여러 공유 음성이 스튜디오 품질로 선정되면 이 과정이 여러 번 발생할 수 있습니다
  • 다음 중 하나를 충족하지 않으면 PVC를 더 만들 수 없습니다.
    • 보이스 라이브러리에 공유한 음성이 스튜디오 품질 검토를 통과해 추가 슬롯을 획득
    • 스케일 이상으로 업그레이드
중요 참고 사항
  • 프로페셔널 음성 복제는 자신의 음성을 복제하는 데만 사용할 수 있습니다
  • 크리에이터 등급 미만으로 다운그레이드하면 PVC는 계정에 남아 있지만, 크리에이터 이상으로 업그레이드할 때까지 사용할 수 없습니다
  • PVC를 포함해 만들 수 있는 맞춤 음성의 총수는 구독 등급에 따라 다릅니다

즉석 음성 복제는 다소 복잡할 수 있으며, 몇 가지 일반적인 가이드라인이 있습니다. 하지만 이는 어디까지나 가이드라인일 뿐입니다. 샘플 수나 길이에 대한 정해진 규칙은 없습니다. 30초짜리 샘플만 사용해도 뛰어난 결과를 얻은 사용자가 있는 반면, 10분 분량의 오디오를 사용하고도 결과가 좋지 않았던 사용자도 있었습니다. 다만 고려해야 할 사항이 몇 가지 있습니다.

  • 즉석 음성 복제에서 가장 중요한 요소는 오디오 품질입니다.
  • 샘플 수는 중요하지 않으며, 중요한 것은 총 재생 시간입니다. 2~3분이 넘는 오디오는 개선 효과가 거의 없고, 경우에 따라 복제 음성의 안정성에 오히려 부정적인 영향을 줄 수 있습니다.

음성을 인증한 후 사용하려면 모델에서 파인튜닝을 거쳐야 합니다. 이 과정이 진행되는 동안 내 음성에서 음성 이름에 마우스를 올려 음성 상태를 확인할 수 있습니다. 그러면 해당 음성에 사용 가능한 모든 모델이 표시됩니다. 각 모델의 상태를 확인하려면 모델 이름에 마우스를 올리세요. 

문제가 발생한 경우 다음 상태가 표시될 수 있습니다.

학습 실행 중 문제가 발생하여 재시도되었습니다. 추가 조치는 필요하지 않습니다. 이는 문제가 발생했지만 음성이 파인튜닝 프로세스를 다시 시도하도록 자동으로 대기열에 추가되었음을 의미합니다. 다음 시도에서 파인튜닝이 성공적으로 완료될 가능성이 높지만, 여러 번 실패한다면 AI가 해결할 수 없는 데이터 세트 문제일 수 있습니다.

음성을 삭제하고 처음부터 데이터를 다시 업로드해 문제를 해결해 볼 수 있습니다. 이 방법은 일부 사용자에게 도움이 된 것으로 확인되었습니다.

그래도 문제가 해결되지 않으면 학습용 오디오를 검토하고 다른 학습용 오디오를 사용해야 할 수 있습니다.

파인튜닝 과정에서 실패가 발생하면 언제든 support@elevenlabs.io로 이메일을 보내 지원팀에 문의할 수 있습니다.

프로페셔널 음성 복제를 만드는 동안 모든 인증 시도에 실패했다면 24시간 후에 다시 시도할 수 있습니다.

support@elevenlabs.io로 이메일을 보내 지원팀에 문의할 수도 있습니다. 지원팀에서 확인한 후 문제가 없으면 인증 시도를 초기화하여 다시 진행할 수 있도록 도와드립니다.

프로페셔널 음성 복제를 성공적으로 인증하는 데 도움이 되는 권장 사항은 다음과 같습니다.

  • 웹 브라우저에서 마이크 사용이 허용되어 있고 음소거 상태가 아닌지 확인하세요.
  • 컴퓨터 마이크로 녹음한 오디오가 배경 소음이나 기타 외부 오디오 간섭 없이 복제용으로 업로드한 오디오와 유사하게 들리는지 확인하세요.
  • 음성 학습에 사용한 오디오와 비슷한 스타일로 말해 보세요.
  • 각 인증 문장을 한 번만 읽은 후 중지를 눌러 녹음을 멈추세요. 문장을 두 번 이상 읽으면 인증 과정이 실패할 수 있습니다.

프로페셔널 음성 복제(PVC)의 Finetune 과정이 완료되어 사용할 수 있게 되기 전에 사용하려 하면 이 오류가 표시됩니다.

PVC를 만들면 사용 가능해지기 전에 여러 과정을 거쳐야 합니다. 음성을 인증한 후 처리되고 Finetune 대기열에 추가됩니다. 현재 Finetune 대기열에 있는 다른 음성 수에 따라 다르지만, 이 과정은 보통 3~6시간이 걸리며 최대 24시간까지 걸릴 수 있습니다.

내 음성에서 음성 목록의 해당 음성을 찾은 다음 보기를 클릭하면 PVC의 진행 상황을 확인할 수 있습니다. 각 모델에 마우스를 올리면 현재 상태를 볼 수 있습니다.

각 상태의 의미에 관한 자세한 내용은 프로페셔널 음성 복제의 상태는 무엇을 의미하나요?를 참고하세요.

PVC의 Finetune이 완료되어 사용할 수 있게 되면 팝업 알림과 이메일로 안내해 드립니다.

프로페셔널 음성 복제는 처리되는 동안 몇 가지 단계를 거칩니다. 이 단계는 내 음성에서 프로페셔널 음성 복제에 표시되는 상태에 반영됩니다.

현재 상태를 보려면 목록에서 음성을 찾아 오른쪽에 표시된 아이콘을 확인하세요.

초안: 이 상태는 음성 생성이 완료되지 않았음을 의미합니다. 일반적으로 음성 생성을 완료하지 않았거나 아직 음성을 인증하지 않았기 때문입니다.

인증 과정을 진행하려면 체크 아이콘을 클릭하세요.

음성 생성 과정으로 돌아가려면 추가 작업(점 3개)을 클릭하고 음성 편집을 선택하세요.

음성을 인증한 후에는 사용하기 전에 ElevenLabs 모델에서 Finetune을 거쳐야 합니다. 내 음성에서 음성 이름에 마우스를 올리면 이 과정을 추적할 수 있습니다. 여기에서 사용 가능한 모든 모델과 각 모델의 상태를 나타내는 아이콘을 확인할 수 있습니다.

자세한 정보는 모델 이름에 마우스를 올려 확인하세요. 다음 중 하나가 표시됩니다.

학습 실행이 예약되었습니다: 음성 학습을 위한 자리가 날 때까지 대기 중임을 의미합니다. 음성이 대기열에 머무는 시간은 대기열에 있는 다른 음성 수에 따라 달라집니다.

데이터세트 생성 중 및 Finetune 실행 중: 자리가 나면 Finetune 과정이 시작됩니다. 이 과정은 6~24시간이 걸릴 수 있습니다. 각 학습 단계가 얼마나 진행되었는지 백분율로 확인할 수 있습니다.

학습 실행 중 문제가 발생하여 다시 시도했습니다. 추가 조치는 필요하지 않습니다.

문제가 발생했지만 음성이 Finetune 과정을 다시 시도하도록 자동으로 대기열에 추가되었음을 의미합니다. 다음 시도에서는 Finetune이 정상적으로 완료될 가능성이 높지만, 여러 번 실패한다면 support@elevenlabs.io로 이메일을 보내 지원팀에 문의하세요.

이 모델에서 음성을 사용할 준비가 되었습니다: 이 모델의 Finetune 과정이 완료되어 이제 이 모델에서 음성을 사용할 수 있음을 의미합니다.

Finetune을 시작하려면 클릭하세요: 일부 모델은 자동으로 학습되지 않으므로 Finetune을 시작하려면 모델 이름을 클릭해야 합니다. 음성에 사용할 수 있는 추가 Finetune 모델이 생기면 음성 옆에 느낌표 아이콘이 표시됩니다.

Finetune 과정을 시작하려면 음성 이름에 마우스를 올리고 모델 이름을 클릭하세요.

프로페셔널 음성 복제는 Eleven v4 모델 제품군에서 제공하는 모든 언어, 총 90개 이상의 언어를 지원합니다.

Eleven v4 모델 제품군은 다음을 포함한 90개 이상의 언어를 지원합니다.

아프리칸스어 (afr), 암하라어 (amh), 아랍어 (ara), 아르메니아어 (hye), 아삼어 (asm), 아스투리아스어 (ast), 아제르바이잔어 (aze), 벨라루스어 (bel), 벵골어 (ben), 보스니아어 (bos), 불가리아어 (bul), 버마어 (mya), 광둥어 (yue), 카탈루냐어 (cat), 세부아노어 (ceb), 크로아티아어 (hrv), 체코어 (ces), 덴마크어 (dan), 네덜란드어 (nld), 영어 (eng), 에스토니아어 (est), 필리핀어 (fil), 핀란드어 (fin), 프랑스어 (fra), 풀라어/풀라르어 (ful), 갈리시아어 (glg), 조지아어 (kat), 독일어 (deu), 그리스어 (ell), 구자라트어 (guj), 하우사어 (hau), 히브리어 (heb), 힌디어 (hin), 헝가리어 (hun), 아이슬란드어 (isl), 인도네시아어 (ind), 이탈리아어 (ita), 일본어 (jpn), 자바어 (jav), 캄바어 (kam), 칸나다어 (kan), 카자흐어 (kaz), 한국어 (kor), 키르기스어 (kir), 라오어 (lao), 라트비아어 (lav), 링갈라어 (lin), 리투아니아어 (lit), 루간다어 (lug), 룩셈부르크어 (ltz), 마케도니아어 (mkd), 말레이어 (msa), 말라얄람어 (mal), 몰타어 (mlt), 중국어 표준어 (cmn), 마오리어 (mri), 마라티어 (mar), 몽골어 (mon), 네팔어 (nep), 노르웨이어 보크몰 (nob), 오크어 (oci), 오디아어 (ori), 파슈토어 (pus), 페르시아어 (fas), 폴란드어 (pol), 포르투갈어, 브라질 (por), 펀자브어 (pan), 루마니아어 (ron), 러시아어 (rus), 세르비아어 (srp), 쇼나어 (sna), 신드어 (snd), 슬로바키아어 (slk), 슬로베니아어 (slv), 소말리어 (som), 소라니 쿠르드어 (ckb), 스페인어, 라틴아메리카 (spa), 스와힐리어 (swa), 스웨덴어 (swe), 타지크어 (tgk), 타밀어 (tam), 텔루구어 (tel), 태국어 (tha), 터키어 (tur), 우크라이나어 (ukr), 우르두어 (urd), 우즈베크어 (uzb), 베트남어 (vie), 웨일스어 (cym), 월로프어 (wol), 줄루어 (zul).

프로페셔널 음성 복제는 특정 화자의 대규모 음성 데이터로 모델을 학습(Finetune)하여 맞춤형 모델을 만드는 과정입니다.

샘플을 업로드하고 음성을 인증하면 프로페셔널 음성 복제가 대기열에 추가됩니다. 예상 학습 시간은 약 3~6시간입니다. 몇 가지 요인에 따라 달라 정확한 시간을 안내하기는 어렵습니다. 경우에 따라 더 오래 걸릴 수도 있습니다.

내 음성에서 음성의 현재 상태를 확인할 수 있습니다. 자세한 내용은 프로페셔널 음성 복제의 상태는 무엇을 의미하나요?를 참고하세요.

PVC의 Finetune 과정이 완료되면 음성을 사용할 준비가 되었다는 인앱 및 이메일 알림을 받게 됩니다.

No results