음성 복제
음성 복제
최고 수준의 모델을 사용해 음성을 복제하는 방법을 알아보세요.
개요
음성을 복제하는 방법에는 즉석 음성 복제와 프로페셔널 음성 복제라는 두 가지 주요 옵션이 있습니다. 즉석 음성 복제는 빠르고 간편하게 음성을 복제하는 방법이며, 프로페셔널 음성 복제는 더 정확하고 맞춤 설정이 가능한 옵션입니다.
즉석 음성 복제

즉석 음성 복제를 사용하면 짧은 샘플로 거의 즉시 음성 복제본을 만들 수 있습니다. 즉석 음성 복제(IVC)를 만들 때는 맞춤 AI 모델을 학습시키거나 생성하지 않습니다. 대신 정확한 음성을 학습하는 대신, 학습 데이터에서 얻은 사전 지식을 바탕으로 추론합니다.
이 방식은 많은 음성에서 매우 잘 작동합니다. 하지만 IVC의 가장 큰 한계는 매우 독특한 음성이나 AI가 학습 중 충분히 경험하지 못했을 수 있는 액센트가 있는 음성을 복제하려는 경우입니다. 이런 경우에는 명시적인 학습을 통해 맞춤 모델을 만드는 프로페셔널 음성 복제가 가장 적합할 수 있습니다.
프로페셔널 음성 복제

프로페셔널 음성 복제는 크리에이터 요금제 이상에서 사용할 수 있는 기능입니다. 프로페셔널 음성 복제를 사용하면 더 많은 음성 데이터로 전용 모델을 학습해 더욱 사실적인 음성 모델을 만들 수 있으며, 원본 음성과 사실상 구분할 수 없는 모델을 생성할 수 있습니다.
맞춤 모델은 Finetune과 학습이 필요하므로, PVC 학습에는 IVC보다 더 많은 시간이 걸립니다. 일반적으로 Finetune은 완료까지 3~6시간이 걸리지만, Finetune 대기열에 있는 다른 PVC 수에 따라 때때로 조금 더 오래 걸릴 수 있습니다.
초보자를 위한 오디오 녹음 가이드
오디오 녹음이 처음이라면 시작하는 데 도움이 될 몇 가지 팁을 확인하세요.
녹음 장소
오디오를 녹음할 때는 적절한 장소를 선택하고, 실내 에코/리버브를 최소화하도록 환경을 구성하세요. 즉, 공간을 최대한 “데드하게” 만들어야 합니다. 이를 위해 음향 처리가 된 보컬 부스가 만들어졌으며, 보컬 부스를 바로 사용할 수 없다면 DIY 보컬 부스, “담요 요새”, 또는 옷장 같은 방법을 시도해 볼 수 있습니다.
다음은 DIY 음향 처리 아이디어를 소개하는 YouTube 예시입니다.
마이크, 팝 필터 및 오디오 인터페이스
좋은 마이크는 매우 중요합니다. 마이크 가격은 $100에서 $10,000까지 다양하지만, 대부분의 보이스오버 작업에는 $150~$300의 전문 XLR 마이크면 충분합니다.
합리적인 가격으로 고품질 보이스오버 환경을 구성하려면 Focusrite 인터페이스와 Audio-Technica AT2020 또는 Rode NT1 microphone을 함께 사용하는 것을 고려해 보세요. $300~$500 수준의 이 구성은 자체 노이즈가 적어 깨끗한 결과물을 제공하며, 전문적인 용도에 적합한 고품질 녹음이 가능합니다.
녹음할 때 파열음과 호흡, 공기가 다이어프램/마이크에 직접 닿는 것을 방지하려면 마이크 앞에 적절한 팝 필터를 설치하세요. 그렇지 않으면 소리가 좋지 않고 복제 과정에도 문제가 생길 수 있습니다.
디지털 오디오 워크스테이션(DAW)
오디오를 녹음하는 다양한 녹음 솔루션이 있습니다. 하지만 모두 같은 수준은 아닙니다. 최소 24비트 비트레이트로 44.1kHz 또는 48kHz WAV 파일을 녹음할 수 있다면 괜찮습니다. 오디오 녹음은 단순하게 유지해야 하므로, 복잡한 후처리, 플러그인, 노이즈 제거 도구 등은 필요하지 않습니다.
추천이 필요하다면 뛰어난 유연성을 제공하는 훌륭한 DAW인 REAPER를 제안합니다. 다양한 오디오 작업에서 업계 표준으로 사용됩니다. 또 다른 좋은 무료 옵션으로는 Audacity가 있습니다.
디지털 왜곡과 과도한 노이즈를 피하려면 최적의 녹음 레벨을 유지하세요. 너무 크거나 너무 작으면 안 됩니다. 보이스오버 작업에서는 노이즈 플로어를 최소화하면서 선명도를 유지하기 위해 피크 -6dB~-3dB, 평균 음량 -18dB를 목표로 하세요. 프로젝트와 녹음 환경에 따라 최상의 결과를 얻을 수 있도록 면밀히 모니터링하고 필요에 따라 레벨을 조정하세요.
위치
유용한 지침 중 하나는 마이크와 약 두 주먹 거리, 즉 약 20cm(7~8인치)를 유지하고, 자신과 마이크 사이에 팝 필터를 두는 것입니다. 어떤 사람들은 팝 필터를 맨 뒤로 배치해 팝 필터에 바짝 붙을 수 있도록 합니다. 이렇게 하면 마이크와의 거리를 더 쉽게 일정하게 유지할 수 있습니다.
마이크에 직접 숨을 내쉬거나 파열음을 내지 않기 위한 또 다른 일반적인 기법은 각도를 두고 말하는 것입니다. 각도를 두고 말하면 내쉰 공기가 마이크에 직접 닿을 가능성이 줄고, 대신 마이크 옆으로 지나갑니다.
퍼포먼스
녹음 세션 전체에서 제공하는 퍼포먼스는 가장 중요한 요소 중 하나입니다. AI는 매우 높은 수준의 역량으로 음성의 모든 특징을 복제하려고 합니다. 즉, 말의 리듬, 음색, 퍼포먼스 스타일, 쉼의 길이, 말을 더듬는지, 깊게 숨 쉬는지, 숨소리가 섞이는지, “음”이나 “어” 같은 추임새를 많이 쓰는지까지 재현하려고 합니다. 심지어 그런 특징도 복제할 수 있습니다. 따라서 오디오 파일에는 복제하고 싶은 퍼포먼스와 음성만 정확히 담겨야 합니다. 그렇기 때문에 목표로 하는 음색에 맞는 대본을 찾는 것도 매우 중요합니다.
AI용 녹음에서는 일관성을 유지하는 것이 매우 중요합니다. 음성을 녹음한다면 처음부터 끝까지 매우 생동감 있게 유지하거나, 처음부터 끝까지 매우 차분하게 유지하세요. 두 방식을 섞으면 AI가 음성의 어느 부분을 복제해야 할지 알 수 없어 불안정해질 수 있습니다. 액센트도 마찬가지로 녹음 전체에서 동일하게 유지하세요. 올바른 복제본을 만들기 위한 핵심은 일관성입니다!






