Eleven v4를 소개합니다역대 가장 감성적인 모델, Eleven v4를 만나보세요. 10월 12일까지 Creator+에 크레딧 3배 제공

콘텐츠로 건너뛰기

ElevenLabs로 내 목소리 복제하기: 완벽 가이드

작성자
Jack Limebear
게시일
최종 업데이트

듣기이 글 오디오로 듣기

똑같은 목소리는 없습니다. 목소리는 타고난 특성과 환경의 영향을 받고, 오랜 세월 표현을 거치며 다듬어집니다. 지극히 개인적인 것입니다.

최근까지는 그런 고유성을 복제할 수 없었습니다. 하지만 AI의 발전으로 놀라울 정도로 정밀하게 목소리를 복제할 수 있게 되었습니다. 단 몇 분 분량의 오디오만으로도 AI 시스템은 원본과 매우 흡사하게 들리는 음성을 생성할 수 있습니다.

이 가이드에서는 ElevenLabs로 목소리를 복제하는 방법을 자세히 알려드립니다. 녹음할 내용, 즉시 음성 복제와 프로페셔널 음성 복제 중 선택하는 방법, 그리고 완성된 복제 음성을 활용하는 방법을 다룹니다. 두 방식 모두 따라 할 수 있는 단계별 상세 가이드를 준비했습니다.

요약

  • ElevenLabs는 즉시 음성 복제와 프로페셔널 음성 복제 서비스를 제공합니다.
  • 즉시 음성 복제에는 깨끗하고 일관된 몇 분 분량의 오디오가 필요합니다.
  • 프로페셔널 음성 복제에는 최대 3시간의 음성 데이터가 필요합니다.
  • 복제 음성을 만든 후에는 다른 ElevenLabs 제품과 연결할 수 있습니다.
  • 음성을 복제하려면 명시적인 동의가 필요합니다. ElevenLabs에서는 이 서비스를 사용하기 전에 동의를 확인해야 합니다.

즉시 복제와 프로페셔널 음성 복제: 어떤 것이 필요할까요?

ElevenLabs는 선택할 수 있는 두 가지 음성 복제 방식을 제공합니다. 

즉시 복제는 단 몇 분 만에 사용할 수 있는 음성을 제공하므로 복제 음성을 빠르게 실용적으로 활용할 수 있습니다. 프로페셔널 음성 복제는 시간이 더 걸리지만 매우 높은 충실도의 모델을 만들어 냅니다.

나에게 가장 적합한 옵션을 선택할 수 있도록 빠른 참고 가이드를 소개합니다.

Instant Voice Cloning
Training time
Near-instant
Audio input required
1-3 minutes
Quality
Excellent for the vast majority of voices
Best for
Testing, iteration, content creators, quick projects
ElevenLabs plan required
Free and above
Professional Voice Cloning
Training time
Fine-tuning can take up to 6 hours, with some use cases reaching over 24 hours
Audio input required
30 minutes minimum, 2-3 hours recommended
Quality
Virtually indistinguishable from the original
Best for
Voice actors and professionals; long-form production; unique accents
ElevenLabs plan required
Creator plan and above

두 방식의 차이를 이해하면 처음부터 시간을 절약하고 빠르게 시작할 수 있습니다.

ElevenLabs로 목소리를 복제하기 전에 필요한 것

ElevenLabs의 프로페셔널 또는 즉시 음성 복제 중 어느 쪽을 선택하든, 준비해 두면 유용한 몇 가지 기본 사항이 있습니다. 특히 즉시 복제에서는 필수는 아니지만, 복제 품질에 큰 차이를 만들 수 있습니다.

녹음을 시작하기 전에 고려할 몇 가지 사항을 소개합니다.

  • 오디오 품질 요구 사항: 전문 녹음용 마이크를 사용하면 큰 차이가 납니다. 최소 요구 사항은 44.1kHz 또는 48kHz, 최소 24비트 비트레이트로 WAV 파일을 녹음할 수 있는 환경입니다. WAV 파일을 지원하는 디지털 오디오 워크스테이션(DAW)에서 조용한 장소를 골라 녹음하세요. Audacity는 무료로 사용할 수 있는 좋은 선택지입니다.
  • 최소 샘플 길이: 얼마나 많은 오디오 데이터를 제공해야 하는지 확인하세요. 중요한 것은 파일 개수가 아니라 합산된 전체 재생 시간입니다. 프로페셔널 음성 복제의 경우 가능한 3시간에 가깝게 파일을 업로드하세요.
  • 말할 내용: ElevenCreative의 음성 복제는 제공한 목소리를 재현하는 것을 목표로 합니다. 느리고 단조로운 목소리로 읽으면 녹음에도 그런 특성이 반영됩니다. 감정과 속도에 변화를 주어 자연스럽게 말하세요. ElevenLabs는 프로페셔널 음성 복제용 기본 스크립트를 제공합니다.

몇 분만 더 투자해 이러한 사항을 미리 준비하면 최종 음성 복제 품질을 높일 수 있습니다.

ElevenLabs로 즉시 음성 복제 만들기

몇 분의 시간이 있고 조용한 장소에 있다면 목소리를 복제할 준비가 되었습니다. ElevenCreative는 자연스러운 언어의 감정적 톤과 운율을 유지하면서 32개 이상의 언어로 활용할 수 있는 디지털 음성 복제본을 만듭니다. 

ElevenLabs 즉시 음성 복제를 사용하는 방법은 다음과 같습니다.

  1. Voices 열기
  2. 샘플 업로드
  3. 음성 이름 지정 및 저장
  4. 스크립트로 테스트
  5. 안정성 및 유사성 설정 조정

각 단계를 자세히 살펴보겠습니다.

1단계: Voices에서 즉시 음성 복제 페이지로 이동

먼저 ElevenLabs 대시보드에 로그인하세요. 왼쪽 사이드바에서 Voices를 선택한 다음 더하기 아이콘을 클릭합니다.

화면에 아래와 같은 팝업이 표시되며, 몇 가지 옵션을 선택할 수 있습니다.

모듈에서 즉시 음성 복제를 선택하면 해당 페이지로 이동합니다.

Voice creation interface with options for designing, cloning, remixing, and selecting voices.

2단계: 샘플 업로드

화면의 안내에 따라 미리 녹음한 오디오 파일을 업로드하거나 브라우저에서 직접 녹음하세요. 이 단계에서는 여러 파일을 엔진에 업로드할 수 있습니다. ElevenLabs는 음성 복제 시 개별 파일 길이가 아닌 합산된 전체 재생 시간을 사용합니다.

Voice cloning interface for uploading or recording audio, emphasizing quality and consistency.

작업에 사용할 수 있도록 깨끗하고 일관된 오디오를 최소 1~2분 제공하는 것이 좋습니다.

시끄러운 환경 피하기, 마이크 품질 확인, 모든 녹음에서 같은 장비 사용 등 모범 사례도 확인할 수 있습니다.

3단계: 음성 이름 지정 및 저장

음성을 녹음한 후 ElevenLabs가 음성 복제 합성을 시작합니다. 이 단계에서 음성을 미리 들어 보고 소리를 확인한 뒤 이름을 지정할 수 있습니다.

언어, 억양, 성별, 연령 라벨 등 복제 음성 정보에 다른 세부 사항도 추가할 수 있습니다. 이 음성을 분류하거나 나중에 기억하는 데 도움이 될 정보를 설명란에 입력할 수 있습니다. 

Voice cloning interface for uploading and describing audio samples.

마지막으로 동의 내용을 읽고 수락했음을 확인하려면 동의 확인란을 클릭해야 합니다. 자신의 음성이든 다른 사람의 음성이든, 작업 중인 음성을 복제하려면 반드시 동의를 받아야 합니다.

4단계: 즉시 음성 복제 테스트

음성을 만든 후 My Voices로 이동해 Use voice를 클릭하면 텍스트 음성 변환 플레이그라운드에서 복제 음성을 사용할 수 있습니다. 복제 음성이 말할 짧은 스크립트를 작성하세요. 제대로 테스트하려면 학습 오디오에 포함하지 않았던 내용을 작성해야 합니다.

음성 복제를 선택하고 텍스트를 작성한 후 페이지 하단의 Generate speech를 누르면 음성이 생성됩니다.

ElevenLabs interface showing text-to-speech settings with a skeleton joke entered.

5단계: 모델 조정 및 반복

음성 복제를 들어 봤는데 어딘가 자연스럽지 않다고 느껴도 처음부터 다시 시작할 필요는 없습니다. ElevenLabs는 최종 오디오 결과물을 구성할 수 있는 다양한 설정 슬라이더를 제공합니다.

화면 오른쪽의 다음 컨트롤을 조절해 보며 음성 복제에 어떤 영향을 미치는지 확인하세요.

  • 안정성: 안정성이 높을수록 일관되고 예측 가능한 음성이 생성됩니다. 값을 낮추면 표현력은 높아질 수 있지만 다소 일관성이 떨어질 수 있습니다. 대부분의 사용 사례에서는 중간 범위 설정이 가장 적합합니다.
  • 유사성: 음성 복제가 제공한 음성 샘플을 얼마나 가깝게 따르는지 정의합니다. 이 슬라이더를 높이면 음성이 본인 목소리처럼 느껴지는 데 도움이 됩니다. 왜곡이 들린다면 이 슬라이더를 낮추세요.
  • 스타일: 학습 오디오의 표현력을 강화하고 싶으신가요? 이 슬라이더를 높이세요. 다만 값이 너무 높으면 최종 샘플이 왜곡될 수 있습니다.

이 슬라이더 값을 조정한 후 Generate speech를 다시 눌러 모델이 어떻게 달라지는지 확인하세요. 

이 5단계를 마치면 바로 사용할 수 있는 ElevenLabs 음성 복제가 완성됩니다.

원본
음성 복제
Lily
Lily
원본
Lily
Lily
복제
Chris
Chris
원본
Chris
Chris
복제
Laura
Laura
원본
Laura
Laura
복제
본인과 똑같이 들리는 음성 복제본을 만들어보세요.

ElevenLabs로 프로페셔널 음성 복제 만들기

ElevenLabs로 전문적으로 목소리를 복제하는 데는 즉시 복제보다 시간이 더 걸리지만, 목소리를 매우 정확하게 재현하는 모델을 얻을 수 있습니다. 

크리에이터 요금제 이상을 사용 중이라면 다음 단계에 따라 ElevenLabs로 프로페셔널 음성 복제를 만들 수 있습니다.

  1. Voices 열기
  2. 오디오 업로드
  3. 샘플 길이 피드백 확인
  4. 품질 향상을 위한 오디오 샘플 처리
  5. 보안을 위한 본인 음성 인증
  6. 음성 미세 조정 과정 대기
  7. 음성 복제 사용

각 단계를 자세히 살펴보겠습니다.

1단계: Voices에서 프로페셔널 음성 복제 페이지로 이동

ElevenLabs 대시보드에 로그인한 후 왼쪽 사이드바에서 Voices를 선택하고 Create Voice를 클릭하세요. 팝업에서 이전과 같은 옵션을 볼 수 있습니다.

이번에는 Professional Voice Clone을 선택하세요. 다음을 포함한 다양한 권장 사항이 표시됩니다.

  • 팝 필터 사용
  • 녹음에서 노이즈 제거
  • 음향 처리가 된 공간에서 녹음
  • 오디오 사전 처리
  • 처음부터 끝까지 일관된 볼륨 유지
  • 최소 30분, 이상적으로는 3시간에 가까운 오디오 제공

2단계: 오디오 업로드

Upload samples를 클릭하고 미리 녹음한 오디오 파일을 추가하세요. 직접 녹음하여 소프트웨어에 바로 업로드할 수도 있습니다. 광고, 내레이션, 대화형 모델링 등 다양한 용도로 사용할 수 있는 여러 스크립트를 제공합니다.

Professional Voice Clone interface for uploading and describing audio samples.

이 오디오 파일은 말하는 목소리만 포함해야 합니다. 현재 노래는 입력 또는 출력 소스로 지원하지 않습니다. 

3단계: 샘플 길이 피드백 확인

오디오를 성공적으로 업로드한 후 길이에 관한 피드백을 반드시 확인하세요. 즉시 음성 복제에는 1~2분이면 충분하지만, 이 서비스에는 1~3시간의 오디오를 업로드하는 것을 권장합니다.

다양한 감정이 담긴 오디오 파일을 포함하세요. 모델이 최대한 좋은 정보를 활용할 수 있도록 스튜디오 수준의 다양한 콘텐츠를 제공하는 것이 좋습니다.

Professional Voice Clone interface showing voice sample upload and configuration options.

4단계: 품질 향상을 위한 오디오 샘플 처리

프로페셔널 음성 복제 플랫폼에서 오디오 샘플의 품질을 직접 개선할 수 있습니다. 배경 소음 제거부터 화자 분리까지, ElevenLabs는 고품질 오디오 입력을 만드는 데 도움을 줍니다.

필수 단계는 아니지만, 최종 음성 복제 모델의 품질을 높여 주므로 유용합니다.

Audio settings panel with options for noise removal and speaker separation. Save or cancel changes.

5단계: 보안을 위한 본인 음성 인증

ElevenLabs는 프로페셔널 음성 복제를 만들 때 인증을 요구합니다. 모든 파일을 업로드하면 인터페이스에서 짧은 클립을 직접 녹음하도록 요청합니다. 가능하면 학습 녹음과 같은 마이크와 공간 설정을 사용하고, 톤과 전달 스타일도 최대한 맞추세요.

인증에 실패하면 24시간 후에 다시 시도할 수 있습니다. 그전에 시작해야 한다면 ElevenLabs 지원팀에 직접 문의해 도움을 받으세요. 

6단계: 음성 미세 조정 과정 대기

음성을 인증하면 ElevenLabs가 모델 미세 조정을 시작합니다. 일반적으로 3~6시간이 걸리지만, 앞서 대기 중인 다른 프로페셔널 음성 복제가 많으면 더 오래 걸릴 수 있습니다.

복제 상태를 확인하려면 My Voices로 이동하세요. 음성 모델을 사용할 준비가 되면 알림도 보내드립니다.

7단계: 음성 복제 사용

축하합니다. 이제 완전하게 작동하는 전문가급 음성 복제가 준비되었습니다. 완성된 모델은 My Voices에 표시되며, 텍스트 음성 변환, Studio, 더빙 및 API, 음성 에이전트 등 다른 모든 ElevenLabs 제품에서 사용할 수 있습니다.

시작하려면 음성 선택기 대시보드에서 제작 과정에서 지정한 이름으로 음성을 선택하세요.

ElevenLabs 음성 복제 모범 사례

위의 즉시 또는 프로페셔널 음성 복제 단계를 따르면 복제 음성을 만들 수 있지만, 그 전에 추가로 따를 수 있는 몇 가지 단계가 있습니다. 다음 팁은 녹음 도구나 전략을 조금 조정해 음성 복제 품질을 높이는 방법입니다.

다음 AI 음성 복제 모범 사례는 즉시 및 프로페셔널 복제 모두에 적용됩니다.

  • 실내 음향과 배경 소음: 오디오가 얼마나 깨끗한지가 최종 품질에 직접적인 영향을 줍니다. 배경 소음이나 울림이 없는 곳에서 녹음하세요. 전문 녹음에는 녹음 부스가 적합합니다. 스튜디오를 예약하지 않고도 그런 품질을 원한다면, 지역 코워킹 스페이스에 방음 부스가 있는지 확인해 보세요.
  • 마이크 거리: 말할 때 마이크와 주먹 두 개 정도의 거리를 두는 것이 좋습니다. 좋은 기준이지만, 자세한 내용은 마이크 사양도 확인하세요.
  • 감정 표현 범위를 샘플에 담기: AI 모델은 목소리의 자연스러운 운율과 음성 특성을 활용합니다. 표현이 밋밋하면 모델도 같은 부족한 전달력을 보일 수 있습니다. 다양한 상황에서 자연스러운 말하기 스타일을 보여 주는 폭넓은 감정 샘플을 포함해 최대한 풍부하게 녹음하세요. 
  • 문장 다양성 vs. 스크립트 낭독: 스크립트를 소리 내어 읽는 것은 긴 샘플을 제공하는 유용한 시작점이지만, 연습한 듯 부자연스럽게 들릴 수 있습니다. 특히 처음 읽는 스크립트라면 문장에 필요한 감정적 뉘앙스를 정확히 표현하지 못할 수 있습니다. 적절한 균형을 맞추려면 서로 다른 스크립트 구절을 좀 더 대화하듯 전달해 보세요. 

이 모범 사례를 따르면 ElevenLabs가 활용할 수 있는 더 높은 품질의 입력을 제공할 수 있습니다. 이를 바탕으로 고유한 음성 정체성을 더 정확하게 반영하는 음성 복제를 만들 수 있습니다. 

ElevenLabs 음성 복제는 어떻게 사용할 수 있나요?

ElevenLabs로 프로페셔널 또는 즉시 음성 복제를 만든 후에는 My Voices에 음성이 표시됩니다. 여기에서 다른 모든 ElevenLabs 제품으로 음성에 액세스할 수 있습니다.

ElevenLabs 음성 복제를 사용할 수 있는 곳은 다음과 같습니다.

  • 앱 내 텍스트 음성 변환: ElevenLabs 텍스트 음성 변환 플레이그라운드에서는 음성을 선택하고 입력란에 입력한 내용을 읽도록 할 수 있습니다. 보이스오버나 팟캐스트 인트로처럼 일회성 음성 생성에 사용할 수 있습니다. 음성이 최대한 자연스럽게 들리도록 실시간 설정에서 스타일, 유사성, 안정성을 조정하세요.
  • API를 통해: List Voices API 엔드포인트를 사용하면 API 호출에서 사용할 수 있는 모든 음성 목록을 반환할 수 있습니다. 모든 음성에는 고유한 voice ID가 있으며, ElevenAPI를 연결하는 곳 어디에서나 이를 구현해 사용할 수 있습니다. 
  • 음성 에이전트에서: ElevenLabs 음성 복제를 에이전트에 연결하면 에이전트가 말할 때 내 목소리를 사용하도록 할 수 있습니다. 여러 플랫폼에서 일관된 음성 존재감을 원하는 기업이라면 에이전트에 브랜드화된 접근 방식을 만드는 데 도움이 됩니다. 
  • 여러 언어에서: 음성 복제는 32개 언어에서 작동하므로 콘텐츠를 번역하고 내 목소리로 제작할 수 있습니다. 해당 언어의 음성 샘플이 없어도 ElevenCreative는 여러 언어에서 말의 운율과 감정적 특성을 가깝게 재현합니다. 

모든 제품에 활용하면 목소리에 생명을 불어넣고 고품질 콘텐츠를 대규모로 제작할 준비가 됩니다.

ElevenCreative로 목소리 복제하기

비디오 제작을 가속하려는 콘텐츠 크리에이터든, 단순히 자신의 목소리를 보존하려는 경우든 ElevenLabs 음성 복제는 간단하고 빠르며 효과적입니다. 

즉시 음성 복제는 무료 요금제에서 이용할 수 있으며 몇 분밖에 걸리지 않습니다. 크리에이터 요금제에서는 프로페셔널 음성 복제를 시작할 수 있습니다. ElevenLabs의 음성 복제에 대해 자세히 알아보거나 가입하여 지금 목소리를 복제하세요.

자주 묻는 질문

작성자

Jack Limebear는 Growth 팀에서 블로그와 인사이트 페이지의 콘텐츠 작가이자 전략가로 활동하고 있습니다. ElevenLabs에 합류하기 전에는 빠르게 성장하는 SaaS 스타트업부터 포춘 500대 기업까지 다양한 조직에서 10년 넘게 콘텐츠 전략을 이끌었습니다. 케임브리지 대학교에서 영문학 석사 학위를 취득했습니다.

유사한 기사

최고 품질의 AI 오디오로 창작하세요