보이스 디자인
보이스 디자인
텍스트 프롬프트로 음성을 만드는 방법을 안내합니다.
개요
보이스 디자인은 보이스 라이브러리에서 원하는 음성을 정확히 찾을 수 없을 때 제작자가 그 공백을 채울 수 있도록 돕습니다. 프로젝트에 적합한 음성을 찾을 수 없다면 직접 만들 수 있습니다. 보이스 디자인은 빠른 탐색과 반복 작업에 가장 적합하며, 출력 품질은 프롬프트와 사용 사례에 따라 달라질 수 있습니다. 가장 일관되고 프로덕션에 바로 사용할 수 있는 품질이 필요하다면, 현재 플랫폼에서 가장 높은 품질의 음성은 프로페셔널 음성 복제(PVC)입니다. 따라서 라이브러리에 필요에 맞는 PVC가 있다면 이를 사용하는 것을 권장합니다.
ElevenLabs 앱에서 Voices -> My Voices -> Add a new voice -> Voice Design으로 이동하거나 API를 통해 보이스 디자인을 찾을 수 있습니다.
생성을 누르면 3가지 음성 옵션이 생성됩니다. 보이스 디자인 사용 시에는 미리 보기 텍스트 생성에 필요한 크레딧만 청구되며, 3개의 샘플을 생성하더라도 한 번만 청구됩니다. 차감될 문자 수는 “Text to preview” 텍스트 상자에서 확인할 수 있습니다.
생성 후에는 결과 중 하나를 선택해 저장할 수 있으며, 이는 음성 슬롯 하나를 사용합니다.
프롬프트 가이드
프롬프트는 음성의 기반입니다. 프롬프트는 억양과 캐릭터 유형부터 음성의 성별과 분위기까지, 만들고자 하는 음성의 종류를 모델에 알려 줍니다. 잘 만든 프롬프트는 평범한 음성과 비전에 꼭 맞는 음성의 차이를 만듭니다. 일반적으로 더 자세하고 세분화된 프롬프트일수록 더 정확하고 섬세한 결과를 얻을 수 있습니다. 나이, 성별, 톤, 억양, 속도, 감정, 스타일 등을 포함해 자세한 정보를 제공할수록 모델은 의도에 맞게 맞춤화된 느낌의 음성을 더 잘 해석하고 생성할 수 있습니다.
하지만 특히 중립적이거나 폭넓게 활용할 수 있는 음성을 원할 때는 짧고 간단한 프롬프트도 효과적일 수 있습니다. 예를 들어 매우 구체적인 캐릭터나 스타일을 만들려는 것이 아니라면, “차분한 남성 내레이터”만으로도 자세한 설명 없이 필요한 결과를 얻을 수 있습니다. 적절한 세부 수준은 사용 사례에 따라 다릅니다. 판타지 캐릭터를 만들고 있나요? 가상 비서인가요? 건조한 유머 감각을 지닌 60대 뉴욕 여성인가요? 프롬프트에서 이를 명확하게 정의할수록 출력은 상상한 모습에 더 가까워집니다.
권장 프롬프트 형식
일관된 결과를 위해 다음 형식으로 프롬프트를 구성하세요.
예시:
Native Spanish, español europeo (sin rasgos de español latinoamericano). Female, 35–40. Ok quality. Persona: operadora de soporte confiable. Emotion: reassuring, attentive, confident. Smooth, natural timbre with gentle intonation, forward proximity, and a noise-free signal. Delivers updates at a relaxed pace with clear emphasis on helpful information, projecting empathy and professionalism.
피해야 할 일반적인 실수
- 억양을 의미할 때 “accent”를 사용하지 마세요 — 원치 않는 방언 변화가 발생할 수 있습니다. 대신 억양, 강조 또는 전달 패턴을 설명하세요.
- FX 단어는 피하세요 — “reverb”, “echo”, “phone”, “tape” 같은 용어는 출력 품질에 부정적인 영향을 줄 수 있습니다.
- 언어와 방언을 명확히 지정하세요 — 변화가 생기지 않도록 첫 문장에 언어와 지역별 변형을 항상 명시하세요.
오디오 품질
오디오 품질은 생성된 음성의 선명도, 깨끗함, 전반적인 충실도를 의미합니다. 기본적으로 ElevenLabs는 깨끗하고 자연스럽게 들리는 오디오를 생성하지만, 프로젝트에 특정 수준의 품질이 필요하다면 프롬프트에 명시하는 것이 좋습니다.
고품질 결과를 위해 음성 설명에 “완벽한 오디오 품질” 또는 “스튜디오 품질 녹음” 같은 문구를 추가해 모델을 도울 수 있습니다. 이렇게 하면 최대한 선명하고 왜곡은 최소화하며 완성도 높게 음성이 렌더링되도록 할 수 있습니다.
일관된 결과를 제공하는 구체적인 품질 설명도 사용할 수 있습니다.
- 보통 품질
- 좋은 품질
- 매우 좋은 품질
- 뛰어난 품질
- 스튜디오 품질
- 방송 품질
이러한 설명을 프롬프트에 포함하면 최고 수준의 오디오 품질을 얻는 데 도움이 됩니다.
음성이 매우 구체적이거나 특수한 경우, 이러한 유형의 문구를 포함하면 전반적인 프롬프트 정확도가 낮아질 수 있습니다.
오래된 전화 통화, 라디오 방송 또는 발견 영상 같은 효과를 재현할 때처럼 낮은 오디오 품질이 의도적인 창의적 사례도 있을 수 있습니다. 이런 상황에서는 품질 설명을 완전히 제외하거나 다음과 같은 문구를 명시적으로 포함하세요.
- “낮은 충실도의 오디오”
- “낮은 오디오 품질”
- “음성사서함처럼 들림”
- “오래된 테이프 레코더처럼 먹먹하고 멀리서 들림”
이 문구는 프롬프트의 처음이나 끝 어디에든 자유롭게 배치할 수 있으며, 두 위치 모두에서 잘 작동하는 것으로 확인되었습니다.
연령, 톤/음색 및 성별
이 세 가지 특성은 음성 디자인의 기반으로, 음성의 전반적인 정체성과 감정적 울림을 결정합니다. 세부 정보를 더 많이 제공할수록 AI가 창의적인 비전에 맞는 음성을 더 쉽게 만들 수 있습니다. 사실적인 캐릭터를 만들거나, 매력적인 내레이터를 구성하거나, 가상 비서를 디자인할 때 모두 마찬가지입니다.
연령
음성에서 느껴지는 연령을 설명하면 성숙도, 음성 질감, 에너지를 정의하는 데 도움이 됩니다. 적절한 음질을 구현하도록 AI를 안내하려면 구체적인 용어를 사용하세요.
유용한 설명 표현:
- “사춘기 남성” / “사춘기 여성”
- “젊은 성인” / “20대” / “30대 초반”
- “중년 남성” / “40대 여성”
- “노인 남성” / “나이 든 여성” / “80대 남성”
톤/음색
피치, 공명, 음성 질감으로 형성되는 음성의 물리적 특성을 말합니다. 감정 표현이나 태도와는 다릅니다.
일반적인 톤/음색 설명 표현:
- “깊은” / “낮은 피치의”
- “부드러운” / “풍부한”
- “걸걸한” / “쉰”
- “콧소리가 나는” / “날카로운”
- “공기 섞인” / “숨소리 섞인”
- “웅장한” / “울림이 있는”
- “가벼운” / “얇은”
- “따뜻한” / “부드러운”
- “쇳소리가 나는” / “금속성의”
성별
성별은 흔히 피치, 음성의 무게감, 음색의 존재감에 영향을 줍니다. 하지만 정체성 대신 소리를 묘사하면 단순한 범주를 넘어설 수 있습니다.
예시:
- “낮은 피치의 허스키한 여성 목소리”
- “깊고 울림 있는 남성적인 남성 목소리”
- “성별이 중립적이며 부드럽고 중간 피치인 목소리”
억양
억양은 음성의 지역적, 문화적, 감정적 정체성을 정의하는 데 중요한 역할을 합니다. 사실성을 기반으로 하든 캐릭터를 위해 스타일화하든, 프로젝트에 진정성 있는 소리가 필요하다면 원하는 억양을 명확하고 의도적으로 설명하는 것이 필수입니다.
표현 선택은 중요합니다. 특정 용어는 더 일관된 결과를 내는 경향이 있습니다. 예를 들어 억양의 두드러짐을 설명할 때는 “강한”보다 “짙은”이 더 좋은 결과를 내는 경우가 많습니다. 시행착오가 필요한 부분이므로, 다양한 표현을 실험하고 최대한 창의적이고 자세하게 묘사해 보세요.
“accent”라는 단어를 사용할 때는 주의하세요. 지역 방언이 아닌 억양이나 강조 패턴을 의미한다면 해당 용어를 대신 사용하세요. 억양을 의미하면서 “accent”를 사용하면 원치 않는 방언 변화가 발생할 수 있습니다.
- 명확한 억양 프롬프트 예시:
- “짙은 프랑스 억양을 가진 중년 남성”
- “약간의 미국 남부 억양을 지닌 젊은 여성”
- “강한 동유럽 억양을 가진 노인 남성”
- “또렷한 영국 억양으로 말하는 쾌활한 여성”
- “부드러운 아일랜드식 억양이 있는 젊은 남성”
- “중립적인 미국 억양을 지닌 권위 있는 목소리”
- “느긋하고 콧소리가 나는 지역적 호주 억양의 남성”
“외국식”이나 “이국적인”처럼 지나치게 모호한 설명은 피하세요. 부정확하며 일관되지 않은 결과를 낼 수 있습니다.
더 정교하게 제어하려면 억양을 톤, 연령, 속도 같은 다른 특성과 함께 사용하세요. 예: “짙은 뉴욕 억양으로 천천히 말하는, 빈정대는 노년 여성.”
판타지 또는 가상 음성에는 실제 억양을 영감으로 제안할 수 있습니다.
- “제대로 된 짙은 영국 억양을 가진 엘프. 위엄 있고 서정적이다.”
- “쉰 동유럽 억양을 가진 고블린.”
속도
속도는 음성이 말하는 속력과 리듬을 의미합니다. 음성의 개성, 감정적 톤, 명료함을 형성하는 핵심 요소입니다. 특히 스토리텔링, 광고, 캐릭터 대사, 교육 콘텐츠처럼 특정 용도에 맞는 음성을 디자인할 때는 속도를 명확히 지정하는 것이 중요합니다.
음성이 얼마나 빠르거나 느리게 말해야 하는지 명확한 언어로 설명하세요. 속도가 어떻게 느껴지는지도 묘사할 수 있습니다. 일정한지, 불규칙한지, 신중한지, 경쾌한지 등을 설명해 보세요. 속도가 바뀐다면 어디서, 왜 바뀌는지 반드시 표시하세요.
속도 설명 표현 예시:
- “빠르게 말하는” / “빠른 속도로”
- “보통 속도로” / “평소처럼 말하는”
- “천천히 말하는” / “느린 리듬으로”
- “신중하고 절제된 속도”
- “각 단어를 음미하듯 길게 끄는”
- “급한 일이 있는 것처럼 서두르는 리듬으로”
- “편안하고 대화체 같은 속도”
- “리드미컬하고 음악적인 속도”
- “갑작스러운 멈춤과 폭발적인 구간이 있는 불규칙한 속도”
- “단어 사이의 간격이 일정한 균일한 속도”
- “스타카토식 표현”
미리 듣기용 텍스트
좋은 음성 프롬프트를 작성한 후에는 해당 음성을 미리 듣는 데 사용하는 텍스트가 실제 음성의 소리를 결정하는 데 중요한 역할을 합니다. 미리 듣기 텍스트는 연기 대본처럼 작동하며, 음성이 맞추려는 톤, 속도, 감정 표현을 설정합니다.
최상의 결과를 얻으려면 미리 듣기 텍스트가 음성 설명을 보완해야 하며, 모순되어서는 안 됩니다. 예를 들어 프롬프트가 “약간의 일본 억양이 있는 차분하고 사색적인 젊은 여성 목소리”를 설명하는데 “이봐! 네가 이 엉망인 곳에 해 놓은 짓은 정말 못 참겠어!!!” 같은 문장을 사용하면 의도와 충돌합니다. 모델은 이러한 불일치를 조정하려 하며, 그 결과 부자연스럽거나 일관되지 않은 결과가 나오는 경우가 많습니다.
대신 음성이 의도한 개성과 감정적 톤을 반영하는 샘플 텍스트를 사용하세요. 위 예시라면 “요즘은 조용하네요… 생각할 시간이 있었고, 어쩌면 그게 내게 가장 필요했던 일이었는지도 모르겠어요.”와 같은 문장이 프롬프트를 뒷받침하고 더 자연스럽고 일관된 음성을 생성하는 데 도움이 됩니다.
또한 더 긴 미리 듣기 텍스트가 더 안정적이고 표현력 있는 결과를 내는 경향이 있습니다. 특히 톤이나 속도처럼 미묘한 특성을 테스트할 때 짧은 문구는 다소 갑작스럽거나 일관되지 않게 들릴 수 있습니다. 모델에 문장 전체 또는 짧은 단락처럼 더 많은 맥락을 제공하면 음성을 더 매끄럽고 정확하게 구현할 수 있습니다.
파라미터
음량
텍스트 미리 듣기 생성의 볼륨과 저장 후 음성의 볼륨을 제어합니다.
가이던스 스케일
프롬프트를 얼마나 충실히 따를지 결정합니다. 값이 높을수록 프롬프트를 더 엄격하게 따르지만, 프롬프트가 매우 특수한 경우 오디오 품질이 낮아질 수 있습니다. 반면 값이 낮을수록 프롬프트 정확도는 떨어지지만 모델이 더 창의적으로 생성할 수 있습니다. 프롬프트를 완벽히 구현하는 것보다 전반적인 표현과 오디오 품질이 더 중요하다면 낮은 값을 사용하세요. 억양이나 톤의 정확성이 매우 중요할 때는 높은 값을 권장합니다.
속성 및 예시
이러한 설명 표현을 작성하는 방식을 다양하게 실험해 보세요. 예를 들어 “완벽한 오디오 품질”은 “오디오 품질이 완벽함”으로도 작성할 수 있습니다. 이처럼 표현에 따라 서로 다른 결과가 나올 수 있습니다!