콘텐츠로 건너뛰기

보이스 체인저 소개

게시일

듣기이 글 오디오로 듣기

보이스 체인저는 원래 음성 변환(speech-to-speech)으로 불렸습니다. AI 음성 에이전트의 맥락에서 "speech-to-speech"는 하나의 모델이 오디오 입력과 출력을 직접 처리하는 융합형 아키텍처를 의미하기도 합니다. ElevenAgents는 플랫폼에 고도화된 캐스케이드형 아키텍처를 사용합니다. 자세히 알아보기: 캐스케이드형 모델과 융합형 모델 비교.

보이스 체인저

보이스 체인저를 음성 합성에 추가했습니다. 보이스 체인저는 한 음성의 녹음을 다른 사람이 말한 것처럼 들리게 바꾸면서도 원래의 연기는 보존하는 음성 변환 도구입니다. 즉, 녹음에 담긴 감정, 타이밍, 속도, 발음이 출력 음성에도 그대로 전달됩니다.

이를 통해 텍스트 음성 변환 프롬프트만으로는 항상 얻을 수 없는 수준의 제어가 가능합니다. 활용 방법은 크게 두 가지입니다.

음성에서 더 풍부한 감정 끌어내기 모든 음성이 텍스트 음성 변환 프롬프트를 통한 감정 지시에 똑같이 잘 반응하는 것은 아닙니다. 보이스 체인저를 사용하면 표현력이 풍부한 음성을 녹음하거나 업로드하고, 그 감정의 폭을 다른 음성에 재현할 수 있습니다. 전문 내레이터의 목소리를 더 따뜻하게 만들거나 동화 속 캐릭터를 더 장난스럽게 표현해야 한다면, 직접 연기한 뒤 보이스 체인저로 대상 음성에 적용할 수 있습니다.

음성 전달 방식 미세 조정 ElevenLabs의 텍스트 음성 변환 모델은 일반적으로 별도 설정 없이도 억양을 잘 처리합니다. 하지만 특정 문장을 어떻게 전달할지, 즉 어디에 강조를 둘지, 휴지를 어떻게 넣을지, 리듬을 어떻게 만들지 정밀하게 제어해야 할 때는 직접 목소리로 시연한 후 원하는 음성에 그 전달 방식을 적용할 수 있습니다. 보이스 체인저를 Studio에 직접 통합하면 더욱 유용해지겠지만, 목표는 같습니다. 바로 출력 결과를 정밀하게 제어할 수 있게 하는 것입니다.

커뮤니티 멤버가 제공한 사용 안내를 확인해 보세요:

연구

원본 음성을 대상 음성으로 변환하려면, 원본 음성의 내용을 대상 음성의 특성으로 표현해야 합니다. 유용한 비유로 얼굴 교체를 들 수 있습니다. 두 얼굴을 가져와 하나를 다른 하나의 매핑된 구조 안에 렌더링하여 각 특징을 결합하는 앱과 같습니다.

이를 위해 얼굴 이미지를 վերց어 그 속성을 매핑합니다. 아래 예시의 마커가 바로 그 역할을 합니다. 다른 얼굴이 렌더링될 수 있는 범위를 정의합니다.

Comparison of facial recognition and facial mapping technology.
Audio waveform with a corresponding speech transcription in a visual format.

음성 변환의 핵심은 대상 음성의 음소를 사용해 원본 음성의 내용을 렌더링하는 것입니다. 하지만 얼굴 교체 예시와 마찬가지로 여기에는 절충점이 있습니다. 한 얼굴의 속성을 매핑하는 데 사용하는 마커가 많을수록, 그 안에 매핑하는 얼굴에 더 많은 제약이 가해집니다. 마커가 적으면 제약도 줄어듭니다.

음성 변환도 마찬가지입니다. 대상 음성에 더 큰 우선순위를 둘수록 원본 음성과 동기화가 어긋날 위험이 커집니다. 반대로 우선순위를 충분히 주지 않으면 그 음성을 특징짓는 요소를 많이 잃을 수 있습니다. 예를 들어 누군가가 화내며 소리치는 녹음을 속삭이는 목소리로 렌더링한다면 문제가 생깁니다. 원본 음성의 감정에 너무 큰 우선순위를 주면 속삭이는 목소리가 말하는 듯한 인상이 사라지고, 속삭이는 음성 패턴을 너무 강조하면 원본 음성이 지닌 감정적 강도가 사라집니다.

제품 및 최근 업데이트

사전 제작 음성 변경 사항

음성 합성에서 기본으로 제공되는 음성을 변경하고 있습니다. 일부 음성은 지원을 종료하고 새 음성으로 교체할 예정이며, 앞으로 몇 주 동안 20개 이상의 음성이 추가될 예정입니다.

각 음성을 언제까지 사용할 수 있을 것으로 예상되는지 UI에서 안내하기 시작할 예정입니다. 12월 동안 음성 다양성을 높이기 위해 음성 공유 및 사용 보상 기능도 개편합니다. 자세한 내용은 곧 안내해 드리겠습니다.

Eleven Turbo v2 및 uLaw 8kHz 형식

Turbo v2는 ElevenLabs 팀이 수개월간 연구한 결과물입니다. 실시간 상호작용을 위해 설계되었지만 모든 사용 사례에 활용할 수 있습니다. 또한 IVR 시스템용 표준 (m)uLaw 8kHz 형식도 지원합니다.

Studio의 노멀라이제이션 및 메타데이터

Studio는 이제 게인 조정과 다이내믹 압축을 포함한 업계 표준 오디오북 제출 가이드라인을 지원합니다. 또한 Studio 프로젝트에 메타데이터(ISBN, 저자, 제목)를 직접 삽입할 수 있습니다.

발음 사전

가장 많이 요청받은 기능 중 하나였습니다. 지난달에는 영어 모델에서 IPA 및 CMU 사전을 사용해 발음을 지정할 수 있도록 SSML 태그를 지원하기 시작했습니다. 이제 Studio UI에서 발음 사전을 지원하여 IPA, CMU 또는 단어 대체(별칭)를 사용해 발음을 지정한 파일을 업로드할 수 있습니다. 사전 파일은 업계 표준인 개방형 .PLS 어휘 파일 형식을 사용합니다.

현재 Turbo v2 영어는 IPA와 CMU를 지원합니다. 단어 대체는 모든 모델과 언어에서 지원됩니다. 전체 문서는 여기에서 확인할 수 있습니다.

Upload area for a Lexicon file with instructions to click or drag and drop a .pls/.txt/.xml file, size limit 1.5MB.
Pronunciation diary

의견이 있으시면 언제든지 Discord를 통해 알려주세요!

보이스 체인저 사용해 보기

원하는 방식으로 말하고, 연기를 완벽하게 제어하면서 완전히 다른 목소리로 전달되는 결과를 들어 보세요. 속삭임, 웃음, 억양, 미묘한 감정 표현까지 담아낼 수 있습니다.

원하는 대로 말하고, 완전히 다른 목소리로 들어보세요. 퍼포먼스까지 세밀하게 조절할 수 있습니다. 속삭임, 웃음, 억양, 미묘한 감정까지 모두 담아낼 수 있어요.

유사한 기사

최고 품질의 AI 오디오로 창작하세요