Eleven v4를 소개합니다역대 가장 감성적인 모델, Eleven v4를 만나보세요. 10월 12일까지 Creator+에 크레딧 3배 제공

콘텐츠로 건너뛰기

보이스 체인저 소개

게시일

듣기이 글 오디오로 듣기

보이스 체인저는 원래 음성 변환이라고 불렸습니다. AI 음성 에이전트의 맥락에서 "speech-to-speech"는 단일 모델이 오디오 입력과 출력을 직접 처리하는 융합 아키텍처를 의미하기도 합니다. ElevenAgents는 플랫폼에 고급 계단식 아키텍처를 사용합니다. 자세히 알아보기: 계단식 모델과 융합 모델 비교.

보이스 체인저

보이스 체인저를 음성 합성에 추가했습니다. 보이스 체인저는 한 사람의 음성 녹음을 다른 사람이 말한 것처럼 들리게 바꾸는 음성 변환 도구로, 원본 연기는 그대로 보존합니다. 즉, 녹음에 담긴 감정, 타이밍, 속도, 발음이 출력 음성에도 그대로 전달됩니다.

이를 통해 텍스트 음성 변환 프롬프트만으로는 언제나 구현할 수 없는 수준의 제어가 가능합니다. 활용 방법은 크게 두 가지입니다.

음성에서 더 풍부한 감정 표현 끌어내기. 모든 음성이 텍스트 음성 변환 프롬프트를 통한 감정 지시에 똑같이 잘 반응하는 것은 아닙니다. 보이스 체인저를 사용하면 표현력이 풍부한 음성을 녹음하거나 업로드해 감정 표현 범위를 다른 음성으로 재현할 수 있습니다. 전문 내레이터의 목소리를 더 따뜻하게 만들거나 어린이 책 캐릭터를 더 장난스럽게 표현해야 한다면, 직접 연기한 뒤 보이스 체인저로 이를 대상 음성에 적용할 수 있습니다.

음성 전달 방식 세밀하게 조정하기. 텍스트 음성 변환 모델은 일반적으로 별도 설정 없이도 억양을 잘 처리합니다. 하지만 특정 문장을 어떻게 전달할지, 즉 어디에 강조를 둘지, 쉼이 어떻게 느껴질지, 리듬은 어떤 느낌일지 정밀하게 제어해야 할 때 보이스 체인저를 사용하면 직접 음성으로 시연한 후 원하는 어떤 음성에도 그 전달 방식을 적용할 수 있습니다. 보이스 체인저를 Studio에 직접 통합하면 이 기능은 더욱 유용해질 것입니다. 하지만 목표는 같습니다. 바로 출력 결과를 정밀하게 제어할 수 있도록 하는 것입니다.

커뮤니티 멤버가 소개하는 사용 방법을 확인해 보세요:

연구

소스 음성을 대상 음성으로 변환하려면, 소스 음성의 내용을 대상 음성의 특성으로 표현해야 합니다. 얼굴 바꾸기에 비유할 수 있습니다. 두 얼굴을 가져와 하나로 합성하고, 한 사람의 특징을 다른 사람의 매핑된 구조 안에 렌더링하는 앱과 같습니다.

이를 위해 얼굴 이미지를 가져와 그 속성을 매핑합니다. 아래 예시의 마커가 სწორედ 그 역할을 합니다. 다른 얼굴이 렌더링될 범위를 정하는 경계입니다.

Comparison of facial recognition and facial mapping technology.
Audio waveform with a corresponding speech transcription in a visual format.

음성 변환의 핵심은 대상 음성의 음소를 사용해 소스 음성의 내용을 렌더링하는 것입니다. 하지만 얼굴 바꾸기 예시와 마찬가지로 여기에도 절충점이 있습니다. 한 얼굴의 속성을 매핑하는 데 더 많은 마커를 사용할수록 그 안에 매핑되는 얼굴에 더 많은 제약이 가해집니다. 마커가 적을수록 제약도 줄어듭니다.

음성 변환도 마찬가지입니다. 대상 음성에 더 큰 비중을 둘수록 소스 음성과 동기화가 어긋날 위험이 커집니다. 반대로 비중이 충분하지 않으면 해당 음성의 특징을 이루는 요소를 많이 잃을 수 있습니다. 예를 들어 누군가 화가 나서 소리치는 녹음을 속삭이는 목소리로 렌더링한다면 문제가 생깁니다. 소스 음성의 감정에 지나치게 비중을 두면 속삭이는 목소리라는 인상이 사라지고, 속삭이는 음성 패턴을 지나치게 강조하면 소스 음성의 감정적 에너지를 잃게 됩니다.

제품 및 최근 업데이트

사전 제작 음성 변경 사항

음성 합성에서 제공되는 기본 음성을 변경하고 있습니다. 일부 음성은 지원을 종료하고 새로운 음성으로 교체할 예정이며, 앞으로 몇 주 동안 20개 이상의 음성을 추가할 계획입니다.

또한 각 음성을 언제까지 이용할 수 있을 것으로 예상되는지 UI에서 안내하기 시작할 예정입니다. 12월 동안 음성의 다양성을 높이기 위해 음성 공유 및 사용 보상 기능을 개편합니다. 자세한 내용은 곧 안내해 드리겠습니다.

Eleven Turbo v2 및 uLaw 8kHz 형식

Turbo v2는 팀이 수개월간 연구한 결과물입니다. 실시간 상호작용을 위해 설계되었지만 모든 사용 사례에서 활용할 수 있습니다. 또한 IVR 시스템을 위한 표준 (m)uLaw 8kHz 형식도 지원합니다.

Studio의 정규화 및 메타데이터

이제 Studio는 게인 조정 및 다이내믹 압축을 포함한 업계 표준 오디오북 제출 가이드라인을 지원합니다. Studio 프로젝트에 메타데이터(ISBN, 저자, 제목)를 직접 삽입할 수도 있습니다.

발음 사전

가장 많은 요청을 받은 기능 중 하나입니다. 지난달 영어 모델에서 IPA 및 CMU 사전을 사용해 발음을 지정할 수 있도록 SSML 태그를 지원하기 시작했습니다. 이제 발음 사전 기능을 Studio UI에 출시하여 IPA, CMU 또는 단어 대체(별칭)를 사용해 발음을 지정하는 파일을 업로드할 수 있습니다. 사전 파일은 업계 표준 공개 .PLS 어휘 파일 형식을 사용합니다.

현재 Turbo v2 English는 IPA와 CMU를 지원합니다. 단어 대체는 모든 모델과 언어에서 지원됩니다. 전체 문서는 여기에서 확인할 수 있습니다.

Upload area for a Lexicon file with instructions to click or drag and drop a .pls/.txt/.xml file, size limit 1.5MB.
Pronunciation diary

피드백이 있다면 Discord를 통해 언제든지 알려 주세요!

보이스 체인저 사용해 보기

원하는 방식으로 말하고, 연기 표현을 완벽하게 제어한 채 완전히 다른 음성으로 전달되는 결과를 들어 보세요. 속삭임, 웃음, 억양, 미묘한 감정 신호까지 담아낼 수 있습니다.

원하는 방식으로 말하면, 연기 표현을 완벽하게 제어한 전혀 다른 목소리로 들을 수 있습니다. 속삭임, 웃음, 억양, 섬세한 감정 표현까지 담아냅니다.

유사한 기사

최고 품질의 AI 오디오로 창작하세요