보이스 디자인 - 오디오를 위한 최초의 생성형 AI
- 게시일
지난달 ElevenLabs는 발표했습니다 음성 제작을 위한 생성형 모델을 곧 선보일 예정이라고요. 마침내 출시된 이 모델은 최초의 기술이며, 보이스 디자인이라 부릅니다. 이 기능을 사용하면 성별, 연령, 억양 등 핵심 특성을 선택해 완전히 새로운 음성을 처음부터 만들 수 있습니다. 핵심 파라미터 설정이 같더라도 생성 버튼을 누를 때마다 모델이 무작위성을 더해, 듣는 모든 음성이 완전히 고유하도록 합니다. 보이스 디자인은 퍼블리셔와 크리에이터에게 가장 다재다능한 AI 스토리텔링 도구를 제공하려는 더 큰 노력의 일환입니다.
보이스 디자인
보이스 디자인의 기반이 되는 모델은 주로 음성 합성 및 음성 복제 연구의 결과입니다. 이와 별개로 ElevenLabs는 늘 음성을 위한 생성형 도구라는 아이디어를 좋아했습니다. 생성형 텍스트-이미지 및 챗봇 모델의 실용적인 활용 사례는 이미 확인했지만, 오디오를 위한 유사한 도구는 없었습니다. 출시 이후 더 많은 화자를 음성 라이브러리에 추가해 달라는 요청을 받아왔습니다. 수많은 음성으로 라이브러리를 채우고 누가 누구인지 알기 위해 각 미리 듣기를 모두 들어야 하게 하는 대신, 방식을 바꿔 화자 정체성을 직접 정할 수 있도록 했습니다. 그러면서도 이러한 제약 안에서 무한한 다양성을 누릴 수 있습니다.
사용자들은 대본에 맞는 구체적인 음성 특성을 자주 찾기 때문에 음성 선택에 일정 수준의 제어 기능을 제공하는 것이 중요했습니다. 많은 활용 사례에서 특정 음성에 대한 독점적 접근이 필요하거나 적어도 유용하기 때문에, 생성되는 각각의 음성이 고유하도록 보장하는 일도 마찬가지로 중요했습니다. 보이스 디자인으로 생성된 음성은 사용자에게 새로운 창작 수단을 제공할 뿐 아니라 완전히 인공적으로 만들어지며 실제 인물의 음성이 아닙니다.
활용 사례
ElevenLabs의 대표 텍스트 음성 변환 도구로 글을 고품질 오디오로 손쉽게 변환하는 데 더해, 도서 저자는 이제 보이스 디자인을 사용해 내레이션을 예술적으로 제어하고, 맞춤형 음성으로 각 캐릭터의 개성을 만들 수 있습니다.
오디오 분야에 진출하는 뉴스 퍼블리셔에게는 기사에 사용할 음성이 필요합니다. 내레이터는 자신이 대표하는 매체와 동일시되므로 적합한 보이스오버를 선택하는 일은 자주 반복하지 않는 중요한 과제가 됩니다. 보이스 디자인을 사용하면 퍼블리셔가 사실상 셀 수 없이 많은 내레이터를 즉시 선택하고 비교할 수 있습니다. 또한 특정 음성이 오직 해당 퍼블리셔만을 대표한다는 안심도 제공합니다.
게임 개발자는 더 이상 특정 캐릭터에 녹음 비용을 들일 가치가 있는지 고민할 필요가 없습니다. 이전까지 말이 없던 수만 명의 NPC에게 이제 저마다 고유한 개성을 부여해 가상 세계의 몰입감을 한층 더 확장할 수 있습니다.
다음 콘텐츠를 작업하는 콘텐츠 크리에이터이든, 회사 커뮤니케이션에 음성을 입히려는 기업 담당자이든, 이제 특정 활용 사례와 대상에 맞춰 생생하고 매력적인 오디오를 디자인할 수 있는 가능성은 무한합니다.
생태계
보이스 디자인은 올해 선보일 예정인 여러 내레이션 편집 기능 중 하나입니다. 다음은 스튜디오입니다. 긴 텍스트를 구성하고 휴지 삽입을 수행하며, 오디오 일부를 다시 생성하고 텍스트 부분을 서로 다른 화자에게 할당할 수 있는 새로운 작업 공간입니다. 스튜디오는 3월 말에 출시되며, 올해 2분기 후반에는 억양 편집 지원도 추가될 예정입니다.



.jpg&w=3840&q=80)
