콘텐츠로 건너뛰기

웃을 수 있는 최초의 AI

게시일

듣기이 글 오디오로 듣기

지난 글에서는 ElevenLabs의 음성 합성 도구로 생성한 몇 가지 긴 형식의 샘플을 미리 소개하고, 모델의 독자적인 설계가 어떻게 자연스러운 속도와 비로봇적인 음성을 만들어 내는지 간략히 살펴봤습니다. 오늘은 이 모델이 다른 어떤 모델보다도 감정 표현이 풍부하고 문맥을 더 잘 이해한다는 점을 보여드리겠습니다. 덕분에 듣는 재미가 뛰어날 뿐 아니라 책과 비디오 게임의 보이스오버부터 광고까지 폭넓게 활용할 수 있습니다.

감정

모델의 두 가지 강점인 유창함과 정확한 억양은 방대한 학습 데이터(50만 시간 이상!)에서 비롯되지만, 핵심은 이러한 데이터를 학습하는 방식, 즉 모델의 설계에 있습니다. 가장 기본적으로는 글에 담긴 감정을 이해하고 화자가 기쁘게, 화나게, 슬프게 또는 담담하게 들려야 할지 판단하도록 만들어졌습니다. 몇 가지 예시를 살펴보겠습니다:

억양과 분위기의 모든 차이는 오직 텍스트에서 비롯되며, 결과물에 영향을 준 다른 요소는 없습니다. 문장 부호와 단어의 의미는 특정 문장을 어떻게 전달할지 결정하는 데 중요한 역할을 합니다. 하지만 화자가 승리에 기뻐할 때, 모델이 웃음처럼 일반적인 말에는 없는 소리도 설득력 있게 만들어 내는 점도 주목해 보세요(AI가 낼 수 있는 다양한 웃음소리 모음도 곧 공개할 예정입니다!). 마찬가지로 화자가 매우 재미있는 일에 웃을 때는 반응을 적절히 과장합니다. 정말 ‘너어어어무 웃겨요’.

문맥

하지만 개별 단어의 의미를 아는 것만으로는 충분하지 않습니다. 모델은 각 발화가 놓인 더 넓은 상황에도 민감하게 반응하며, 앞뒤 텍스트와 어떻게 연결되는지를 통해 내용이 자연스러운지 판단합니다. 이전의 긴 콘텐츠 글에서 보셨듯, 이러한 거시적 관점은 여러 문장에 걸친 사고의 흐름에 일관된 감정 패턴을 입혀 긴 구절에도 적절한 억양을 부여할 수 있게 합니다. 또한 논리적 오류를 피하는 데도 도움이 됩니다. 예를 들어 철자는 같지만 의미가 다른 단어가 있습니다. 현재형과 과거형의 ‘read’, 시간 단위 또는 아주 작은 것을 뜻하는 ‘minute’이 그렇습니다. 어느 의미가 적절한지는 문맥에 따라 결정됩니다:

글말과 입말

긴 형식의 콘텐츠 수요를 충족하도록 플랫폼을 설계하기 때문에, 모델은 글에서 흔히 쓰이는 기호, 약어 및 특정 표기 관습을 특정 방식으로 발음해야 하거나 문자 그대로 읽지 않아야 한다는 점도 이해해야 합니다. 예를 들어 모델은 FBI, TNT, ATM이 UNESCO나 NASA와 다르게 발음된다는 것을 알아야 합니다. 마찬가지로 $3tr은 글로 쓸 때는 전혀 문제없지만, 소리 내어 읽을 때는 ‘3조 달러’가 되어야 합니다.

사람의 개입

이러한 미묘한 차이를 인식하는 일은 매우 중요합니다. 생성 과정에서 사람의 개입을 최소화하는 것이 목표이기 때문입니다. 오디오북을 몇 분 안에 생성할 수 있다고 홍보하면서, 누군가가 전체 오디오를 들은 뒤 텍스트 전체를 다시 작성해야 한다면 의미가 없습니다. 물론 발음 규칙을 지속해서 업데이트하고 있지만, 모델이 혼동하는 경우는 언제나 있을 수 있습니다. 이를 위해 모델이 문제로 판단한 텍스트 부분을 사용자가 즉시 확인하고, 올바른 발음 방법을 모델에 알려 줄 수 있는 불확실성 표시 시스템을 개발하고 있습니다.

무궁무진한 활용 분야

지금까지 소개한 모든 기능은 소프트웨어를 가장 다재다능한 AI 보이스오버 도구로 만드는 과정의 단계입니다.

뉴스 발행사는 오디오 콘텐츠를 늘리는 것이 구독자를 유지하는 훌륭한 방법임을 이미 알아냈습니다. 모든 기사에 오디오 낭독을 삽입하면 사람들이 다른 일을 하면서도 들을 수 있다는 큰 장점이 있습니다. 이를 도입하는 발행사는 비용이 많이 드는 성우를 사용하는 경우가 많고, 그러면 모든 기사를 다룰 수는 없습니다. 또는 자체 기자가 기사를 읽게 하는데, 이는 시간이 많이 걸려 결국 비용도 많이 듭니다. 콘텐츠에 합성 음성을 사용하는 곳은 비용을 절감하지만 품질을 희생해야 합니다. 이제 ElevenLabs와 함께라면 타협할 필요 없이 두 가지 장점을 모두 누릴 수 있습니다.

또는 몇 분 만에 모든 캐릭터에 뚜렷하고 감정을 사로잡는 보이스오버를 입힌 오디오북을 제작하는 모습을 상상해 보세요. 이는 책을 즐기는 새로운 방식을 제시할 뿐 아니라 학습에 어려움을 겪는 사람들의 접근성도 크게 높여 줍니다.

이제 비디오 게임 개발자에게 열린 가능성을 생각해 보세요. 더는 특정 캐릭터가 실제 성우를 기용하는 데 드는 상당한 비용을 정당화할 만큼 중요한지 고민할 필요가 없습니다. 이제 모든 NPC가 저마다의 목소리와 개성을 가질 수 있습니다.

광고 대행사와 제작자는 이제 스포츠 TV 채널이든 고급 시계 브랜드든, 어떤 캠페인의 분위기에도 맞도록 보이스오버를 자유롭게 실험하고 조정할 수 있습니다. 모든 배우의 목소리는 복제 라이선스를 받을 수 있으므로, 배우가 직접 현장에 있지 않아도 즉시 변경 사항을 적용할 수 있습니다. 완전히 합성된 음성을 선택한다면 광고주는 음성 권리에 대한 추가 사용료를 걱정할 필요도 없습니다.

가상 비서는 음성 복제를 통해 특정 사용자에게 익숙한 목소리로 말할 수 있고, 새롭게 확보한 풍부한 표현력 덕분에 더욱 자연스럽게 상호작용할 수 있어 한층 더 생동감 있게 발전할 수 있습니다.

ElevenLabs 베타

베타 플랫폼에 가입하고 직접 사용해 보려면 여기로 이동하세요. ElevenLabs는 지속적으로 개선하고 있으며, 이 초기 단계에서는 모든 사용자 피드백이 매우 소중합니다. 즐겨 보세요!

유사한 기사

최고 품질의 AI 오디오로 창작하세요