Audio Tags란 무엇인가요? 감성 TTS 완벽 가이드
- 게시일
- 최종 업데이트
Audio Tags는 [laughs], [gasps], [excited], [worried]처럼 대괄호로 감싼 자연어 큐로, Eleven v3는 이를 읽어야 할 단어가 아니라 연기 지시로 해석합니다. 텍스트 음성 변환 모델용 스크립트를 작성할 때 이러한 Audio Tags를 삽입하면 글의 감정 표현을 세밀하게 제어할 수 있습니다.
Eleven v3는 2026년 3월에 정식 공개되었습니다. v3 이전에는 텍스트 음성 변환 모델에서 특정 감정 연기를 얻으려면 콘텐츠를 다시 생성하며 최선의 결과를 기대하는 수밖에 없었습니다. Audio Tags는 이러한 추측을 없애고 감성 텍스트 음성 변환 연기를 완벽하게 제어할 수 있게 해줍니다.
이 가이드에서는 Audio Tags의 정의와 작동 방식, 사용할 수 있는 모든 태그 카테고리, 그리고 SSML(음성 합성 마크업 언어)과의 차이점을 다룹니다. 각 항목의 전용 가이드로 연결되는 일반적인 활용 사례도 살펴봅니다.
요약
- Audio Tags는 [shouts], [excited]처럼 대괄호로 감싼 큐로, Eleven v3의 TTS에서 감정, 속도, 전달 방식, 톤을 지시합니다.
- Eleven v3는 SSML을 지원하지 않지만, 더 자연스러운 작성 경험을 제공하는 Audio Tags로 이를 대체합니다.
- 태그는 감정, 전달 방식과 속도, 사람의 반응, 억양, 음향 효과 등 여러 카테고리로 나뉩니다.
- 텍스트의 문장 부호와 대문자를 활용하면 AI 음성 연기의 속도를 조절할 수 있습니다.
- ElevenLabs UI 또는 API를 통해 Audio Tags를 사용할 수 있습니다.
Audio Tags는 어떻게 작동하나요?
Audio Tags는 스크립트 텍스트 안에 삽입되며 대괄호로 감쌉니다. 예를 들어 전달 방식을 일반적인 톤에서 [worried]로 바꾸고 싶다면 오디오 태그를 추가하기만 하면 됩니다.
한 문장에 여러 태그를 사용할 수도 있고, [tired] 정말 긴 하루였어… [upset] 앞으로 며칠을 더 버틸 수 있을까?처럼 태그를 조합해 더욱 입체적인 연기를 만들 수도 있습니다.
Eleven v3의 아키텍처는 이전 모델보다 더 깊이 있는 수준에서 문맥을 읽을 수 있어, 별도의 매개변수나 설정 없이 감정 신호, 톤 변화, 화자 전환, 문맥 단서를 따를 수 있습니다. 장면에 필요한 것을 모델에 알려주기만 하면, 계획한 그대로 대사를 연기합니다.
Eleven v3는 태그와 스크립트 구조만으로도 끼어들기, 분위기 변화, 실제 대화의 자연스러운 주고받음을 포함해 즉흥적으로 느껴지는 다화자 대화도 처리합니다.
Audio Tags와 SSML 비교
다른 TTS 시스템을 사용해 보셨다면 음성 합성 마크업 언어(Speech Synthesis Markup Language)를 접해 보셨을 것입니다. Amazon Polly나 Microsoft Azure Speech 같은 플랫폼은 <break>, <emphasis> 같은 SSML 태그를 사용해 TTS 스크립트에 추가적인 문맥을 제공합니다.
Eleven v3는 SSML의 break 태그를 비롯한 SSML 태그 세트를 지원하지 않습니다. 대신 Audio Tags, 문장 부호, 텍스트 구조 자체가 그 역할을 맡으며, 전달 방식을 세밀하게 제어할 수 있습니다.
아래 표를 사용해 일반적인 SSML 태그를 Eleven v3의 대응 기능과 비교할 수 있습니다.
작성자 관점에서 대사에 [whispers]를 추가하는 일은 운율 속도를 설정하는 것보다 훨씬 간편합니다.
v3의 Audio Tags 카테고리: Audio Tags로 연기 연출하기
Audio Tags는 스크립트 어디에나 배치하여 실시간으로 전달 방식을 조정할 수 있습니다. 스크립트 전체는 물론 문장 하나 안에서도 여러 태그를 조합해 사용할 수 있습니다.
태그는 다음과 같은 핵심 카테고리로 나뉩니다.
감정
이 태그를 사용하면 침울함, 강렬함, 경쾌함 등 음성의 감정 톤을 설정할 수 있습니다. 예를 들어 [sad], [angry], [happily], [sorrowful]을 하나 또는 조합하여 사용할 수 있습니다.
전달 방식과 속도
이 태그는 톤과 연기에 더 중점을 둡니다. 절제나 강렬함이 필요한 장면에서 볼륨과 에너지를 조절하는 데 사용할 수 있습니다. [whispers], [shouts], [softly] 같은 태그가 예입니다.
사람의 반응
진정한 자연스러운 말에는 반응이 포함됩니다. 예를 들어 자연스럽고 대본에 없는 순간을 음성에 삽입해 사실감을 더할 수 있습니다. [laughs], [clears throat], [sighs] 같은 태그는 사람의 감정을 표현할 수 있는 TTS 모델을 만드는 데 도움이 됩니다.
다른 오디오 태그 카테고리의 예는 다음과 같습니다:
- 억양과 캐릭터 음성: 억양 태그는 [French accent], [British accent], [pirate voice]처럼 모델을 바꾸지 않고 음성을 특정 지역이나 페르소나로 전환합니다. 하나의 고정된 연기 대신 유연한 배역으로 단일 음성을 활용할 수 있습니다.
- 음향 효과: 음향 효과 태그는 [gunshot], [explosion], [clapping]처럼 음성이 아닌 오디오를 생성물에 직접 추가합니다. 장면에 음성 이상의 요소가 필요한 몰입형 오디오, 게임, 드라마틱한 내레이션에 적합합니다. 또는 ElevenCreative AI 음향 효과 생성기를 사용하세요.
태그로 높은 수준의 제어가 가능하지만, 문장 부호를 사용해 리듬과 강조를 조정할 수도 있습니다. 예를 들어 자연스러운 멈춤에는 줄임표를 추가하고, 자연스러운 호흡 패턴에는 쉼표를 사용하세요. 강조하려면 단어를 모두 대문자로 작성해 보세요. “지금 당장 원해.”
Audio Tags로 무엇을 할 수 있나요?
Audio Tags는 직관적인 방식으로 스크립트의 복잡한 감정 표현을 가능하게 합니다. 자연스럽게 작성하고, 필요에 따라 태그를 추가하세요.
Audio Tags를 활용한 감성 TTS의 몇 가지 사용 사례를 간략히 살펴보겠습니다.
AI 오디오의 상황 인식
[whisper], [shouting] 같은 태그를 사용하면 Eleven v3가 상황에 반응하게 할 수 있습니다. 경고를 부드럽게 표현하는 것부터 긴장감을 위한 긴 멈춤까지, 스크립트에 역동적인 상황 인식을 구축할 수 있습니다.
자세한 내용은 AI 오디오의 상황 인식 가이드를 확인하세요.
음성에서 캐릭터 연기 연출하기
여러 캐릭터가 등장하는 스크립트를 만들 때는 각 음성이 어떻게 다른지 명확하게 보여주어야 합니다. [sarcastically]로 성격을 조정하거나 [British accent]로 말하는 방식을 정의하는 등, TTS 엔진으로 폭넓은 감정을 표현할 수 있습니다.
AI 음성에서 캐릭터 연기 연출하기에 대해 자세히 알아보세요.
음성으로 감정적 맥락 표현하기
Audio Tags를 사용하면 대사가 진행되면서 감정 전달 방식을 조절할 수 있습니다. 대사 전반에 걸쳐 감정을 쌓아 올리고, 캐릭터가 잠재력을 최대한 발휘하는 순간에 절정에 도달하게 할 수 있습니다. [awe], [booming], [big laugh] 같은 태그는 AI 음성 연기에 폭넓은 감정 표현을 더해줍니다.
AI 음성에서 감정적 맥락 활용하기에 대해 자세히 알아보세요.
여러 캐릭터의 대화에 생동감 더하기
여러 캐릭터가 대화하는 연기를 만들 때는 각 대사의 시작에 오디오 태그를 추가해 풍부한 캐릭터 간 대화를 구성할 수 있습니다.
다음 예시를 살펴보세요: Tom: [coughing] [beginning to speak] 미안, 오늘 몸이 좀 안 좋아— Emma: [interrupting] —아프다고? 내가 기침을 얼마나 싫어하는지 알잖아, Tom! Tom: [surprised] 그냥 가벼운 기침이야, 심각한 건 아니야. 네가 만약— Emma: [overlapping] [annoyed] —집에 가야 할 것 같아.
Eleven v3에서 여러 캐릭터의 대화 만들기로 더 많은 활용법을 확인하세요.
AI 음성을 위한 정밀 전달 제어
Eleven v3에서는 Audio Tags 또는 문장 부호를 사용해 음성의 속도를 조절할 수 있습니다. [pause], [rushed], [drawn out] 같은 태그를 사용하면 대사를 정밀하게 능동적으로 조정할 수 있습니다. 또는 줄임표, 마침표, 느낌표를 추가해 TTS 연기에 자연스럽게 감정을 더할 수 있습니다.
Eleven v3의 정밀 전달 제어에 관한 심층 가이드도 준비되어 있습니다.
감정 TTS는 API에서도 사용할 수 있습니다
Audio Tags는 텍스트 음성 변환 API를 통해서도 ElevenLabs UI와 동일하게 작동합니다. 스크립트 텍스트 안에 태그를 작성하면 API가 오디오북 파이프라인부터 광고 보이스오버까지 태그가 적용된 연기를 생성된 오디오로 반환합니다.
Eleven v3에 대해 자세히 알아보거나 영업팀에 문의하여 오늘 시작하세요.










