다중 음성 지원
다중 음성 지원
AI 에이전트가 여러 캐릭터 간의 대화와 향상된 스토리텔링을 위해 다양한 음성으로 전환할 수 있도록 지원합니다.
개요
다중 음성 지원을 사용하면 ElevenLabs 에이전트가 하나의 대화 중에 서로 다른 ElevenLabs 음성으로 동적으로 전환할 수 있습니다. 이 강력한 기능으로 다음을 구현할 수 있습니다.
- 다중 캐릭터 스토리텔링: 내러티브의 캐릭터마다 다른 음성 사용
- 언어 교육: 언어별 원어민 음성 사용
- 감정형 에이전트: 감정적 문맥에 따라 음성 변경
- 역할극 시나리오: 페르소나별로 구분되는 음성 사용

작동 방식
다중 음성 지원이 활성화되면 에이전트는 텍스트 생성 중 XML 스타일 마크업을 사용해 구성된 음성 간에 전환할 수 있습니다. 특정 음성을 지정하지 않으면 에이전트는 자동으로 기본 음성으로 돌아갑니다.
구성
지원 음성 추가
각 지원 음성에는 다음 속성이 있습니다.
- 음성 레이블: 고유 식별자(예: “Joe”, “Spanish”, “Happy”)
- 음성: 사용 가능한 ElevenLabs 음성에서 선택
- 모델 패밀리: Turbo, Flash 또는 Multilingual 선택(선택 사항)
- 언어: 이 음성의 기본 언어 재정의(선택 사항)
- 설명: 에이전트가 이 음성을 사용해야 하는 시점
대시보드에서 업데이트
CLI에서 업데이트
API에서 업데이트
대시보드에서 에이전트를 열고 Voice 탭으로 이동한 다음 다중 음성 지원 섹션을 찾으세요. 음성 추가를 클릭하여 새 지원 음성을 구성하세요.

음성 속성
음성 레이블
LLM이 이 음성을 참조하는 데 사용하는 고유 식별자입니다. 다음과 같은 설명적인 레이블을 선택하세요. - 캐릭터 이름: “Alice”, “Bob”, “Narrator” - 언어: “Spanish”, “French”, “German” - 감정: “Happy”, “Sad”, “Excited” - 역할: “Teacher”, “Student”, “Guide”
모델 패밀리
이 특정 음성에 대해 에이전트의 기본 모델 패밀리를 재정의합니다. - Flash: 가장 빠른 생성, 실시간 사용에 최적화 - Turbo: 속도와 품질의 균형 - Multilingual: 가장 높은 품질, 영어 외 언어에 최적 - 에이전트와 동일: 에이전트의 기본 설정 사용
언어 재정의
이 음성에 다른 언어를 지정합니다. 다음과 같은 경우에 유용합니다. - 다국어 대화 - 언어 교육 애플리케이션 - 지역별 발음
설명
에이전트가 이 음성을 사용해야 하는 시점에 관한 문맥을 제공하세요. 예시:
- “스페인어 단어나 문구에 사용”
- “메시지 내용이 즐겁거나 흥분될 때 사용”
- “캐릭터 Joe가 말할 때마다 사용”
구현
XML 마크업 구문
에이전트는 XML 스타일 태그를 사용해 음성을 전환합니다.
핵심 사항:
VOICE_LABEL을 구성한 정확한 레이블로 바꾸세요.- 태그 밖의 텍스트에는 기본 음성이 사용됩니다.
- 태그는 대소문자를 구분합니다.
- 중첩 태그는 지원되지 않습니다.
시스템 프롬프트 통합
지원 음성을 구성하면 시스템이 에이전트 프롬프트에 자동으로 지침을 추가합니다.
사용 예시
언어 교육
스토리텔링
권장사항
음성 선택
- 캐릭터나 문맥을 명확히 구분할 수 있는 음성을 선택하세요.
- 음성 조합이 잘 어울리는지 테스트하세요.
- 각 음성의 감정적 톤과 개성을 고려하세요.
- 언어를 전환할 때 음성이 해당 언어와 억양에 맞는지 확인하세요.
레이블 이름 지정
- LLM이 이해할 수 있는 설명적이고 직관적인 레이블을 사용하세요.
- 레이블은 짧고 기억하기 쉽게 유지하세요.
- 레이블에 특수 문자나 공백을 사용하지 마세요.
성능 최적화
- 실제로 필요한 수로 지원 음성 개수를 제한하세요.
- 전환 오버헤드를 줄이기 위해 가능하면 동일한 모델 패밀리를 사용하세요.
- 예상되는 대화 패턴으로 테스트하세요.
- 여러 번 음성을 전환할 때 응답 시간을 모니터링하세요.
콘텐츠 가이드라인
- 각 음성을 사용해야 하는 시점에 대해 명확한 설명을 제공하세요.
- 음성 전환이 불분명할 수 있는 엣지 케이스를 테스트하세요.
- 음성 레이블이 모호할 때의 대체 동작을 고려하세요.
- 음성 전환이 대화를 방해하지 않고 향상하도록 하세요.
제한 사항
- 에이전트당 최대 10개의 지원 음성(기본 음성 포함)
- 음성 전환은 생성 중 최소한의 지연 시간을 추가합니다.
- XML 태그는 올바른 형식으로 작성하고 닫아야 합니다.
- 마크업에서 음성 레이블은 대소문자를 구분합니다.
- 중첩 음성 태그는 지원되지 않습니다.
FAQ
정의되지 않은 음성 레이블을 사용하면 어떻게 되나요?
에이전트가 구성되지 않은 음성 레이블을 사용하면 텍스트는 기본 음성으로 말해집니다. XML 태그는 무시됩니다.
문장 중간에 음성을 변경할 수 있나요?
네, 하나의 응답 안에서 음성을 전환할 수 있습니다. 태그가 지정된 각 섹션은 지정된 음성을 사용하며, 태그가 없는 텍스트에는 기본 음성이 사용됩니다.
음성 전환이 대화 지연 시간에 영향을 주나요?
음성 전환은 최소한의 오버헤드를 추가합니다. 대화에서 각 음성을 처음 사용할 때는 음성이 초기화되므로 지연 시간이 약간 더 길어질 수 있습니다.
같은 음성을 다른 레이블로 사용할 수 있나요?
네, 동일한 ElevenLabs 음성을 사용하되 서로 다른 모델 패밀리, 언어 또는 문맥을 가진 여러 레이블을 구성할 수 있습니다.
음성 전환을 효과적으로 사용하도록 에이전트를 학습시키려면 어떻게 해야 하나요?
시스템 프롬프트에 명확한 예시를 제공하고 철저히 테스트하세요. 음성 전환이 발생해야 하는 구체적인 시나리오와 XML 마크업 형식의 예시를 포함할 수 있습니다.