다중 음성 지원

AI 에이전트가 여러 캐릭터 간의 대화와 향상된 스토리텔링을 위해 다양한 음성으로 전환할 수 있도록 지원합니다.

개요

다중 음성 지원을 사용하면 ElevenLabs 에이전트가 하나의 대화 중에 서로 다른 ElevenLabs 음성으로 동적으로 전환할 수 있습니다. 이 강력한 기능으로 다음을 구현할 수 있습니다.

  • 다중 캐릭터 스토리텔링: 내러티브의 캐릭터마다 다른 음성 사용
  • 언어 교육: 언어별 원어민 음성 사용
  • 감정형 에이전트: 감정적 문맥에 따라 음성 변경
  • 역할극 시나리오: 페르소나별로 구분되는 음성 사용
다중 음성 구성 인터페이스

작동 방식

다중 음성 지원이 활성화되면 에이전트는 텍스트 생성 중 XML 스타일 마크업을 사용해 구성된 음성 간에 전환할 수 있습니다. 특정 음성을 지정하지 않으면 에이전트는 자동으로 기본 음성으로 돌아갑니다.

The teacher said, <spanish>¡Hola estudiantes!</spanish>
Then the student replied, <student>Hello! How are you today?</student>

구성

지원 음성 추가

각 지원 음성에는 다음 속성이 있습니다.

  • 음성 레이블: 고유 식별자(예: “Joe”, “Spanish”, “Happy”)
  • 음성: 사용 가능한 ElevenLabs 음성에서 선택
  • 모델 패밀리: Turbo, Flash 또는 Multilingual 선택(선택 사항)
  • 언어: 이 음성의 기본 언어 재정의(선택 사항)
  • 설명: 에이전트가 이 음성을 사용해야 하는 시점

대시보드에서 에이전트를 열고 Voice 탭으로 이동한 다음 다중 음성 지원 섹션을 찾으세요. 음성 추가를 클릭하여 새 지원 음성을 구성하세요.

다중 음성 구성 인터페이스

음성 속성

LLM이 이 음성을 참조하는 데 사용하는 고유 식별자입니다. 다음과 같은 설명적인 레이블을 선택하세요. - 캐릭터 이름: “Alice”, “Bob”, “Narrator” - 언어: “Spanish”, “French”, “German” - 감정: “Happy”, “Sad”, “Excited” - 역할: “Teacher”, “Student”, “Guide”

이 특정 음성에 대해 에이전트의 기본 모델 패밀리를 재정의합니다. - Flash: 가장 빠른 생성, 실시간 사용에 최적화 - Turbo: 속도와 품질의 균형 - Multilingual: 가장 높은 품질, 영어 외 언어에 최적 - 에이전트와 동일: 에이전트의 기본 설정 사용

이 음성에 다른 언어를 지정합니다. 다음과 같은 경우에 유용합니다. - 다국어 대화 - 언어 교육 애플리케이션 - 지역별 발음

에이전트가 이 음성을 사용해야 하는 시점에 관한 문맥을 제공하세요. 예시:

  • “스페인어 단어나 문구에 사용”
  • “메시지 내용이 즐겁거나 흥분될 때 사용”
  • “캐릭터 Joe가 말할 때마다 사용”

구현

XML 마크업 구문

에이전트는 XML 스타일 태그를 사용해 음성을 전환합니다.

<VOICE_LABEL>text to be spoken</VOICE_LABEL>

핵심 사항:

  • VOICE_LABEL을 구성한 정확한 레이블로 바꾸세요.
  • 태그 밖의 텍스트에는 기본 음성이 사용됩니다.
  • 태그는 대소문자를 구분합니다.
  • 중첩 태그는 지원되지 않습니다.

시스템 프롬프트 통합

지원 음성을 구성하면 시스템이 에이전트 프롬프트에 자동으로 지침을 추가합니다.

When a message should be spoken by a particular person, use markup: "<CHARACTER>message</CHARACTER>" where CHARACTER is the character label.
Available voices are as follows:
- default: any text outside of the CHARACTER tags
- Joe: Whenever Joe is speaking
- Spanish: For any Spanish words or phrases
- Narrator: For narrative descriptions

사용 예시

Teacher: Let's practice greetings. In Spanish, we say <Spanish>¡Hola! ¿Cómo estás?</Spanish>
Student: How do I respond?
Teacher: You can say <Spanish>¡Hola! Estoy bien, gracias.</Spanish> which means Hello! I'm fine, thank you.

권장사항

  • 캐릭터나 문맥을 명확히 구분할 수 있는 음성을 선택하세요.
  • 음성 조합이 잘 어울리는지 테스트하세요.
  • 각 음성의 감정적 톤과 개성을 고려하세요.
  • 언어를 전환할 때 음성이 해당 언어와 억양에 맞는지 확인하세요.
  • LLM이 이해할 수 있는 설명적이고 직관적인 레이블을 사용하세요.
  • 레이블은 짧고 기억하기 쉽게 유지하세요.
  • 레이블에 특수 문자나 공백을 사용하지 마세요.
  • 실제로 필요한 수로 지원 음성 개수를 제한하세요.
  • 전환 오버헤드를 줄이기 위해 가능하면 동일한 모델 패밀리를 사용하세요.
  • 예상되는 대화 패턴으로 테스트하세요.
  • 여러 번 음성을 전환할 때 응답 시간을 모니터링하세요.
  • 각 음성을 사용해야 하는 시점에 대해 명확한 설명을 제공하세요.
  • 음성 전환이 불분명할 수 있는 엣지 케이스를 테스트하세요.
  • 음성 레이블이 모호할 때의 대체 동작을 고려하세요.
  • 음성 전환이 대화를 방해하지 않고 향상하도록 하세요.

제한 사항

  • 에이전트당 최대 10개의 지원 음성(기본 음성 포함)
  • 음성 전환은 생성 중 최소한의 지연 시간을 추가합니다.
  • XML 태그는 올바른 형식으로 작성하고 닫아야 합니다.
  • 마크업에서 음성 레이블은 대소문자를 구분합니다.
  • 중첩 음성 태그는 지원되지 않습니다.

FAQ

에이전트가 구성되지 않은 음성 레이블을 사용하면 텍스트는 기본 음성으로 말해집니다. XML 태그는 무시됩니다.

네, 하나의 응답 안에서 음성을 전환할 수 있습니다. 태그가 지정된 각 섹션은 지정된 음성을 사용하며, 태그가 없는 텍스트에는 기본 음성이 사용됩니다.

음성 전환은 최소한의 오버헤드를 추가합니다. 대화에서 각 음성을 처음 사용할 때는 음성이 초기화되므로 지연 시간이 약간 더 길어질 수 있습니다.

네, 동일한 ElevenLabs 음성을 사용하되 서로 다른 모델 패밀리, 언어 또는 문맥을 가진 여러 레이블을 구성할 수 있습니다.

시스템 프롬프트에 명확한 예시를 제공하고 철저히 테스트하세요. 음성 전환이 발생해야 하는 구체적인 시나리오와 XML 마크업 형식의 예시를 포함할 수 있습니다.