표현 모드
표현 모드
대화 맥락에 따라 톤, 타이밍, 감정 표현을 조정하는 음성 에이전트를 구축하세요.
개요
표현 모드를 사용하면 에이전트가 의도, 감정, 강조를 반영해 말할 수 있으며, 사용자의 말투와 발화 내용에 실시간으로 맞춰 조정합니다. 이는 대화형 스택의 두 가지 시스템 수준 개선을 기반으로 합니다.
- Eleven v3 Conversational — ElevenAgents에서 제공하는 가장 감정 지능이 높고 문맥을 이해하는 텍스트 음성 변환 모델입니다.
- 새로운 턴테이킹 시스템 — 더 정확한 타이밍으로 응답하며 방해를 줄입니다.
에이전트의 TTS 모델로 Eleven v3 Conversational을 선택하면 표현 모드가 기본으로 활성화됩니다.
Eleven v3 Conversational
Eleven v3 Conversational은 실시간 양방향 대화에 최적화된 Eleven v3의 초저지연 버전입니다. 턴이 바뀌어도 대화 문맥을 유지하고, 각 대화의 톤과 의도에 맞게 전달 방식을 조정합니다.
- 문맥 인식 전달: 에이전트는 대화 문맥에 따라 톤을 조정합니다. 예를 들어 사용자가 걱정스러워 보일 때는 더 차분하게, 명확성이 중요할 때는 더 직접적으로 응답합니다.
- 명시적 감정 제어: 정확한 트리거부터 폭넓은 시나리오까지 시스템 프롬프트 규칙으로 전달 방식을 안내해 브랜드 보이스 및 컴플라이언스 요구 사항에 맞출 수 있습니다.
- 70개 이상의 언어 지원: Flash 모델의 약 32개 언어에서 확장되었으며, 일본어를 비롯해 이전에 미묘한 표현이 부족했던 언어의 표현력이 개선되었습니다.
- 표현 태그: LLM은 특정 전달 순간을 제어하기 위해
[laughs],[whispers],[sighs]같은 태그를 출력할 수 있습니다.
Eleven v3 Conversational의 가격은 Agents 내 다른 ElevenLabs TTS 모델과 같으며, 분당 $0.08부터 시작합니다.
턴테이킹 시스템
새로운 턴테이킹 시스템은 감정 신호와 말하기 패턴을 포함한 Scribe v2 Realtime의 실시간 신호를 사용해 에이전트가 말할지, 멈출지, 기다릴지를 판단합니다. 이를 통해 에이전트는 특히 감정적으로 민감한 상황에서 더 자연스럽게 응답할 수 있습니다.
예를 들어 “yeah”는 완전한 동의 표현일 수도 있고, 계속 말하기 위한 도입일 수도 있습니다. 시스템은 트랜스크립트뿐 아니라 말한 방식(억양 등 음성 신호)도 분석하여 에이전트의 응답 타이밍을 더 자연스럽게 맞춥니다.
턴테이킹 동작은 턴 적극성 설정으로 추가 조정할 수 있습니다.
구성
표현 모드 활성화
시스템 프롬프트 예시
시스템 프롬프트의 자연어 지침을 통해 에이전트의 감정 전달 방식을 안내하세요. 모델은 이를 문맥에 따라 해석하므로 모든 상황에 명시적 태그가 필요한 것은 아닙니다.
폭넓은 가이드라인
구체적인 트리거
표현 태그 사용
문맥 인식 전달 외에도 LLM은 특정 순간을 제어하기 위한 명시적 태그를 출력할 수 있습니다. 일반적인 태그는 다음과 같습니다.
[laughs]— 음성에 웃음 추가[whispers]— 속삭이도록 볼륨 낮춤[sighs]— 한숨 쉬는 느낌 추가[slow]— 말하기 속도 늦춤[excited]— 전달 방식에 흥분감 추가
각 태그는 일반적인 전달 방식으로 돌아가기 전까지 약 다음 4~5단어에 적용됩니다.
권장사항
상황에 맞는 전달 방식
에이전트가 상황에 맞게 감정 전달 방식을 조정하도록 안내하세요. 좌절한 고객은 차분하고 공감하는 응답을 들어야 합니다. 좋은 소식을 전하는 사용자는 진심 어린 따뜻함을 느껴야 합니다. 상황에 맞지 않는 톤은 신뢰를 떨어뜨립니다.
일관성을 위해 시스템 프롬프트 규칙 사용
모델의 판단에만 의존하지 말고 시스템 프롬프트에서 명확한 톤 가이드라인을 정의하세요. 이를 통해 브랜드 보이스 및 컴플라이언스 요구 사항에 맞는 일관된 전달 방식을 보장할 수 있습니다.
언어별 테스트
표현력 있는 전달 방식은 언어마다 다를 수 있습니다. 특히 대화 규범이 다른 언어에서는 감정적 뉘앙스가 의도대로 전달되는지 각 대상 언어에서 에이전트를 테스트하세요.
턴 적극성 설정과 결합
표현 모드를 적절한 턴 적극성 설정과 함께 사용하세요. 인내 모드는 감정적으로 민감한 대화에서 사용자에게 더 많은 여유를 제공하고, 적극 모드는 빠르게 진행되는 상호작용에 적합합니다.
모니터링 및 반복 개선
대화 분석을 사용해 사용자가 표현력 있는 전달 방식에 어떻게 반응하는지 추적하세요. 대화 결과와 사용자 피드백을 바탕으로 톤 가이드라인을 개선하세요.
제한 사항
- Eleven v3 Conversational은 프로페셔널 음성 복제(PVC)의 특성을 보존하지 않습니다. 출력 음성이 원본 PVC 음성과 다르게 들릴 수 있습니다.
- 표현 태그 효과는 일반적인 전달 방식으로 돌아가기 전까지 약 4~5단어 동안 지속됩니다.
- 표현력은 음성과 언어에 따라 달라질 수 있습니다.
FAQ
표현 모드는 비용이 더 드나요?
아니요. Eleven v3 Conversational의 가격은 Agents 내 다른 ElevenLabs TTS 모델과 같으며, 분당 $0.08부터 시작합니다.
표현 모드는 어떻게 활성화하나요?
에이전트의 TTS 모델로 V3 Conversational을 선택하세요. 이 모델에서는 표현 모드가 기본으로 활성화됩니다.
턴테이킹 시스템은 어떻게 작동하나요?
이 시스템은 감정 신호와 말하기 패턴을 포함한 Scribe v2 Realtime의 실시간 신호를 사용해 에이전트가 언제 응답해야 하는지 예측합니다. 트랜스크립트와 단어가 말해진 방식(억양)을 모두 분석하여 자연스러운 타이밍으로 응답합니다.
프로페셔널 음성 복제와 표현 모드를 함께 사용할 수 있나요?
Eleven v3 Conversational은 현재 PVC 특성을 잘 보존하지 않습니다. PVC 음성 정체성을 유지하는 것이 중요하다면 Flash v2 사용을 고려하세요.
Eleven v3 Conversational은 몇 개 언어를 지원하나요?
Eleven v3 Conversational은 Flash 모델의 약 32개 언어에서 확장된 70개 이상의 언어를 지원합니다. 여기에는 이전에 미묘한 표현이 부족했던 일본어 같은 언어의 향상된 표현력도 포함됩니다.
ElevenAgents의 다른 TTS 모델과 비교하면 어떤가요?
Eleven v3 Conversational은 Flash 및 Multilingual v2보다 더 넓은 감정 표현 범위를 제공하며, 대화 문맥에 따라 전달 방식을 조정할 수 있습니다. Flash의 약 32개 언어와 비교해 70개 이상의 언어를 지원합니다. 가격은 다른 모델과 같습니다.
