텍스트 음성 변환과 텍스트 대화 WebSocket 비교
텍스트 음성 변환과 텍스트 대화 WebSocket 비교
이 가이드에서는 음성 스트리밍에 적합한 WebSocket을 선택하는 방법과 두 프로토콜의 차이점을 설명합니다.
ElevenLabs는 합성 음성 스트리밍을 위한 두 가지 WebSocket 제품을 제공합니다. 두 제품은 서로 다른 문제를 해결하며, 다른 메시지 형식을 받고, 다른 모델을 대상으로 합니다.
어떤 WebSocket을 사용해야 하나요?
텍스트 음성 변환(TTS) WebSocket은 일반 텍스트를 연결당 하나의 음성으로 스트리밍할 때 사용하세요(음성은 URL에 고정됨). Flash 또는 Multilingual v2 같은 v3 이외 모델, 선택적 SSML, 청크 스케줄 또는 에이전트 스타일의 인터럽트 처리를 위한 다중 컨텍스트 변형이 필요할 때 적합합니다.
텍스트 대화(TTD) WebSocket은 표현력 있는 전달 방식, 청크별 voice_id, 턴 경계(new_turn), 서버에서 v3에 사용되는 것과 동일한 대화 지향 버퍼링 등 Eleven v3 대화 동작이 필요할 때 사용하세요.
일괄 처리 또는 HTTP 스트리밍 대화(한 번의 호출로 전체 요청)의 경우 WebSocket 대신 대화 생성 또는 대화 스트리밍을 사용하세요.
비교
TTS WebSocket이 더 적합한 경우
- 지연 시간 또는 언어 지원 범위를 위해 이미 Flash 또는 Multilingual v2를 통합했습니다.
- 연결당 하나의 내레이터 음성과 간단한 프레임당 텍스트 프로토콜을 원합니다.
- 끼어들기 및 병렬 발화를 위해 다중 컨텍스트 오케스트레이션이 필요합니다(다중 컨텍스트 가이드).
TTS WebSocket 전체 안내는 실시간 오디오 생성을 참조하세요.
TTD WebSocket이 더 적합한 경우
- Eleven v4 대화(표현 태그, 대화형 속도, 다중 화자 대사)를 대상으로 합니다.
- 새 연결을 열지 않고도 줄마다 화자 음성을 변경할 수 있는 스크립트 기반 또는 LLM 생성 대화를 스트리밍합니다.
- 서버에서 v4 전용 대화 생성을 위해 WebSocket 형식의 점진적 입력을 원합니다.
실습 안내는 실시간 텍스트 대화를 참조하세요. 프로토콜 세부 정보는 API 레퍼런스에 있습니다.