모델

사용 사례에 적합한 모델을 선택하는 방법을 알아보세요

ElevenAgents는 에이전트를 여러 모델 및 제공업체에 연결할 수 있는 통합 인터페이스를 제공하여 유연성, 안정성, 비용 최적화를 지원합니다.

주요 기능

  • 통합 액세스: 최소한의 코드 변경으로 제공업체와 모델 간 전환
  • 높은 안정성: 한 제공업체에 장애가 발생하면 다른 제공업체로 자동 전환
  • 지출 모니터링: 여러 모델 전반의 지출 모니터링

지원 모델

현재 다음 모델이 기본 지원되며 에이전트 설정에서 구성할 수 있습니다.

제공업체모델
ElevenLabsDeepSeek Flash 4.1
GLM 5.2
Qwen3.6-35B-A3B
Qwen3.5-397B-A17B
GoogleGemini 3.8 Flash
Gemini 3.7 Flash
Gemini 3.6 Flash
Gemini 3.5 Flash
Gemini 3.5 Flash-Lite
Gemini 3.1 Pro Preview
Gemini 3.1 Flash Lite
Gemini 3 Flash Preview
Gemini 2.5 Flash
Gemini 2.5 Flash Lite
OpenAIGPT-6.1 Sol
GPT-6 Astra
GPT-6 Sol
GPT-6 Luna
GPT-5.6 Sol
GPT-5.6 Terra
GPT-5.6 Luna
GPT-5.5
GPT-5.4
GPT-5.4 Mini
GPT-5.4 Nano
GPT-5.2
GPT-5.1
GPT-5
GPT-5 Mini
GPT-5 Nano
GPT-4.1
GPT-4.1 Mini
GPT-4.1 Nano
GPT-4o
GPT-4o Mini
AnthropicClaude Opus 5.5
Claude Opus 5
Claude Opus 4.8
Claude Opus 4.7
Claude Sonnet 5.5
Claude Sonnet 5
Claude Sonnet 4.6
Claude Sonnet 4.5
Claude Haiku 4.5

별도 명시가 없는 한 가격은 일반적으로 토큰 100만 개당 USD로 표시됩니다. 토큰은 LLM의 텍스트 데이터를 구성하는 기본 단위로, 평균적으로 약 4자에 해당합니다.

커스텀 LLM

요청을 전송할 엔드포인트를 지정하고 안전한 시크릿 저장소를 통해 자격 증명을 제공하면 자체 커스텀 LLM을 사용할 수 있습니다. 커스텀 LLM 통합에서 자세히 알아보세요.

EU 데이터 레지던시가 활성화된 경우 일부 모델을 사용할 수 없습니다. 제공 여부에 관한 자세한 내용은 GDPR 및 데이터 레지던시를 참조하세요.

모델 선택

애플리케이션에 가장 적합한 LLM을 선택하려면 여러 요소를 고려해야 합니다.

  • 작업 복잡도: 애플리케이션의 대표적인 작업을 기준으로 모델을 평가하세요.
  • 지연 시간 요구사항: 실시간 음성 대화에는 지연 시간이 짧은 모델을 선택하고, 프롬프트와 도구를 사용해 응답 시간을 측정하세요.
  • 컨텍스트 윈도우 크기: 애플리케이션에서 긴 대화나 방대한 문서의 정보를 처리, 이해 또는 기억해야 한다면 컨텍스트 윈도우가 더 큰 모델을 선택하세요.
  • 비용 효율성: 원하는 성능과 기능을 예산에 맞춰 조정하세요. LLM 가격은 크게 달라질 수 있으므로 예상 사용 패턴에 맞춰 가격 구조(입력, 출력, 캐시 토큰)를 분석하세요.
  • HIPAA 규정 준수: 애플리케이션에서 보호 건강 정보(PHI)를 다루는 경우, HIPAA 준수로 지정된 LLM을 사용하고 전체 데이터 처리 과정이 규제 기준을 충족하는지 확인하는 것이 중요합니다.

최대 시스템 프롬프트 크기는 2MB이며, 여기에는 에이전트 지침, 지식 베이스 콘텐츠 및 기타 시스템 수준 컨텍스트가 포함됩니다.

모델 구성

온도

온도는 모델 응답의 무작위성을 제어합니다. 값이 낮을수록 더 일관되고 집중된 출력을 생성하며, 값이 높을수록 창의성과 다양성이 증가합니다.

  • 낮음(0.0-0.3): 구조화된 상호작용을 위한 결정론적이고 일관된 응답
  • 중간(0.4-0.7): 창의성과 일관성의 균형
  • 높음(0.8-1.0): 역동적인 대화를 위한 창의적이고 다양한 응답

백업 LLM 구성

기본 LLM에 장애가 발생하거나 사용할 수 없게 될 때 대화가 계속되도록 백업 LLM을 구성하세요.

구성 옵션:

  • 기본값: ElevenLabs에서 권장하는 폴백 순서를 사용합니다.
  • 커스텀: 자체 백업 모델 캐스케이드 순서를 정의합니다.
  • 비활성화됨: 폴백 없음(프로덕션 환경에서는 사용을 강력히 권장하지 않음)

백업 LLM을 비활성화하면 기본 LLM에 장애가 발생하거나 사용할 수 없게 될 경우 대화가 즉시 종료됩니다. 프로덕션 환경에서는 사용을 강력히 권장하지 않습니다.

LLM 캐스케이딩에서 자세히 알아보세요.

추론

추론은 도구 간 선택, 정책 적용, 여러 단계의 워크플로 완료와 같은 복잡한 의사 결정을 에이전트가 처리하도록 돕습니다. 모델에 따라 사고 예산 또는 추론 노력 수준으로 수행할 추론의 양을 제어할 수 있습니다.

사고 예산

숫자 슬라이더로 최대 추론 토큰 수를 설정하세요. 예산이 클수록 응답 시간이 늘어날 수 있습니다. 모델이 허용하는 경우 예산을 0으로 설정하면 사고를 비활성화할 수 있습니다.

추론 노력

추론 노력은 모델이 답변하기 전에 수행하는 추론의 양을 제어합니다. 사용 가능한 수준은 선택한 모델에 따라 다릅니다.

추가 사고는 턴 전환을 지연시킬 수 있으므로 실시간 음성 에이전트에서는 더 낮은 예산 또는 노력 수준부터 시작하세요. 더 복잡한 의사 결정이 필요한 워크플로 단계에서는 이를 높이세요.

추론 요약

응답, 도구 호출 또는 워크플로 경로를 디버깅할 때 모델이 반환한 추론을 캡처하려면 추론 요약을 활성화하세요. 에이전트의 LLM 설정에서 추론 요약을 켜거나 API를 통해 enable_reasoning_summary를 설정하세요. 이 설정은 기본적으로 꺼져 있습니다.

커스텀 엔드포인트의 경우 ElevenLabs가 추론을 요청하고 저장하는 방법을 참조하세요.

추론 콘텐츠에는 보존 및 PII 마스킹 설정이 적용됩니다. 다음 채널을 통해 액세스할 수 있습니다.

대상제공 여부
대화 기록추론 배지에서 확인 가능
대화 가져오기 API트랜스크립트 항목의 reasoning 필드에 반환
OpenTelemetry통화 후 에이전트 응답 스팬에 elevenlabs.reasoning_content로 포함
클라이언트 이벤트텍스트 대화에서만 agent_reasoning_response_part로 제공

보존 없음 모드에서는 ElevenLabs가 **추론 콘텐츠를 저장하지 않습니다 **. 채팅 클라이언트와 통화 후 웹훅에만 전달됩니다.

제한 사항

  • 추론 요약을 요청하면 응답 지연 시간이 늘어날 수 있습니다. 지연 시간에 민감한 음성 에이전트에 활성화하기 전에 테스트하세요.
  • 제공업체는 요약, 사고 텍스트, 원시 추론 델타 또는 표시할 수 있는 콘텐츠 없음을 반환할 수 있습니다.

가격 이해하기

  • 토큰: LLM 사용량은 일반적으로 처리된 토큰 수를 기준으로 청구됩니다. 영어 텍스트의 일반적인 기준으로 100토큰은 약 75단어에 해당합니다.
  • 입력 및 출력 가격: 제공업체는 입력 토큰(모델에 전송하는 데이터)과 출력 토큰(모델이 응답으로 생성하는 데이터)의 가격을 구분하는 경우가 많습니다.
  • 캐시 가격:
    • input_cache_read: 이전에 처리된 입력 데이터를 캐시에서 가져오는 데 드는 비용입니다. 동일한 입력을 여러 번 처리하는 경우 캐시된 데이터를 활용하면 비용을 절감할 수 있습니다.
    • input_cache_write: 입력 데이터를 캐시에 저장하는 데 드는 비용입니다. 일부 LLM 제공업체는 이 작업에 요금을 부과할 수 있습니다.
  • 이 문서에 나열된 가격은 토큰 100만 개당 가격이며, 작성 시점에 제공되는 정보를 기반으로 합니다. 이 가격은 LLM 제공업체에 의해 변경될 수 있습니다.
  • 패스스루 가격: ElevenLabs는 별도 마진 없이 제공업체의 공개 가격으로 타사 LLM 비용을 그대로 청구합니다. 일부 Gemini 및 Claude 모델은 미국 및 EU 트래픽에 청구되는 Vertex AI 리전(글로벌 외) 가격에 맞춰져 있으며, Vertex 리전 요율과 동일하게 입력, 출력 및 캐시 토큰이 10% 인상됩니다.

현재 모델 기능, 가격 및 서비스 약관은 제공업체 문서를 참조하세요.

HIPAA 규정 준수

플랫폼에서 제공하는 일부 LLM은 HIPAA 규정 준수가 필요한 환경에서 사용하기에 적합할 수 있습니다. 자세한 내용은 HIPAA 규정 준수 문서를 참조하세요.

관련 리소스

ElevenLabs에서 호스팅하는 모델

ElevenLabs는 ElevenLabs에서 호스팅하는 일부 타사 모델을 포함하여 다양한 AI 모델에 대한 액세스를 제공합니다.

모델이 “ElevenLabs에서 호스팅”으로 지정된 경우, 해당 모델은 ElevenLabs가 관리하는 인프라에 배포되고 운영됩니다. 이러한 모델은 현재 미국 또는 엔터프라이즈 배포 지역에서 호스팅됩니다.

ElevenLabs에서 호스팅하는 모델 식별 방법

ElevenLabs에서 호스팅하는 모델은 ElevenLabs 인터페이스에 명확히 표시됩니다. 모델을 탐색하거나 선택할 때 “ElevenLabs에서 호스팅” 표시를 확인하세요.

데이터 처리 방식

ElevenLabs에서 호스팅하는 모델의 경우 요청은 ElevenLabs가 관리하는 인프라 내에서 처리됩니다. 즉, 원래 모델 제공업체는 ElevenLabs를 통해 제출된 입력 및 출력을 수신, 액세스 또는 처리하지 않습니다.

이러한 모델을 호스팅함으로써 ElevenLabs는 모델 요청을 처리하는 데 사용되는 인프라를 제어하면서 일관된 경험을 제공할 수 있습니다.

자주 묻는 질문

자체 호스팅 모델은 어디에서 호스팅되나요?

ElevenLabs에서 호스팅하는 모델은 현재 미국 또는 엔터프라이즈 배포 지역에 위치한 인프라에서 호스팅됩니다.

원래 모델 제공업체가 내 데이터 또는 사용 메타데이터에 액세스하나요?

ElevenLabs에서 호스팅하는 모델의 경우, 모델의 원래 개발자는 입력이나 출력을 받지 않으며 이를 처리하는 배포에 관한 데이터에도 액세스할 수 없습니다.

모델이 ElevenLabs에서 호스팅되는지 어떻게 알 수 있나요?

ElevenLabs에서 호스팅하는 모델은 ElevenLabs 인터페이스에서 “ElevenLabs에서 호스팅” 표시로 명확하게 식별됩니다.