Modelos
O ElevenAgents oferece uma interface unificada para conectar seu agente a vários modelos e provedores, com flexibilidade, confiabilidade e otimização de custos.
Principais recursos
- Acesso unificado: alterne entre provedores e modelos com poucas mudanças no código
- Alta confiabilidade: alterne automaticamente de um provedor para outro em caso de falha
- Monitoramento de gastos: acompanhe seus gastos entre diferentes modelos
Modelos compatíveis
Atualmente, os seguintes modelos têm suporte nativo e podem ser configurados nas configurações do agente:
Os preços normalmente são indicados em USD por 1 milhão de tokens, salvo especificação em contrário. Um token é uma unidade fundamental de dados de texto para LLMs, equivalente, em média, a cerca de 4 caracteres.
LLM personalizado
Você pode usar seu próprio LLM personalizado especificando o endpoint para o qual devemos enviar solicitações e fornecendo credenciais pelo nosso armazenamento seguro de segredos. Saiba mais sobre a integração de LLM personalizado.
Alguns modelos não estão disponíveis quando a residência de dados na UE está ativada. Consulte LGPD e residência de dados para detalhes sobre a disponibilidade.
Como escolher um modelo
Para selecionar o LLM mais adequado para seu aplicativo, considere vários fatores:
- Complexidade da tarefa: avalie os modelos com tarefas representativas do seu aplicativo
- Requisitos de latência: para conversas de voz ao vivo, escolha um modelo de baixa latência e meça o tempo de resposta com seus prompts e ferramentas
- Tamanho da janela de contexto: se seu aplicativo precisa processar, compreender ou recuperar informações de conversas longas ou documentos extensos, selecione modelos com janelas de contexto maiores
- Custo-benefício: equilibre o desempenho e os recursos desejados com seu orçamento. Os preços de LLMs podem variar bastante; לכן, analise a estrutura de preços (tokens de entrada, saída e cache) em relação aos seus padrões de uso esperados
- Conformidade com HIPAA: se seu aplicativo envolver Informações de Saúde Protegidas (PHI), é essencial usar um LLM designado como compatível com HIPAA e garantir que todo o processo de tratamento de dados atenda às normas regulatórias
O tamanho máximo do prompt de sistema é 2 MB, incluindo as instruções do seu agente, o conteúdo da base de conhecimento e outro contexto de nível de sistema.
Configuração do modelo
Temperatura
A temperatura controla a aleatoriedade das respostas do modelo. Valores mais baixos produzem resultados mais consistentes e focados, enquanto valores mais altos aumentam a criatividade e a variação.
- Baixa (0.0-0.3): respostas determinísticas e consistentes para interações estruturadas
- Média (0.4-0.7): equilíbrio entre criatividade e consistência
- Alta (0.8-1.0): respostas criativas e variadas para conversas dinâmicas
Configuração de LLM de backup
Configure LLMs de backup para garantir a continuidade da conversa quando o LLM principal falhar ou ficar indisponível.
Opções de configuração:
- Padrão: usa a sequência de fallback recomendada pela ElevenLabs
- Personalizado: defina sua própria sequência em cascata de modelos de backup
- Desativado: sem fallback (não recomendado para produção)
Desativar LLMs de backup significa que as conversas terminarão abruptamente se seu LLM principal falhar ou ficar indisponível. Isso não é recomendado para uso em produção.
Saiba mais sobre cascata de LLMs.
Raciocínio
O raciocínio ajuda os agentes a lidar com decisões complexas, como escolher entre ferramentas, aplicar políticas ou concluir workflows com várias etapas. Dependendo do modelo, você controla quanto raciocínio ele executa com um orçamento de pensamento ou um nível de esforço de raciocínio.
Orçamento de pensamento
Defina o número máximo de tokens de raciocínio com o controle deslizante numérico. Orçamentos maiores podem aumentar o tempo de resposta. Defina o orçamento como 0 para desativar o pensamento, quando o modelo permitir.
Esforço de raciocínio
O esforço de raciocínio controla quanto o modelo raciocina antes de responder. Os níveis disponíveis dependem do modelo selecionado.
Comece com um orçamento ou esforço menor para agentes de voz ao vivo, pois pensar mais pode atrasar a troca de turnos. Aumente-o para etapas de workflow que exigem decisões mais complexas.
Resumo de raciocínio
Ative o resumo de raciocínio para capturar o raciocínio retornado pelo modelo ao depurar respostas, chamadas de ferramentas ou caminhos de workflow. Ative Resumo de raciocínio nas configurações de LLM do agente ou defina enable_reasoning_summary pela API. A configuração fica desativada por padrão.
Para endpoints personalizados, veja como a ElevenLabs solicita e armazena o raciocínio.
O conteúdo de raciocínio está sujeito às configurações de retenção e remoção de PII. Você pode acessá-lo pelos seguintes canais:
Com o Modo de retenção zero, a ElevenLabs **não armazena conteúdo de raciocínio **. Ele é entregue apenas aos clientes de chat e webhooks após a chamada.
Limitações
- Solicitar um resumo de raciocínio pode aumentar a latência da resposta. Teste antes de ativá-lo em agentes de voz sensíveis à latência.
- Os provedores podem retornar um resumo, texto de pensamento, deltas brutos de raciocínio ou nenhum conteúdo exibível.
Como entender os preços
- Tokens: o uso de LLM geralmente é cobrado com base no número de tokens processados. Como referência geral para textos em inglês, 100 tokens equivalem aproximadamente a 75 palavras
- Preços de entrada vs. saída: os provedores costumam diferenciar os preços de tokens de entrada (os dados enviados ao modelo) e tokens de saída (os dados que o modelo gera em resposta)
- Preços de cache:
input_cache_read: refere-se ao custo associado à recuperação de dados de entrada processados anteriormente em um cache. O uso de dados em cache pode gerar economia quando entradas idênticas são processadas várias vezesinput_cache_write: é o custo associado ao armazenamento de dados de entrada em um cache. Alguns provedores de LLM podem cobrar por essa operação
- Os preços listados neste documento são por 1 milhão de tokens e se baseiam nas informações disponíveis no momento da redação. Esses preços estão sujeitos a alterações pelos provedores de LLM
Para saber as capacidades atuais dos modelos, preços e termos de serviço, consulte a documentação do provedor.
Conformidade com HIPAA
Alguns LLMs disponíveis em nossa plataforma podem ser adequados para uso em ambientes que exigem conformidade com HIPAA. Consulte a documentação sobre conformidade com HIPAA para mais detalhes.
Recursos relacionados
Modelos hospedados pela ElevenLabs
A ElevenLabs oferece acesso a vários modelos de IA, incluindo modelos selecionados de terceiros hospedados pela ElevenLabs.
Quando um modelo é designado como “Hospedado pela ElevenLabs”, ele é implantado e operado em uma infraestrutura gerenciada pela ElevenLabs. Atualmente, esses modelos são hospedados nos Estados Unidos ou na região da sua implantação empresarial.
Como identificar modelos hospedados pela ElevenLabs
Os modelos hospedados pela ElevenLabs são claramente identificados na interface da ElevenLabs. Procure a designação “Hospedado pela ElevenLabs” ao navegar ou selecionar modelos.
Como seus dados são tratados
Para modelos hospedados pela ElevenLabs, as solicitações são processadas na infraestrutura gerenciada pela ElevenLabs. Isso significa que o provedor original do modelo não recebe, acessa nem processa as entradas e saídas enviadas pela ElevenLabs.
Ao hospedar esses modelos, a ElevenLabs pode oferecer uma experiência consistente, mantendo o controle sobre a infraestrutura usada para atender às solicitações aos modelos.
Perguntas frequentes
Onde os modelos auto-hospedados são hospedados?
Os modelos hospedados pela ElevenLabs estão atualmente em uma infraestrutura localizada nos Estados Unidos ou na região da sua implantação empresarial.
O provedor original do modelo acessa meus dados ou metadados de uso?
Para modelos hospedados pela ElevenLabs, o desenvolvedor original do modelo nunca recebe suas entradas ou saídas e não tem acesso aos dados sobre a implantação que os processa.
Como sei se um modelo é hospedado pela ElevenLabs?
Os modelos hospedados pela ElevenLabs são claramente identificados na interface da ElevenLabs com a designação “Hospedado pela ElevenLabs”.