Ir al contenido

¿Qué son las llamadas a herramientas? Guía completa para integrar IA

Escrito por
Jack Limebear
Publicado
Última actualización

EscucharEscucha este artículo

Los modelos de IA se basan en sus datos de entrenamiento y extrapolan a partir de ellos para responder a usuarios. Pero ¿qué ocurre cuando una petición va más allá del alcance de esa información inicial?

La llamada a herramientas es una capacidad que ayuda a cubrir estas carencias de conocimiento y funcionalidad, permitiendo que un modelo solicite ayuda adicional a herramientas y sistemas externos, ya sea para activar una acción como enviar una actualización o extraer contenido de un panel de datos.

En este artículo, veremos qué es la llamada a herramientas, cómo se compara con la llamada a funciones y cómo ElevenAgents utiliza la llamada a herramientas en flujos de trabajo de IA conversacional.

Resumen

  • La llamada a herramientas permite que un modelo de IA active acciones y solicite información a herramientas externas y API.
  • Un modelo de IA no ejecuta activamente una herramienta. En su lugar, una capa de aplicación ejecuta la petición.
  • La llamada a herramientas sigue un proceso de cinco pasos y puede activar varias herramientas distintas en una misma petición.
  • La llamada a herramientas puede utilizarse para recuperar información, ejecutar código, controlar dispositivos o interactuar con flujos de trabajo y procesos.
  • ElevenAgents admite llamadas a herramientas en agentes de voz, lo que permite a tu asistente de IA conversacional completar tareas en tu nombre.

¿Qué es la llamada a herramientas?

La llamada a herramientas es una capacidad de un modelo de IA que le permite interactuar con otro sistema. Ese sistema puede ser una base de datos, una API, un software o cualquier otro recurso que le permita realizar una función que vaya más allá de sus datos de entrenamiento. 

La llamada a herramientas genera una petición para que un sistema de terceros realice una tarea, normalmente en formato JSON. Un sistema de IA utiliza la llamada a herramientas para consultar sistemas externos, obtener información en tiempo real, ejecutar comandos o realizar operaciones. La capacidad de llamar a herramientas permite a la IA agéntica completar tareas más complejas o de varios pasos accediendo a recursos externos y utilizando dinámicamente sistemas de terceros.

La capacidad de llamar a herramientas es lo que diferencia a los asistentes de IA agéntica de los LLM que solo pueden responder según lo que ya saben.

¿Por qué es importante la llamada a herramientas?

Los modelos de lenguaje de gran tamaño se entrenan con enormes volúmenes de datos históricos para desarrollar sus capacidades. Aunque esto los convierte en sistemas potentes para responder a usuarios y proporcionar información, tienen dificultades para ir más allá de su contexto de entrenamiento inicial y su corpus de información. Si pides a un LLM información que queda fuera de su alcance o sus capacidades, necesita ayuda externa para proporcionártela.

La llamada a herramientas proporciona esa ayuda externa y permite a los LLM obtener datos recientes de otras fuentes o integrarse en sistemas en producción que una empresa ya utiliza, como API de terceros o bases de datos internas.

La llamada a herramientas ofrece numerosas ventajas a los sistemas de IA:

  • Menos alucinaciones: Un sistema que se basa en llamadas directas a herramientas para verificar información trabaja con pruebas y datos, en lugar de inventar información o extrapolar a partir de los datos de entrenamiento.
  • Más autonomía y alcance: Un LLM con llamadas a herramientas puede completar acciones que van más allá de simplemente proporcionar información. 
  • Respuestas en tiempo real: Al consultar fuentes en directo, un LLM puede obtener datos en tiempo real de bases de datos o llamadas a API y ofrecerte información actualizada que no estaría disponible trabajando únicamente con datos de entrenamiento.
  • Procesos automatizados de varios pasos: Una tarea que puede requerir que interactúes con varios sistemas diferentes se reduce a un único prompt con un LLM que dispone de llamadas a herramientas. Puede consultar otros sistemas y obtener información por ti sin que tengas que salir de la ventana de interacción.

Gartner prevé que el 40 % de las aplicaciones empresariales estarán integradas con agentes de IA específicos para tareas a finales de 2026, frente a menos del 5 % en 2025. Un modelo que puede llamar a la herramienta adecuada para una tarea amplía sus capacidades y permite a usuarios hacer más mediante prompts en lenguaje natural.

Llamada a herramientas frente a generación aumentada por recuperación (RAG)

Tanto la generación aumentada por recuperación como la llamada a herramientas buscan datos que van más allá del contexto proporcionado por los datos de entrenamiento de un modelo, pero se centran en aspectos distintos. RAG se utiliza principalmente para contenido estático, como artículos, documentos y bases de conocimiento que conectas a un modelo. Proporciona a un LLM contexto adicional que ayuda a generar respuestas más completas.

La llamada a herramientas permite acceder dinámicamente a información, incluidos sistemas en tiempo real que cambian constantemente. RAG podría recuperar un PDF con los precios de un año concreto, mientras que la llamada a herramientas podría obtener al instante los precios en directo de un sistema conectado. La mayoría de los sistemas LLM utilizan estas capacidades conjuntamente, ya que tanto las bases de conocimiento como las herramientas en directo son importantes en muchos casos de uso.

RAG retrieves static knowledge; tool calling accesses live systems; most systems use both.

¿Cómo funciona la llamada a herramientas?

La llamada a herramientas sigue un patrón bastante estándar, tanto si un agente de IA llama a una aplicación interna como a un modelo externo. 

Aquí tienes una visión general de cómo funciona la llamada a herramientas:

  1. Detectar cuándo se necesita una llamada a herramienta
  2. Seleccionar la herramienta adecuada entre los sistemas conectados
  3. Crear y enviar una petición
  4. Se ejecuta la petición y se devuelve un resultado
  5. El modelo responde o realiza otra acción

Veámoslo con más detalle.

Five-step tool-calling flow from prompt to action; model requests, application executes.

Paso 1: Detectar cuándo se necesita una llamada a herramienta

Después de escribir una petición en lenguaje natural, un modelo lee tu prompt y evalúa si necesitará ayuda externa de una herramienta. Una pregunta que coincida con sus datos de entrenamiento no necesitará ayuda externa, pero otras, como las que van más allá del contexto del modelo, sí.

Preguntas como «¿Cuáles fueron nuestras cifras de ventas del segundo trimestre en Salesforce?» y «¿Cuál es el número actual de usuarios activos de nuestra tienda de Shopify?» requerirían una llamada a herramienta.

Paso 2: Seleccionar la herramienta adecuada entre los sistemas conectados

Cada herramienta a la que tiene acceso un modelo cuenta con un esquema: un nombre, una descripción en lenguaje natural de lo que hace y los parámetros que acepta. Un modelo compara tu petición con cada una de estas descripciones para encontrar la herramienta adecuada para la tarea. Especialmente cuando un agente dispone de un amplio catálogo de herramientas, ejecuta un proceso interno para filtrarlas y encontrar las relevantes, ya que revisar manualmente cientos de herramientas ralentizaría mucho la búsqueda de la herramienta adecuada.

Paso 3: Crear y enviar una petición

Después de seleccionar la herramienta adecuada, un modelo crea una llamada estructurada, a menudo en formato JSON. Esta llamada define qué herramienta utilizará y qué incluye la petición. Por ejemplo, consultar el tiempo en Bogotá podría tener este aspecto: {"name": "get_weather", "arguments": {"city": "Bogota"}}. El modelo genera esta llamada y la capa de aplicación la ejecuta en el siguiente paso.

Paso 4: Se ejecuta la petición y se devuelve un resultado 

La capa de aplicación recibe la petición del modelo y ejecuta la herramienta o llama a una API para procesarla. Después, la respuesta se devuelve al modelo original como contexto adicional, que puede usarla para completar su respuesta a un usuario. 

Paso 5: El modelo responde o realiza otra acción

Con los datos o la información obtenidos mediante la llamada a herramienta, el modelo responde a un usuario en lenguaje natural o confirma que se ha realizado una acción concreta. Esta última respuesta se produce si la tarea específica que quería completar un usuario está orientada a una acción, como publicar un mensaje en una plataforma concreta o introducir datos en una base de datos.

Si la tarea requiere más pasos, el modelo repetirá los pasos 1-4 según corresponda. Las peticiones más complejas pueden requerir llamar a varias herramientas antes de crear una respuesta final para un usuario. Por ejemplo, si un usuario quisiera conocer un tipo de cambio actual y después convertir divisas, el modelo tendría que ejecutar varios pasos de forma secuencial para lograr ese objetivo. 

Tipos de llamada a herramientas

La llamada a herramientas describe cualquier situación en la que un modelo llama a un sistema externo para obtener datos que van más allá de su entrenamiento subyacente. El proceso puede recurrir a varios sistemas diferentes, y muchos casos de uso utilizan distintos tipos de herramientas.

  • Recuperación de información: Incluye extraer datos de una fuente externa, como una API, una base de datos empresarial conectada o un índice de búsqueda, para responder a una pregunta que va más allá del contexto de entrenamiento original de un modelo.
  • Ejecución de código: La ejecución de cualquier script, proceso de transformación de datos o cálculo mediante un entorno de código. Normalmente se utiliza para analizar datos, en lugar de limitarse a describir cómo podría funcionar un análisis en la práctica.
  • Automatización de procesos: Describe cuándo una llamada a una API activa un flujo de trabajo específico en otro sistema, como interactuar con un CMS, programar una reunión, actualizar registros, enviar notificaciones o convertir peticiones en acciones completadas. Es especialmente habitual en sistemas agénticos que realizan tareas para una persona.
  • Control de dispositivos y sistemas: Las llamadas a herramientas que interactúan con otro dispositivo, un sistema de telefonía, un asistente de hogar inteligente y otros recursos pertenecen a esta categoría.

A menudo, la llamada a herramientas no encaja claramente en una sola de estas categorías. Puede haber llamadas de varios pasos y encadenadas que combinen varias de las categorías anteriores en una secuencia continua. Por ejemplo, podrías recuperar el estado del pedido de un cliente, activar un reembolso, actualizar tu CRM interno y transmitir esa información a un agente humano.

Four types of tool calling: retrieval, code, automation, and device control, often chained.

Llamada a herramientas frente a llamada a funciones: diferencias clave

La llamada a herramientas es una categoría más amplia que la llamada a funciones, ya que abarca un alcance mayor y una gama más diversa de capacidades potenciales. La llamada a funciones ocurre cuando un modelo genera una llamada estructurada, con argumentos, a una función predefinida.

Aquí tienes una tabla que resume las diferencias entre una llamada a herramienta y una llamada a función. 

Function calling
Overall scope
A model that can generate a function call for a specific predetermined action
Origin
OpenAI introduced the term back in 2023
Relationship
A narrow subset of tool calling
Commonly found
Within older API documentation or legacy parameters
Tool calling
Overall scope
A wide capability that relates to calling APIs, executing code, and interacting with external systems
Origin
The wider industry term that has now become popularized, stemming from a model’s ability to interact with multiple external tools
Relationship
A broad concept that includes function calling
Commonly found
Modern documentation used by most AI companies
Function calling is a narrow subset of tool calling; terms are often used interchangeably.

¿Qué fiabilidad tiene la llamada a herramientas? 

La fiabilidad de la llamada a herramientas depende por completo del modelo que realiza las llamadas. Del mismo modo, un fallo puede manifestarse de forma distinta en diferentes sistemas. Por ejemplo, un modelo de IA puede simplemente alucinar una respuesta tras fallar una llamada a herramienta, mientras que otro puede pedir al usuario que lo intente de nuevo. 

El Berkeley Function Calling Leaderboard es una clasificación de referencia habitual que compara el rendimiento de distintos modelos en llamadas a herramientas. Aunque se describe como una clasificación de llamadas a funciones, en la práctica mide la eficiencia de las llamadas a herramientas probando los modelos con llamadas a API, recopilando información de consultas a bases de datos, ejecutando llamadas en paralelo o respondiendo en conversaciones de varios turnos.

Los modelos se evalúan en aspectos como el coste total, la capacidad de buscar en la web, la precisión en conversaciones de varios turnos, la medición de alucinaciones, la latencia y mucho más. Si vas a ejecutar flujos de trabajo complejos o de varios pasos, es útil saber qué modelos ofrecen capacidades de llamada a herramientas más completas. 

Empieza a usar ElevenAgents para llamadas a herramientas

En ElevenAgents puedes elegir entre varios modelos para adaptar tu carga de trabajo al mejor modelo subyacente posible. Los agentes de voz utilizan herramientas, consultan pedidos, revisan registros, actualizan bases de datos y recopilan información de API.

Puedes utilizar distintos tipos de herramientas, incluidas herramientas de webhook para llamar a API externas, herramientas de cliente para activar acciones en aplicaciones o en un navegador, herramientas de código para lógica personalizada del lado del servidor, herramientas MCP que se conectan a servidores de herramientas externos y herramientas de sistema para acciones integradas, como transferir a un agente humano.

ElevenLabs también ofrece conectores nativos prediseñados para servicios como Zendesk, HubSpot, Salesforce y muchos más, por lo que no necesitas configurar integraciones personalizadas. Descubre más sobre ElevenAgents o regístrate para empezar hoy a crear agentes de voz con llamadas a herramientas.

Preguntas frecuentes

Artículos relacionados

Crea con el audio IA de la más alta calidad