Entrada multimodal

Configura los archivos adjuntos y la entrada por teclado de tu agente.

Descripción general

La configuración de entrada multimodal controla formas adicionales en las que usuarios pueden enviar información al agente, más allá de la voz. Se encuentra en la pestaña Avanzado del agente, en Entrada multimodal.

Entrada de archivos

La entrada de archivos permite que usuarios envíen imágenes y PDF al agente en el chat. El agente puede leer esos archivos cuando el modelo seleccionado admite la entrada de imágenes o documentos.

Los archivos adjuntos se ignoran si el modelo no admite el tipo de archivo, aunque la entrada de archivos esté activada.

Configuración

CampoTipoPredeterminadoDescripción
enabledbooleantrueCuando es true, usuarios pueden adjuntar imágenes o PDF si el modelo admite ese tipo de entrada.
max_files_in_memoryinteger10Cuántos archivos subidos recientemente se conservan en memoria a la vez. Intervalo: de 1 a 10. Cuando se alcanza el límite, los archivos más antiguos se sustituyen por un breve resumen.
max_files_per_conversationinteger10Total de archivos que un usuario puede subir en una conversación. Las subidas se facturan por archivo. Usa -1 para no establecer límite. Debe ser -1 o mayor o igual que max_files_in_memory.

Usuarios pueden adjuntar archivos en el widget, en canales de chat compatibles como Slack o mediante la API subir archivo de conversación.

1

Abre Entrada multimodal

Abre tu agente en el panel, confirma que el modelo seleccionado admite la entrada de imágenes o PDF y ve a la pestaña Avanzado.

2

Activa los archivos adjuntos

En Entrada multimodal, activa Permitir archivos adjuntos.

3

Establece los límites de archivos

Si lo deseas, configura Archivos conservados en memoria y Máximo de archivos por conversación.

4

Guarda los cambios

Guarda el agente. A continuación, usuarios podrán adjuntar imágenes y PDF en el chat.

Entrada DTMF

La entrada DTMF permite que quienes llaman introduzcan dígitos en el teclado de su teléfono durante una llamada. Úsala para recopilar números de teléfono, opciones de menú y otras entradas numéricas sin depender del reconocimiento de voz.

Es lo contrario de la herramienta del sistema reproducir tono de pulsación del teclado, que envía tonos desde el agente.

Solo se admite DTMF fuera de banda de Twilio, trunking SIP (telefonía) o Genesys. Los tonos dentro de banda en el flujo de audio se ignoran. El widget web y los canales de chat no pueden enviar DTMF.

Cada pulsación del teclado se almacena en un búfer hasta que se completa la secuencia. Al completar una secuencia se crea un turno de usuario.

  1. Quien llama pulsa una tecla. El primer dígito interrumpe al agente si está hablando.
  2. Los dígitos posteriores se añaden al mismo búfer.
  3. La secuencia se completa cuando quien llama pulsa # (si está activada la finalización con almohadilla) o cuando no llegan más dígitos antes de que termine el tiempo de espera.
  4. El agente recibe los dígitos recopilados como un turno de usuario y responde.

# es un terminador cuando está activada la finalización con almohadilla; no se incluye en la cadena recopilada. Se ignora un # pulsado con el búfer vacío. El búfer acepta 0-9, *, # y A-D, hasta un máximo de 50 caracteres.

Configuración

conversation_config.conversation.dtmf_input_settings es null cuando la entrada DTMF está desactivada. Cuando está activada, los valores predeterminados son:

CampoTipoPredeterminadoDescripción
dtmf_input_timeoutfloat2.0Segundos que se espera después de la última pulsación antes de completar la secuencia. Intervalo: de 0.5 a 10.0.
hash_terminatorbooleantrueSi es true, # completa la secuencia inmediatamente y no se incluye en los dígitos recopilados.
redact_inputbooleanfalseSi es true, las entradas del teclado se sustituyen por <REDACTED> en la transcripción almacenada, el registro de conversación y el análisis.

La redacción se aplica al turno de teclado en los datos de conversación almacenados. No oculta los dígitos al agente durante la llamada en directo ni reescribe los dígitos que el agente dice o envía a una herramienta. Esto es distinto de la redacción del historial de conversación.

1

Abre Entrada multimodal

Abre tu agente en el panel y ve a la pestaña Avanzado.

2

Activa la entrada DTMF

En Entrada multimodal, activa Habilitar entrada DTMF.

3

Configura el tiempo de espera y la redacción

Si lo deseas, configura Tiempo de espera de entrada DTMF, Usar # para completar la entrada DTMF y Redactar entrada DTMF.

4

Guarda los cambios

Guarda el agente, llama por teléfono e introduce dígitos en el teclado.

Actualiza el prompt del sistema del agente para que sepa cuándo pedir una entrada por teclado. Por ejemplo:

If you need the caller's phone number, ask them to type it on their keypad. Wait for the DTMF
input before continuing.