La respuesta corta

La monitorización de un agente difiere de la monitorización de un sistema convencional: el agente rara vez "cae". Permanece activo, pero su rendimiento disminuye. Por ello, las métricas clásicas de disponibilidad y errores no son suficientes; se requiere una capa que evalúe la calidad de sus decisiones, no solo su operatividad técnica.

Una estructura práctica de monitorización comprende tres niveles: un Trace para explicar interacciones individuales, Tendencias Semanales para identificar deterioros, y una Métrica de Resultado de Negocio que justifique la continuidad de la operación. Cada nivel responde a una pregunta diferente y está dirigido a una audiencia específica.

Tres niveles de monitorización

NivelPregunta que respondeAudienciaFrecuencia
Trace¿Por qué esta interacción terminó así?Equipo técnico y analistasSegún necesidad
Tendencia¿Qué está cambiando para bien o para mal?Propietario del proceso y administrador de plataformaSemanal
Resultado¿El agente justifica su existencia?Dirección y PatrocinadorMensual y trimestral

Nivel 1: Componentes esenciales de un Trace

Un Trace útil permite reconstruir una decisión sin necesidad de consultar a nadie. Consta de siete elementos: la consulta formulada, el tema identificado, los segmentos de conocimiento recuperados, las acciones ejecutadas con sus parámetros, el resultado de cada acción, los puntos de aprobación y su decisión, y el motivo de la finalización.

El componente más frecuentemente olvidado son los segmentos de conocimiento recuperados. Sin ellos, es imposible distinguir entre dos fallos completamente diferentes: que el agente no encontrara la información, o que la encontrara y la usara incorrectamente. El primer caso se aborda con el contenido, el segundo con las instrucciones; una gestión incorrecta ha desperdiciado semanas en cada organización que hemos observado.

También es crucial vincular el Trace a un registro de negocio: un Case, Order u Opportunity. Sin esta vinculación, no es posible verificar si la interacción condujo finalmente a un resultado exitoso o a una nueva consulta.

Nivel 2: Tendencias recomendadas para seguir

Cinco métricas son suficientes para la mayoría de las implementaciones: tasa de finalización sin escalada, tasa de segundas consultas dentro de una semana, porcentaje de respuestas con fuente válida, tasa de fallos de acción, y consumo en relación con las tareas completadas.

La lectura debe realizarse en pares. Una alta contención con una alta tasa de segundas consultas no representa éxito. Un consumo que aumenta mientras las tareas se mantienen estables significa que el agente trabaja más intensamente para el mismo resultado, una señal temprana de deterioro del contenido.

Las alertas automáticas deben configurarse sobre cambios relativos, no sobre valores absolutos: un salto en la tasa de escalada, una disminución en el porcentaje de fuentes válidas, un aumento en los fallos de acción con un sistema externo específico.

La relación entre estas métricas y los costos se detalla en Costo de Agentforce y TCO.

Nivel 3: Resultado de negocio

Este nivel es determinante en la revisión trimestral. Incluye dos cifras: qué ha cambiado en la métrica del proceso preestablecida (tiempo de manejo, abandono, volumen de consultas al agente) y cuál es el costo de la tarea completada frente a la línea base.

Es fundamental establecer las definiciones de antemano y no modificarlas una vez que se observan los resultados. Cambiar la definición de "éxito" a mitad de camino es lo que más socava la confianza de la dirección en los datos, incluso cuando el cambio esté justificado.

Del análisis a la cola de mejora

El informe semanal no es el producto final. El producto final es una cola de trabajo. La práctica efectiva es la siguiente: muestreo de veinte interacciones fallidas o escaladas, clasificación según la causa raíz (brecha de contenido, etiquetado incorrecto, instrucción ambigua, fallo de acción o solicitud fuera de alcance), y apertura de un ítem de trabajo solo para la categoría más grande.

La regla para evitar desviaciones es: abordar una causa raíz por semana. Las organizaciones que intentan corregir cinco simultáneamente al final no saben qué mejoró la métrica y qué la empeoró.

Las brechas de contenido identificadas aquí son una entrada directa a la lista de redacción; el proceso se detalla en Gestión del Conocimiento para Agentforce.

Escenario: Un declive silencioso detectado a tiempo

Una compañía de servicios financieros implementó un agente interno que funcionó de manera estable durante cuatro meses. En la decimoquinta semana, la tasa de escalada aumentó gradualmente sin quejas; los agentes simplemente complementaban el proceso por sí mismos.

La alerta configurada para un aumento relativo en la escalada inició una investigación. El muestreo de Traces reveló que, en la mitad de los nuevos casos, no se recuperó ningún segmento relevante. La razón: un cambio en la política de producto llevó al archivado automático de once artículos de conocimiento, y no se redactaron alternativas.

La corrección tomó dos días y no requirió modificaciones en el agente. Sin la capa de monitorización, la brecha se habría descubierto solo cuando un gerente preguntara por qué el tiempo promedio de manejo había aumentado, probablemente después de un trimestre.

Riesgos y acciones preventivas

RiesgoManifestaciónAcción preventiva
Monitorización solo técnicaTodo en verde, pero respuestas de baja calidadMétricas de calidad y escalada junto a métricas de disponibilidad
Trace sin segmentos de recuperaciónMeses de conjeturas entre contenido y modeloRegistro obligatorio de los segmentos recuperados
Informe sin cola de trabajoDatos presentados que no generan cambiosMuestreo semanal y un ítem de trabajo para una causa raíz
Cambio de definiciones a mitad de procesoPérdida de confianza en los datosEstablecer previamente las definiciones de éxito
Sin vinculación a registro de negocioImposibilidad de identificar nuevas consultasVincular Trace a Case u Order

Tabla de métricas recomendadas

MétricaDefiniciónUmbral de alerta
Tasa de finalizaciónFinalización sin escalada y sin nuevas consultasDisminución relativa significativa semana a semana
Tasa de escaladaPorcentaje de transferencias a un agente humanoAumento relativo sostenido
Fuente válidaPorcentaje de respuestas con cita existente y vigenteCaída por debajo de un umbral preestablecido
Fallos de acciónPorcentaje de operaciones fallidas según sistema de destinoAumento de fallos con un destino específico
Consumo por tareaUnidades de consumo por tarea completadaAumento sin incremento en el número de tareas

Si necesita acompañamiento en la implementación de una capa de monitorización y un proceso de mejora semanal, el Servicio Agentforce e IA es el camino práctico a seguir.

Checklist para la implementación de la observabilidad

  • ☐ El Trace registra la consulta, el tema, los segmentos recuperados, las acciones y el resultado.
  • ☐ Cada Trace está vinculado a un registro de negocio.
  • ☐ La política de retención distingue entre metadatos y contenido de la conversación.
  • ☐ Se han seleccionado entre cinco y siete métricas de tendencia, máximo.
  • ☐ Se han configurado alertas sobre cambios relativos, no sobre valores absolutos.
  • ☐ Existe una rutina de muestreo semanal de interacciones fallidas.
  • ☐ Se ha definido una taxonomía de causas raíz de fallos.
  • ☐ El propietario del proceso de negocio participa en la revisión semanal.
  • ☐ Las definiciones de éxito se han establecido antes del inicio de la medición.