La respuesta corta
La monitorización de un agente difiere de la monitorización de un sistema convencional: el agente rara vez "cae". Permanece activo, pero su rendimiento disminuye. Por ello, las métricas clásicas de disponibilidad y errores no son suficientes; se requiere una capa que evalúe la calidad de sus decisiones, no solo su operatividad técnica.
Una estructura práctica de monitorización comprende tres niveles: un Trace para explicar interacciones individuales, Tendencias Semanales para identificar deterioros, y una Métrica de Resultado de Negocio que justifique la continuidad de la operación. Cada nivel responde a una pregunta diferente y está dirigido a una audiencia específica.
Tres niveles de monitorización
| Nivel | Pregunta que responde | Audiencia | Frecuencia |
|---|---|---|---|
| Trace | ¿Por qué esta interacción terminó así? | Equipo técnico y analistas | Según necesidad |
| Tendencia | ¿Qué está cambiando para bien o para mal? | Propietario del proceso y administrador de plataforma | Semanal |
| Resultado | ¿El agente justifica su existencia? | Dirección y Patrocinador | Mensual y trimestral |
Nivel 1: Componentes esenciales de un Trace
Un Trace útil permite reconstruir una decisión sin necesidad de consultar a nadie. Consta de siete elementos: la consulta formulada, el tema identificado, los segmentos de conocimiento recuperados, las acciones ejecutadas con sus parámetros, el resultado de cada acción, los puntos de aprobación y su decisión, y el motivo de la finalización.
El componente más frecuentemente olvidado son los segmentos de conocimiento recuperados. Sin ellos, es imposible distinguir entre dos fallos completamente diferentes: que el agente no encontrara la información, o que la encontrara y la usara incorrectamente. El primer caso se aborda con el contenido, el segundo con las instrucciones; una gestión incorrecta ha desperdiciado semanas en cada organización que hemos observado.
También es crucial vincular el Trace a un registro de negocio: un Case, Order u Opportunity. Sin esta vinculación, no es posible verificar si la interacción condujo finalmente a un resultado exitoso o a una nueva consulta.
Nivel 2: Tendencias recomendadas para seguir
Cinco métricas son suficientes para la mayoría de las implementaciones: tasa de finalización sin escalada, tasa de segundas consultas dentro de una semana, porcentaje de respuestas con fuente válida, tasa de fallos de acción, y consumo en relación con las tareas completadas.
La lectura debe realizarse en pares. Una alta contención con una alta tasa de segundas consultas no representa éxito. Un consumo que aumenta mientras las tareas se mantienen estables significa que el agente trabaja más intensamente para el mismo resultado, una señal temprana de deterioro del contenido.
Las alertas automáticas deben configurarse sobre cambios relativos, no sobre valores absolutos: un salto en la tasa de escalada, una disminución en el porcentaje de fuentes válidas, un aumento en los fallos de acción con un sistema externo específico.
La relación entre estas métricas y los costos se detalla en Costo de Agentforce y TCO.
Nivel 3: Resultado de negocio
Este nivel es determinante en la revisión trimestral. Incluye dos cifras: qué ha cambiado en la métrica del proceso preestablecida (tiempo de manejo, abandono, volumen de consultas al agente) y cuál es el costo de la tarea completada frente a la línea base.
Es fundamental establecer las definiciones de antemano y no modificarlas una vez que se observan los resultados. Cambiar la definición de "éxito" a mitad de camino es lo que más socava la confianza de la dirección en los datos, incluso cuando el cambio esté justificado.
Del análisis a la cola de mejora
El informe semanal no es el producto final. El producto final es una cola de trabajo. La práctica efectiva es la siguiente: muestreo de veinte interacciones fallidas o escaladas, clasificación según la causa raíz (brecha de contenido, etiquetado incorrecto, instrucción ambigua, fallo de acción o solicitud fuera de alcance), y apertura de un ítem de trabajo solo para la categoría más grande.
La regla para evitar desviaciones es: abordar una causa raíz por semana. Las organizaciones que intentan corregir cinco simultáneamente al final no saben qué mejoró la métrica y qué la empeoró.
Las brechas de contenido identificadas aquí son una entrada directa a la lista de redacción; el proceso se detalla en Gestión del Conocimiento para Agentforce.
Escenario: Un declive silencioso detectado a tiempo
Una compañía de servicios financieros implementó un agente interno que funcionó de manera estable durante cuatro meses. En la decimoquinta semana, la tasa de escalada aumentó gradualmente sin quejas; los agentes simplemente complementaban el proceso por sí mismos.
La alerta configurada para un aumento relativo en la escalada inició una investigación. El muestreo de Traces reveló que, en la mitad de los nuevos casos, no se recuperó ningún segmento relevante. La razón: un cambio en la política de producto llevó al archivado automático de once artículos de conocimiento, y no se redactaron alternativas.
La corrección tomó dos días y no requirió modificaciones en el agente. Sin la capa de monitorización, la brecha se habría descubierto solo cuando un gerente preguntara por qué el tiempo promedio de manejo había aumentado, probablemente después de un trimestre.
Riesgos y acciones preventivas
| Riesgo | Manifestación | Acción preventiva |
|---|---|---|
| Monitorización solo técnica | Todo en verde, pero respuestas de baja calidad | Métricas de calidad y escalada junto a métricas de disponibilidad |
| Trace sin segmentos de recuperación | Meses de conjeturas entre contenido y modelo | Registro obligatorio de los segmentos recuperados |
| Informe sin cola de trabajo | Datos presentados que no generan cambios | Muestreo semanal y un ítem de trabajo para una causa raíz |
| Cambio de definiciones a mitad de proceso | Pérdida de confianza en los datos | Establecer previamente las definiciones de éxito |
| Sin vinculación a registro de negocio | Imposibilidad de identificar nuevas consultas | Vincular Trace a Case u Order |
Tabla de métricas recomendadas
| Métrica | Definición | Umbral de alerta |
|---|---|---|
| Tasa de finalización | Finalización sin escalada y sin nuevas consultas | Disminución relativa significativa semana a semana |
| Tasa de escalada | Porcentaje de transferencias a un agente humano | Aumento relativo sostenido |
| Fuente válida | Porcentaje de respuestas con cita existente y vigente | Caída por debajo de un umbral preestablecido |
| Fallos de acción | Porcentaje de operaciones fallidas según sistema de destino | Aumento de fallos con un destino específico |
| Consumo por tarea | Unidades de consumo por tarea completada | Aumento sin incremento en el número de tareas |
Si necesita acompañamiento en la implementación de una capa de monitorización y un proceso de mejora semanal, el Servicio Agentforce e IA es el camino práctico a seguir.
Checklist para la implementación de la observabilidad
- ☐ El Trace registra la consulta, el tema, los segmentos recuperados, las acciones y el resultado.
- ☐ Cada Trace está vinculado a un registro de negocio.
- ☐ La política de retención distingue entre metadatos y contenido de la conversación.
- ☐ Se han seleccionado entre cinco y siete métricas de tendencia, máximo.
- ☐ Se han configurado alertas sobre cambios relativos, no sobre valores absolutos.
- ☐ Existe una rutina de muestreo semanal de interacciones fallidas.
- ☐ Se ha definido una taxonomía de causas raíz de fallos.
- ☐ El propietario del proceso de negocio participa en la revisión semanal.
- ☐ Las definiciones de éxito se han establecido antes del inicio de la medición.
