Los agentes de IA no son deterministas. El mismo agente con los mismos permisos puede ser fiable el martes y filtrar PII el viernes. La puntuación de confianza de agentes sustituye el control de acceso binario por permisos basados en el comportamiento que se actualizan continuamente, en producción, a lo largo de cinco dimensiones del comportamiento del agente. Así es como VeriSwarm Gate puntúa a los agentes — y por qué una puntuación vale más para un operador que una concesión de permisos.
La puntuación de confianza de agentes es un sistema de calificación en tiempo de ejecución, ponderado por comportamiento, que cuantifica cuánta autonomía debería concederse a un agente de IA concreto en un momento dado, según su comportamiento observado en las dimensiones de identidad, riesgo, fiabilidad, autonomía y calibración. A diferencia del control de acceso estático, la puntuación se actualiza a medida que llegan nuevos eventos e impulsa un nivel de política — allow, review o deny — para cada decisión que el agente intenta tomar.
El control de acceso tradicional es binario. Un agente tiene permiso o no lo tiene. Ese modelo funcionaba cuando el software era determinista; una función con permiso para leer una base de datos siempre la leía de la misma manera. Los agentes no son deterministas. El mismo agente con los mismos permisos puede:
El control de acceso binario no capta nada de esto. Un agente que lleva 48 horas comportándose mal tiene el mismo acceso que uno que ha sido perfecto durante seis meses. La puntuación de confianza cierra esa brecha.
Una puntuación de confianza compuesta que reduce todo a un solo número es solo eso, un número. Una puntuación desglosada en cinco dimensiones ortogonales es un diagnóstico. Gate puntúa a los agentes en cinco dimensiones, y el nivel de política se deriva de las cinco — no de un único valor consolidado.
¿Qué tan consolidada está la identidad de este agente? ¿Está verificado? ¿Tiene un propietario humano acreditado? ¿Ha operado el tiempo suficiente para construir un historial?
¿Ha estado este agente involucrado en incidentes de seguridad, uso indebido de herramientas, violaciones de políticas o exposición de PII? El riesgo sube cuando ocurren incidentes y decae lentamente con el tiempo.
¿Completa este agente sus tareas con éxito? ¿Gestiona los errores con elegancia? ¿Escala cuando corresponde? La fiabilidad se gana con un comportamiento bueno y constante.
¿Cuánta independencia debería concederse a este agente? Meses fiables ganan más autonomía. Una prueba de seguridad fallida la recorta.
¿Sabe este agente lo que no sabe? La calibración compara la confianza que un agente reporta sobre una tarea con el resultado que realmente obtuvo, puntuado con una métrica de Brier continua. Un agente confiadamente equivocado y uno bien calibrado pueden mostrar la misma cifra de fiabilidad — la calibración es lo que los distingue.
Sobre por qué una puntuación compuesta única realmente no cumple su función a escala de producción, el argumento en profundidad está en Identidad, riesgo, fiabilidad, autonomía: por qué una sola puntuación de confianza no basta para agentes en producción. La calibración se incorporó al modelo como quinta dimensión en 2026-Q3 — el razonamiento detrás de esa incorporación está en La quinta dimensión: cómo medir si un agente sabía lo que no sabía.
Los cambios de puntuación están impulsados por eventos. Gate usa una taxonomía estandarizada de 24 eventos en la que se mapea el flujo de ingestión de cada cliente, sin importar el framework — LangChain, CrewAI, AutoGen, personalizado — sobre el que corra el agente. La taxonomía se agrupa por dimensión:
agent.confidence_reported) emparejada con el resultado observado de la tarea (agent.task_outcome).Se pueden añadir tipos de eventos personalizados a través de la API. Los nombres de eventos heredados (incluido el espacio de nombres agentgate_* de la vida anterior de la plataforma) se mapean automáticamente en la taxonomía.
Consideremos un agente de IA de atención al cliente que gestiona correos electrónicos para una empresa de comercio electrónico.
Los permisos del agente cambiaron cuatro veces en tres meses sin que nadie editara una matriz de permisos. Ese es el mecanismo.
Un chatbot de atención al cliente y un agente de triaje médico no deberían compartir las mismas reglas de confianza. Los perfiles de puntuación permiten a un tenant sobrescribir los valores predeterminados del motor — pesos de dimensión distintos, umbrales de nivel de política distintos, sensibilidades de eventos distintas — por sector. Hoy se ofrecen once perfiles predefinidos, siete de ellos verticales con calibración (salud, servicios financieros, legal, software, seguridad, comercio electrónico, y un perfil general con calibración); los perfiles personalizados están disponibles a partir de Pro.
El argumento de por qué un único umbral no puede sobrevivir tanto al tráfico de salud como al de comercio electrónico se detalla en Una talla no sirve para todos: cómo configurar umbrales de confianza para agentes de salud frente a comercio electrónico.
Suelen confundirse y no deberían. La evaluación de LLM califica un modelo con un benchmark, sin conexión, antes del despliegue. La puntuación de confianza de agentes califica a un agente desplegado según su comportamiento en producción, de forma continua, después del despliegue. El conjunto de evaluación te dice si el modelo puede responder una pregunta de BoolQ; la puntuación de confianza te dice si el agente no filtró el SSN de un cliente el martes. Ambas cosas tienen valor. No son sustitutas la una de la otra.
La delimitación completa — La puntuación de agentes no es evaluación de LLM. Esta es la diferencia.
Una puntuación de confianza no es una identidad. Una identidad no es una decisión de política. Confundir cualquiera de estos pares es la razón por la que las arquitecturas de gobernanza de agentes de IA fallan en producción. La identidad responde quién es este agente. La puntuación de confianza responde cómo se está comportando este agente. Una decisión de política combina ambas cosas — además de la acción que se intenta realizar, el nivel en el que se encuentra actualmente el agente, y cualquier anulación por kill switch o delegación — y emite un único allow / review / deny por solicitud.
Por qué la IAM tradicional, por sí sola, no cierra el círculo: La identidad no es confianza: por qué los agentes verificados siguen necesitando puntuación. Para la imagen arquitectónica de cómo la identidad, la puntuación y las decisiones de política se combinan en una única capa en tiempo de ejecución, consulta qué es realmente una capa de confianza para agentes de IA.
No. La exactitud mide si un modelo produjo el resultado correcto en un benchmark. Una puntuación de confianza mide si un agente en producción se está comportando de una manera que se gana el acceso continuado — a través de la fortaleza de identidad, la exposición al riesgo, el historial de fiabilidad y la autonomía que debería concedérsele. El mismo agente puede obtener un 94% en un benchmark y perder autonomía en producción esa misma semana, porque son dos preguntas distintas.
La taxonomía de eventos de Gate cubre 24 tipos de eventos estandarizados en cinco familias: eventos de identidad (verificación, acreditación del propietario, cambios de manifiesto), eventos de riesgo (exposición de PII, inyección de prompts, uso indebido de herramientas, violaciones de políticas), eventos de fiabilidad (finalización de tareas, tasas de error, comportamiento de escalado), eventos de autonomía (pruebas de límites, cumplimiento del alcance, solicitudes de privilegios) y eventos de calibración (la confianza reportada por un agente sobre una tarea emparejada con el resultado observado de la tarea). Se pueden añadir tipos de eventos personalizados a través de la API; los nombres de eventos heredados se mapean automáticamente en la taxonomía.
Sí — para eso están los perfiles de puntuación. Un perfil es una configuración por tenant que sobrescribe los pesos predeterminados del motor para cada dimensión, define umbrales para los niveles de política allow / review / deny, y puede acotarse por sector. VeriSwarm ofrece once perfiles predefinidos — siete de ellos verticales con calibración (salud, servicios financieros, legal, software, seguridad, comercio electrónico, y un perfil general con calibración) — y admite perfiles totalmente personalizados.
El kill switch es una anulación forzosa en la capa de decisión, no un modificador de la puntuación. Cuando se mata a un agente, cada verificación de decisión contra ese agente devuelve deny con reason_code: "agent_killed" y policy_tier: "tier_x", independientemente de lo que digan las puntuaciones subyacentes. Matar a un agente no daña su historial de puntuación — es una acción de operador separada y registrada en auditoría que puede revertirse.
El nivel gratuito de Gate incluye el motor de puntuación completo de cinco dimensiones, ingestión de eventos ilimitada, 5.000 decisiones de confianza al día, el perfil de puntuación predeterminado, y el mismo libro de auditoría encadenado por hash que Vault usa en los planes de pago. Los perfiles de puntuación personalizados, la red de reputación compartida y los pilares más amplios Guard / Passport / Vault / Cortex están limitados por plan, pero la puntuación de confianza en sí misma empieza gratis.
Calibration Trust mide si la confianza de un agente coincide con la realidad. Cuando un agente reporta cuán seguro está sobre una tarea, Gate compara esa predicción con el resultado observado de la tarea y puntúa la diferencia con una métrica de Brier continua — la misma regla de puntuación adecuada que se usa para calificar pronósticos meteorológicos. Es una quinta dimensión distinta porque la precisión de la confianza es ortogonal a las otras cuatro: un agente puede ser muy fiable y a la vez crónicamente exceso de confianza, y ese exceso de confianza es exactamente el modo de fallo que convierte una decisión autónoma en un incidente. La calibración complementa a las cuatro dimensiones existentes; no sustituye a ninguna de ellas.
POST /v1/decisions/check. Evalúa la puntuación actual del agente que llama frente a la acción solicitada y devuelve una decisión allow / review / deny, un código de motivo y el nivel de política. El kill switch y cualquier anulación de verificación de Passport se comprueban antes de devolver la respuesta, de modo que un agente matado o no verificado puede ser denegado independientemente de lo que diga la puntuación subyacente.
Ambas cosas, en un orden definido. El motor de decisión de VeriSwarm prueba primero las políticas de Cedar personalizadas del tenant; si el tenant no ha definido ninguna, o la evaluación de Cedar falla por cualquier motivo, recurre a una matriz de políticas integrada que refleja el conjunto de reglas de Cedar predeterminado. Todos los tenants obtienen evaluación de políticas independientemente del plan — las políticas de Cedar personalizadas por tenant son la parte limitada, a Max y Enterprise.
La ingestión de eventos es asíncrona. Los eventos llegan a una cola de Redis y un worker de puntuación los consume, y normalmente aterrizan como una nueva instantánea de puntuación en cuestión de segundos — no con el retraso de un job por lotes en un recálculo nocturno. La calibración es la excepción: el reporte de confianza de un agente y el resultado observado de la tarea a menudo llegan en momentos distintos, así que el worker los empareja por ID de tarea y actualiza la dimensión de calibración fuera de banda una vez que llega el resultado.
El nivel gratuito de Gate incluye el motor de puntuación completo, ingestión de eventos ilimitada, 5.000 decisiones al día, y el mismo libro encadenado por hash que usa cada plan de pago. Diez minutos para conectarlo; el framework de agentes que ya usas funciona.