Skip to content
VeriSwarm
Acerca de
DocumentaciónPreciosHabilidad del agente
Iniciar sesiónRegistrarse
  1. Inicio
  2. /Learn
  3. /How to secure an ai agent
VeriSwarm
  • English
  • ✓ Español
  • Deutsch
  • Français
  • Italiano
  • Português
  • 日本語
  • 한국어
  • 简体中文

Producto

  • Precios
  • Documentación
  • API
  • Habilidad del agente
  • Especificación OATS

Confianza

  • Centro de confianza
  • Seguridad
  • Cumplimiento
  • Estado
  • Registro de cambios

Empresa

  • Acerca de
  • Blog
  • Código abierto
  • Inversionistas
  • Prensa

Legal

  • Términos
  • Privacidad
  • SLA
  • DPA
  • Accesibilidad
Lista de seguridad

Cómo proteger un agente de IA

Proteger un agente de IA requiere seis controles: identidad delimitada, permisos de herramientas de mínimo privilegio, tokenización de PII, escaneo de inyección de prompts, un interruptor de apagado y un registro de auditoría. Cada uno cierra un modo de fallo distinto — la identidad para saber qué agente hizo qué, los permisos para que un agente comprometido no pueda llamar a lo que quiera, la tokenización para que una fuga no parezca que el agente está haciendo su trabajo, el escaneo de inyección para que una entrada manipulada no pueda secuestrar una llamada a herramienta, un interruptor de apagado para poder detener a un agente sin esperar a que coopere, y un registro de auditoría para que haya evidencia cuando algo sale mal. Esto es lo que hace cada uno, dónde vive y en qué plan está.

Qué significa proteger un agente de IA

Proteger un agente de IA significa cerrar seis modos de fallo distintos en tiempo de ejecución — identidad, acceso a herramientas, exposición de datos, instrucciones manipuladas, anulación del operador y evidencia — con controles que operan fuera del propio razonamiento del agente. Una instrucción en el system prompt que le dice al agente qué no hacer no es un control; es una petición que el modelo puede llegar a ignorar. Cada elemento de la lista se aplica en una capa sobre la que el agente no tiene voto.

Los seis controles

En el orden en que la mayoría de los equipos los implementan — la identidad y la capa de decisión primero, ya que todo lo demás depende de saber qué agente estás observando.

  1. Identidad delimitada. Establece qué agente es este, atribuye sus acciones a una credencial específica y sabe quién es su propietario. Una credencial JWT firmada (emitida en POST /v1/credentials/issue, verificable frente a /.well-known/jwks.json) es el piso gratuito — ilimitado en todos los planes. La identidad más completa — verificación de propiedad, manifiestos firmados que declaran lo que un agente puede hacer, y delegaciones delimitadas desde una cuenta humana — es VeriSwarm Passport, en el plan Pro y superiores. Plan: credenciales básicas gratis; Passport en Pro+. Cómo funciona la verificación de identidad de un agente.
  2. Permisos de herramientas de mínimo privilegio. Un agente solo debería poder llamar a las herramientas que su trabajo requiere, y solo bajo las condiciones que definas — una puntuación de confianza mínima, un nivel de política mínimo, un límite de frecuencia. Las reglas de permisos de herramientas de VeriSwarm Guard (POST /v1/suite/guard/tool-permissions) te permiten definir una lista de permitidos por herramienta en lugar de confiar en el propio criterio del agente sobre lo que debería llamar. Plan: Max (Guard).
  3. Tokenización de PII. Los datos sensibles — un nombre, un número de la seguridad social, un número de teléfono — se sustituyen por un token tipado ([VS:EMAIL:a1b2c3]) antes de cruzar el límite de una herramienta, no después. VeriSwarm Guard ejecuta esto en POST /v1/suite/guard/pii/tokenize, respaldado por un motor de detección NER basado en Presidio, y Guard Proxy lo aplica de forma transparente a cada llamada de herramienta MCP sin cambios en el código del agente. Plan: Max (Guard). Los tres vectores que esto cierra.
  4. Escaneo de inyección de prompts. Una entrada manipulada — en un mensaje de usuario, un documento que el agente recupera, la respuesta de una herramienta — puede intentar anular las instrucciones del agente y disparar una llamada a herramienta que nunca debía hacer. El escáner de VeriSwarm Guard (POST /v1/suite/guard/scan) revisa el texto no confiable antes de que llegue a un paso que pueda actuar sobre él, combinando detección de patrones estructurales con un clasificador de ML DeBERTa. Plan: Max (Guard). Cómo funciona el escaneo.
  5. Un interruptor de apagado. Una única llamada del operador (POST /v1/suite/guard/kill/{agent_id}) bloquea toda verificación de decisión y emisión de credenciales posterior para ese agente, sin importar lo que diga su propio prompt. Vive completamente fuera del razonamiento del agente — al agente no se le pide que se detenga, se le deniega en la capa de política la próxima vez que intente actuar. Plan: Max (Guard). Cómo funciona realmente el interruptor de apagado.
  6. Un registro de auditoría. Cada evento que genera un agente queda registrado en un libro mayor encadenado por hash desde el momento en que se ingiere — ese registro ocurre en todos los planes, incluido el gratuito. Lo que está limitado al plan Max es Vault, la capa de producto que se construye encima: consultar el libro mayor, verificar criptográficamente que la cadena no ha sido manipulada, y exportarlo para una revisión de cumplimiento. Plan: registro gratis; consulta, verificación y exportación en Max (Vault). Qué demuestra realmente la cadena de hashes.

Dónde está realmente el límite de lo gratuito

Es tentador leer una lista de seis elementos como seis cosas que hay que comprar. Así no es como se dividen los planes. La capa de decisión que sustenta todos los controles — VeriSwarm Gate — es gratuita: puntuación de confianza completa, 5.000 verificaciones de permitir/revisar/denegar al día, ingestión de eventos ilimitada, y emisión de credenciales básicas ilimitada. Puedes establecer la identidad y empezar a puntuar el comportamiento del agente sin tarjeta registrada. Lo que está limitado es la capa de aplicación — los permisos de herramientas de Guard, la tokenización, el escaneo de inyección y el interruptor de apagado, además del libro mayor consultable y exportable de Vault — que es Max. La identidad más completa de Passport (verificación, manifiestos, delegaciones) está en Pro, en el medio. No dejes que un proveedor insinúe que el plan gratuito es una demo reducida; para una gran parte de los agentes internos de bajo radio de impacto, la identidad más la capa de decisión son suficientes por sí solas.

Dónde decide cada control quién es responsable

Los seis controles no son interruptores independientes — alimentan una única decisión. La identidad le dice al motor de políticas qué agente está preguntando. La puntuación de confianza, impulsada por el flujo de eventos al que escriben tanto Guard como Gate, le dice cómo se ha estado comportando ese agente. Los permisos de herramientas, la tokenización de PII y el escaneo de inyección son los puntos de aplicación donde una solicitud específica avanza o se detiene. El interruptor de apagado es la anulación que prevalece sobre todo lo demás. El registro de auditoría es lo que te permite reconstruir, después de los hechos, por qué se permitió o denegó una solicitud determinada. Esa decisión — allow, review, or deny — es la capa de confianza que sustenta los seis controles. Qué es realmente una capa de confianza.

Preguntas frecuentes

¿Cuáles son los seis controles para proteger un agente de IA?

Identidad delimitada (saber qué agente es este, y quién responde por él), permisos de herramientas de mínimo privilegio (restringir qué herramientas puede llamar y en qué condiciones), tokenización de PII (eliminar datos sensibles antes de que crucen el límite de una herramienta), escaneo de inyección de prompts (detectar instrucciones manipuladas antes de que disparen una llamada a herramienta), un interruptor de apagado (una anulación del operador que vive fuera del propio razonamiento del agente) y un registro de auditoría (un registro inmutable de lo que el agente realmente hizo). Ninguno de los seis sustituye a otro — un agente con identidad perfecta y sin interruptor de apagado sigue estando a un mal prompt de distancia de un incidente.

¿Cuáles de estos controles son gratuitos?

La capa de decisión que sustenta los seis es gratuita: la puntuación de confianza de VeriSwarm Gate, las decisiones de política permitir/revisar/denegar (5.000 verificaciones/día), la ingestión de eventos ilimitada y la emisión ilimitada de credenciales portátiles básicas (tokens de identidad JWT, verificables por JWKS) no cuestan nada. La capa de aplicación — los permisos de herramientas de Guard, la tokenización de PII, el escaneo de inyección y el interruptor de apagado, además del libro de auditoría consultable y exportable de Vault — es una funcionalidad del plan Max. La verificación de identidad más completa con manifiestos firmados y delegaciones (Passport) está en Pro. Puedes conectar la identidad y empezar a puntuar el comportamiento en el nivel gratuito; la aplicación es donde el plan de pago empieza a hacer el trabajo.

¿No basta con un system prompt que le diga al agente 'no hagas X'?

No. Una instrucción en el system prompt es una petición que se puede convencer al modelo de ignorar — eso es exactamente lo que explota la inyección de prompts. Todos los controles de esta lista salvo la identidad operan fuera del propio razonamiento del modelo: los permisos de herramientas se comprueban antes de que se ejecute una llamada, la tokenización de PII se ejecuta sobre el texto independientemente de lo que el agente pretendiera, y el interruptor de apagado deniega en la capa de política sin importar lo que diga el prompt del agente. El patrón en los cuatro controles de aplicación es el mismo — trasladar la comprobación a una capa con la que el modelo no puede discutir.

¿Necesito los seis controles antes de desplegar un agente en producción?

La identidad y la capa de decisión (Gate) son el mínimo — desplegar sin ellas y no tienes forma de saber qué agente hizo qué, ni de actuar ante un patrón de mal comportamiento una vez que lo detectas. Los otros cuatro escalan con lo que el agente realmente puede hacer. Un agente interno de solo lectura sin exposición de PII tiene una superficie de riesgo mucho más delgada que uno que llama a una API de pagos y maneja registros de clientes — pero en el momento en que un agente puede llamar a una herramienta externa o tocar datos sensibles, los permisos de herramientas y la tokenización de PII dejan de ser opcionales. El interruptor de apagado y el registro de auditoría son lo bastante baratos, en términos de ingeniería, como para que raramente haya un buen motivo para omitirlos una vez que Guard y Vault ya están conectados.

¿En qué se diferencia esto de las funciones de seguridad integradas de un framework de agentes de IA?

Las barreras de un framework (callbacks de LangChain, los validadores de tareas de CrewAI, un try/except personalizado alrededor de una llamada a herramienta) se ejecutan dentro del mismo proceso que el agente y dependen de que el propio código del agente se ejecute correctamente. Los seis controles de aquí son externos a ese proceso — VeriSwarm se sitúa entre el agente y las herramientas/decisiones que intenta tomar, de modo que un error o una inyección exitosa en la propia lógica del agente tampoco desactiva el control que la vigila. Es la misma razón por la que un firewall no se implementa como una configuración dentro de la aplicación que protege.

¿Qué pasa si solo implemento algunos de los seis?

Cada control cierra un modo de fallo distinto, así que omitir uno deja abierto ese modo específico. Omite la identidad y no podrás atribuir un incidente a un agente específico ni revocar solo el acceso de ese agente. Omite los permisos de herramientas y un agente comprometido podrá llamar a cualquier cosa para la que tenga credenciales. Omite la tokenización de PII y una fuga de datos parecerá que el agente está haciendo su trabajo. Omite el escaneo de inyección y una entrada manipulada podrá disparar una llamada a herramienta no autorizada antes de que nadie la revise. Omite el interruptor de apagado y no habrá una forma rápida de detener a un agente que se comporta mal, salvo retirarle las credenciales. Omite el registro de auditoría y no tendrás evidencia de lo que ocurrió, algo que importa tanto para la revisión posterior como para el propio incidente.

Empieza con la identidad y la capa de decisión — ambas gratis

La puntuación de confianza de Gate, las verificaciones de decisión y la emisión de credenciales básicas no cuestan nada. Añade los controles de aplicación de Guard y el libro exportable de Vault cuando el radio de impacto de un agente lo justifique.

Probar la demoEmpieza gratis