Skip to content
VeriSwarm
Acerca de
DocumentaciónPreciosHabilidad del agente
Iniciar sesiónRegistrarse
  1. Inicio
  2. /Learn
  3. /Prompt injection detection ai agents
VeriSwarm
  • English
  • ✓ Español
  • Deutsch
  • Français
  • Italiano
  • Português
  • 日本語
  • 한국어
  • 简体中文

Producto

  • Precios
  • Documentación
  • API
  • Habilidad del agente
  • Especificación OATS

Confianza

  • Centro de confianza
  • Seguridad
  • Cumplimiento
  • Estado
  • Registro de cambios

Empresa

  • Acerca de
  • Blog
  • Código abierto
  • Inversionistas
  • Prensa

Legal

  • Términos
  • Privacidad
  • SLA
  • DPA
  • Accesibilidad
Seguridad en tiempo de ejecución

Detección de inyección de prompts para agentes de IA

Analiza cada turno en busca de inyecciones antes de que se dispare una herramienta, no solo el prompt de entrada. VeriSwarm Guard ejecuta dos capas de detección — un análisis de patrones estructurales rápido, seguido de un clasificador DeBERTa autoalojado — todo dentro de su propia infraestructura. Sin llamadas a una API de detección de terceros, sin que la carga útil de la solicitud salga de tu perímetro.

Por qué el prompt no es donde debe detenerse la detección de inyecciones

Un system prompt reforzado y una evaluación red-team limpia no detienen el ataque que realmente importa en producción. Un agente lee un ticket de soporte, y una instrucción oculta dentro del cuerpo del ticket le indica que consulte un registro de facturación y reenvíe el resultado a un webhook. El modelo nunca viola su system prompt — llama a una herramienta. La herramienta se ejecuta. Los datos salen. La detección tiene que ejecutarse sobre el texto que está a punto de impulsar una llamada a una herramienta, no solo sobre lo que escribió el usuario.

El argumento completo de por qué las defensas a nivel de prompt no cubren esta vía de ataque está en La inyección de prompts no se detiene en el LLM. Fluye a través de las llamadas a herramientas..

Dos capas de detección

Análisis estructural

Basado en regex, sin coste de modelo. Detecta manipulaciones a nivel de protocolo — inyección de delimitadores de formato de chat (marcadores falsos <|im_start|>, [INST], y marcadores similares pensados para confundir al modelo sobre dónde termina un mensaje y empieza otro) y payloads introducidos de contrabando dentro de base64 u codificaciones similares. Son señales estructurales, no coincidencias de palabras clave, por lo que se activan ante trucos de protocolo que una lista de palabras pasaría por alto por completo.

Clasificador de ML autoalojado

Un modelo basado en DeBERTa (protectai/deberta-v3-base-prompt-injection-v2) que se carga una vez y se sirve localmente mediante ONNX Runtime. Lee la intención en lugar de los patrones superficiales, lo que permite detectar un ataque reformulado, una inyección multilingüe o una técnica de evasión lo bastante nueva como para no coincidir con ningún patrón conocido. Si el modelo no llega a cargarse, la detección recurre al análisis estructural en lugar de fallar en modo abierto.

Las dos capas se ejecutan en orden — primero la estructural, porque es más económica y detecta de inmediato los ataques más evidentes, y luego el clasificador para todo lo que el análisis estructural no haya marcado ya.

La API

POST /v1/suite/guard/scan toma un cuerpo de { "text": "...", "scan_injection": true, "scan_moderation": true } y devuelve { "flagged": bool, "injection": {...}, "moderation": {...}, "summary": "..." }. El objeto injection contiene la categoría coincidente, una puntuación de confianza y qué capa produjo el veredicto. Llámalo sobre cualquier texto que pueda impulsar una llamada a una herramienta antes de que esa llamada se dispare — un mensaje de usuario, contenido recuperado de una base de conocimiento, un payload de webhook procedente de una integración anterior en la cadena.

Integrado automáticamente en Guard Proxy

Guard Proxy es la capa de interceptación transparente de MCP de VeriSwarm, y el escaneo de inyecciones es un paso fijo en su pipeline: cada respuesta que llega desde un servidor de herramientas se revisa en busca de intentos de inyección antes de que alcance al agente, junto con la tokenización de PII y la aplicación de políticas. Apunta el cliente MCP de tu agente al proxy en lugar de al servidor de herramientas directamente — cero cambios de código en el agente.

Defensa en profundidad: detección a nivel de sesión

El escaneo por turno detecta un intento de inyección que aparece en un solo mensaje. Algunos ataques no lo hacen — acumulan riesgo a lo largo de toda una conversación, un intento de goteo lento para extraer un system prompt o exfiltrar un valor canario un pequeño paso a la vez. Session Sentry funciona como una capa complementaria que puntúa el riesgo a lo largo de toda la sesión en lugar de por turno, junto a — no en lugar de — las capas estructural y DeBERTa descritas anteriormente.

Relacionado: los datos que esas llamadas a herramientas pueden filtrar

La detección de inyecciones impide que se dispare una llamada a herramienta manipulada. Es un problema relacionado pero distinto de lo que ocurre cuando una legítima llamada a una herramienta transporta PII que no debería — cubierto en Cómo evitar que un agente de IA filtre datos. Guard ejecuta ambas comprobaciones en el mismo pipeline.

Preguntas frecuentes

¿Por qué escanear en busca de inyección de prompts antes de que se dispare una herramienta, y no solo en el prompt?

Porque el payload no necesita parecer un jailbreak para ser peligroso. Una instrucción oculta en un ticket de soporte o en una página web extraída puede dejar intacto el system prompt del propio modelo y aun así cambiar qué herramienta se llama, con qué argumentos, sobre los datos de quién. Para cuando la llamada llega al servidor de herramientas, el modelo ya está fuera del circuito y es el protocolo el que se ejecuta. Escanear la respuesta antes de que se dispare la llamada a la herramienta detecta esa clase de ataque; escanear solo el prompt entrante no lo hace.

¿Cuáles son las dos capas de detección?

La capa uno es el análisis estructural — detección basada en regex de manipulación a nivel de protocolo, como la inyección de delimitadores de formato de chat (marcadores falsos <|im_start|> o [INST] pensados para confundir al modelo sobre los límites de los mensajes) y el contrabando mediante base64/codificación. Es rápida y detecta ataques que ni siquiera requieren comprensión semántica. La capa dos es un clasificador de aprendizaje automático que lee la intención real del texto, detectando ataques reformulados, inyecciones multilingües y técnicas de evasión novedosas que la mera coincidencia de patrones pasa por alto.

¿Qué modelo impulsa la capa de ML, y dónde se ejecuta?

Un clasificador basado en DeBERTa (protectai/deberta-v3-base-prompt-injection-v2), cargado localmente y servido a través de ONNX Runtime dentro de la propia infraestructura de VeriSwarm. No hay ninguna llamada saliente a una API de detección de inyecciones de terceros y ningún payload de solicitud sale del límite de tu tenant para obtener un veredicto — la detección es totalmente autocontenida. Si el modelo no llega a cargarse por cualquier motivo, la detección recurre únicamente al análisis estructural en lugar de fallar en modo abierto.

¿Hay una API que pueda llamar directamente?

Sí — POST /v1/suite/guard/scan toma { "text": "...", "scan_injection": true, "scan_moderation": true } y devuelve { "flagged": bool, "injection": {...}, "moderation": {...}, "summary": "..." }. El campo injection lleva la categoría, una puntuación de confianza y qué capa (structural o ml) produjo el veredicto. Llámalo sobre cualquier texto no confiable — un mensaje de usuario, contenido RAG, un payload de webhook — antes de que llegue a un paso que pueda disparar una llamada a una herramienta.

¿Tengo que integrarlo yo mismo para cada llamada a una herramienta?

No si ya estás ejecutando Guard Proxy. Guard Proxy es la capa de interceptación transparente de MCP de VeriSwarm, y el escaneo de inyección de prompts es un paso dentro de su pipeline fijo: cada respuesta que llega desde un servidor de herramientas se revisa en busca de intentos de inyección antes de que alcance al agente, junto con la tokenización de PII y la aplicación de políticas — cero cambios de código en el agente. La API de escaneo directa está ahí para los casos en los que quieras revisar el texto tú mismo, fuera del camino del proxy.

¿VeriSwarm también detecta ataques multiturno o a nivel de sesión?

Sí, como una capa aparte y complementaria. Session Sentry acumula señales de riesgo a lo largo de toda una conversación — exposición de tokens canario, intentos de extracción del system prompt — en lugar de puntuar un único turno de forma aislada, lo que permite detectar un intento de exfiltración lenta que ningún mensaje individual dispararía por sí solo. Funciona junto a las capas estructural y DeBERTa por turno, no en su lugar.

¿En qué plan está la detección de inyección de prompts?

Guard — incluyendo la detección de inyecciones basada en escaneo y el escaneo automático de Guard Proxy — es una función del plan Max. El nivel gratuito de Gate te da primero la puntuación de confianza y visibilidad de eventos; Guard es donde se activa la aplicación.

Escanea antes de que se dispare la llamada a la herramienta

La detección de inyecciones de Guard — la API y el escaneo automático de Guard Proxy — es una función del plan Max. El nivel gratuito de Gate te da primero la puntuación de confianza y la visibilidad de eventos.

Probar la demoEmpezar gratis