Skip to content
VeriSwarm
Chi siamo
DocumentazionePrezziCompetenza agente
AccediRegistrati
  1. Home
  2. /Learn
  3. /Prompt injection detection ai agents
VeriSwarm
  • English
  • Español
  • Deutsch
  • Français
  • ✓ Italiano
  • Português
  • 日本語
  • 한국어
  • 简体中文

Prodotto

  • Prezzi
  • Documentazione
  • API
  • Competenza agente
  • Specifica OATS

Fiducia

  • Centro Fiducia
  • Sicurezza
  • Conformità
  • Stato
  • Changelog

Azienda

  • Chi siamo
  • Blog
  • Open source
  • Investitori
  • Stampa

Legale

  • Termini
  • Privacy
  • SLA
  • DPA
  • Accessibilità
Sicurezza a runtime

Rilevamento delle prompt injection per agenti IA

Analizza ogni turno alla ricerca di injection prima che uno strumento venga attivato, non solo il prompt in ingresso. VeriSwarm Guard esegue due livelli di rilevamento — un'analisi strutturale dei pattern veloce, seguita da un classificatore DeBERTa self-hosted — interamente all'interno della propria infrastruttura. Nessuna chiamata a un'API di rilevamento di terze parti, nessun payload della richiesta lascia il tuo perimetro per ottenere un verdetto.

Perché il prompt non è dove dovrebbe fermarsi il rilevamento delle injection

Un system prompt irrobustito e una red-team eval pulita non fermano l'attacco che conta davvero in produzione. Un agente legge un ticket di assistenza e un'istruzione nascosta nel corpo del ticket gli dice di interrogare un record di fatturazione e di inoltrare il risultato a un webhook. Il modello non viola mai il proprio system prompt — chiama uno strumento. Lo strumento viene eseguito. I dati escono. Il rilevamento deve essere eseguito sul testo che sta per guidare una chiamata a uno strumento, non solo su ciò che l'utente ha digitato.

L'argomentazione completa sul perché le difese a livello di prompt non intercettano questo percorso di attacco è in La prompt injection non si ferma al LLM. Si propaga attraverso le chiamate agli strumenti..

Due livelli di rilevamento

Analisi strutturale

Basato su regex, senza costo di modello. Rileva la manipolazione a livello di protocollo — injection di delimitatori del formato chat (marcatori falsi <|im_start|>, [INST], e marcatori simili pensati per confondere il modello su dove termina un messaggio e ne inizia un altro) e payload contrabbandati all'interno di base64 o codifiche simili. Sono segnali strutturali, non corrispondenze di parole chiave, quindi si attivano su trucchi di protocollo che una wordlist mancherebbe del tutto.

Classificatore ML self-hosted

Un modello basato su DeBERTa (protectai/deberta-v3-base-prompt-injection-v2) viene caricato una sola volta e servito localmente tramite ONNX Runtime. Legge l'intento anziché i pattern superficiali, ed è questo che permette di intercettare un attacco riformulato, un'injection multilingue o una tecnica di evasione abbastanza nuova da non corrispondere a nessun pattern noto. Se il modello non riesce a caricarsi, il rilevamento ripiega sull'analisi strutturale anziché fallire in modalità aperta.

I due livelli vengono eseguiti in ordine — prima quello strutturale, perché è più economico e intercetta subito gli attacchi più evidenti, poi il classificatore per tutto ciò che l'analisi strutturale non ha già segnalato.

L'API

POST /v1/suite/guard/scan accetta un body { "text": "...", "scan_injection": true, "scan_moderation": true } e restituisce { "flagged": bool, "injection": {...}, "moderation": {...}, "summary": "..." }. L'oggetto injection contiene la categoria corrispondente, un punteggio di confidenza e quale livello ha prodotto il verdetto. Chiamalo su qualsiasi testo che potrebbe guidare una chiamata a uno strumento prima che quella chiamata scatti — un messaggio utente, contenuto recuperato da una knowledge base, un payload webhook proveniente da un'integrazione a monte.

Integrato automaticamente in Guard Proxy

Guard Proxy è il livello di intercettazione MCP trasparente di VeriSwarm, e la scansione delle injection è un passaggio fisso nella sua pipeline: ogni risposta proveniente da un server di strumenti viene controllata alla ricerca di tentativi di injection prima che raggiunga l'agente, insieme alla tokenizzazione dei PII e all'applicazione delle policy. Punta il client MCP del tuo agente al proxy anziché direttamente al server di strumenti — zero modifiche al codice lato agente.

Difesa in profondità: rilevamento a livello di sessione

La scansione per turno intercetta un tentativo di injection che compare in un singolo messaggio. Alcuni attacchi non lo fanno — accumulano rischio nel corso di un'intera conversazione, un tentativo a goccia per estrarre un system prompt o esfiltrare un valore canary un piccolo passo alla volta. Session Sentry funziona come un livello complementare che valuta il rischio sull'intera sessione anziché per turno, insieme a — non al posto di — i livelli strutturale e DeBERTa descritti sopra.

Correlato: i dati che quelle chiamate agli strumenti possono far trapelare

Il rilevamento delle injection impedisce che venga eseguita una chiamata a uno strumento manipolata. È un problema correlato ma distinto da ciò che accade quando una legittima chiamata a uno strumento trasporta PII che non dovrebbe — trattato in Come impedire a un agente IA di far trapelare dati. Guard esegue entrambi i controlli nella stessa pipeline.

Domande frequenti

Perché eseguire la scansione delle prompt injection prima che uno strumento venga attivato, e non solo sul prompt?

Perché il payload non deve necessariamente sembrare un jailbreak per essere pericoloso. Un'istruzione nascosta in un ticket di assistenza o in una pagina web estratta può lasciare intatto il system prompt del modello e comunque cambiare quale strumento viene chiamato, con quali argomenti, sui dati di chi. Quando la chiamata raggiunge il server degli strumenti, il modello è ormai fuori dal ciclo ed è il protocollo a essere eseguito. Scansionare la risposta prima che la chiamata allo strumento scatti intercetta questa classe di attacco; scansionare solo il prompt in ingresso no.

Quali sono i due livelli di rilevamento?

Il primo livello è l'analisi strutturale — rilevamento basato su regex della manipolazione a livello di protocollo, come l'injection di delimitatori del formato chat (marcatori falsi <|im_start|> o [INST] pensati per confondere il modello sui confini dei messaggi) e il contrabbando via base64/codifica. È veloce e intercetta attacchi che non richiedono nemmeno una comprensione semantica. Il secondo livello è un classificatore di machine learning che legge l'intento reale del testo, intercettando attacchi riformulati, injection multilingue e tecniche di evasione inedite che il semplice pattern-matching lascia passare.

Quale modello alimenta il livello ML, e dove viene eseguito?

Un classificatore basato su DeBERTa (protectai/deberta-v3-base-prompt-injection-v2), caricato localmente e servito tramite ONNX Runtime all'interno dell'infrastruttura propria di VeriSwarm. Non c'è nessuna chiamata in uscita verso un'API di rilevamento injection di terze parti e nessun payload della richiesta lascia il confine del tuo tenant per ottenere un verdetto — il rilevamento è completamente autonomo. Se il modello non riesce a caricarsi per qualsiasi motivo, il rilevamento ripiega solo sull'analisi strutturale anziché fallire in modalità aperta.

C'è un'API che posso chiamare direttamente?

Sì — POST /v1/suite/guard/scan accetta { "text": "...", "scan_injection": true, "scan_moderation": true } e restituisce { "flagged": bool, "injection": {...}, "moderation": {...}, "summary": "..." }. Il campo injection riporta la categoria, un punteggio di confidenza e quale livello (structural o ml) ha prodotto il verdetto. Chiamalo su qualsiasi testo non affidabile — un messaggio utente, contenuto RAG, un payload webhook — prima che raggiunga un passaggio in grado di innescare una chiamata a uno strumento.

Devo configurarlo io stesso per ogni chiamata a uno strumento?

Non se stai già eseguendo Guard Proxy. Guard Proxy è il livello di intercettazione MCP trasparente di VeriSwarm, e la scansione delle prompt injection è un passaggio della sua pipeline fissa: ogni risposta proveniente da un server di strumenti viene controllata alla ricerca di tentativi di injection prima che raggiunga l'agente, insieme alla tokenizzazione dei PII e all'applicazione delle policy — zero modifiche al codice lato agente. L'API di scansione diretta è lì per i casi in cui vuoi controllare tu stesso il testo, al di fuori del percorso del proxy.

VeriSwarm rileva anche gli attacchi multi-turno o a livello di sessione?

Sì, come livello separato e complementare. Session Sentry accumula segnali di rischio nel corso di un'intera conversazione — esposizione di token canary, tentativi di estrazione del system prompt — anziché valutare un singolo turno in isolamento, il che intercetta un tentativo di esfiltrazione a goccia che nessun messaggio individuale attiverebbe da solo. Funziona insieme ai livelli strutturale e DeBERTa per turno, non al loro posto.

In quale piano è disponibile il rilevamento delle prompt injection?

Guard — incluso il rilevamento delle injection basato su scansione e la scansione automatica di Guard Proxy — è una funzionalità del piano Max. Il livello gratuito di Gate ti offre prima il trust scoring e la visibilità sugli eventi; è con Guard che si attiva l'enforcement.

Esegui la scansione prima che la chiamata allo strumento scatti

Il rilevamento delle injection di Guard — l'API e la scansione automatica di Guard Proxy — è una funzionalità del piano Max. Il livello gratuito di Gate ti offre prima il trust scoring e la visibilità sugli eventi.

Prova la demoInizia gratis