Skip to content
VeriSwarm
Chi siamo
DocumentazionePrezziCompetenza agente
AccediRegistrati
  1. Home
  2. /Learn
  3. /Agent trust scoring
VeriSwarm
  • English
  • Español
  • Deutsch
  • Français
  • ✓ Italiano
  • Português
  • 日本語
  • 한국어
  • 简体中文

Prodotto

  • Prezzi
  • Documentazione
  • API
  • Competenza agente
  • Specifica OATS

Fiducia

  • Centro Fiducia
  • Sicurezza
  • Conformità
  • Stato
  • Changelog

Azienda

  • Chi siamo
  • Blog
  • Open source
  • Investitori
  • Stampa

Legale

  • Termini
  • Privacy
  • SLA
  • DPA
  • Accessibilità
Guida tecnica

Trust scoring degli agenti

Gli agenti IA non sono deterministici. Lo stesso agente con gli stessi permessi può essere affidabile il martedì e far trapelare PII il venerdì. Il trust scoring degli agenti sostituisce il controllo degli accessi binario con permessi basati sul comportamento che si aggiornano continuamente, in produzione, su cinque dimensioni del comportamento dell’agente. È così che VeriSwarm Gate valuta gli agenti — e perché un punteggio vale più, per chi opera, di una semplice concessione di permessi.

Cos’è il trust scoring degli agenti

Il trust scoring degli agenti è un sistema di valutazione in tempo reale, ponderato sul comportamento, che quantifica quanta autonomia dovrebbe essere concessa a un determinato agente IA in un dato momento, in base al comportamento osservato sulle dimensioni identità, rischio, affidabilità, autonomia e calibrazione. A differenza del controllo degli accessi statico, il punteggio si aggiorna man mano che arrivano nuovi eventi e determina un livello di policy — allow, review o deny — per ogni decisione che l’agente tenta di prendere.

Perché il controllo degli accessi binario non basta

Il controllo degli accessi tradizionale è binario. Un agente ha un permesso oppure no. Questo modello funzionava quando il software era deterministico; una funzione autorizzata a leggere un database la leggeva sempre nello stesso modo. Gli agenti non sono deterministici. Lo stesso agente con gli stessi permessi può:

  • Rispondere correttamente a domande per settimane, e poi iniziare ad allucinare.
  • Rispettare perfettamente i propri limiti, e poi tentare di accedere a dati fuori dal proprio ambito.
  • Gestire i PII con cura, e poi iniziare a farli trapelare attraverso chiamate a strumenti.
  • Operare nell’ambito del proprio ruolo, e poi iniziare a tentare di elevare i propri permessi.

Il controllo degli accessi binario non coglie nulla di tutto questo. Un agente che si comporta male da 48 ore ha lo stesso accesso di uno che è stato impeccabile per sei mesi. Il trust scoring colma questo divario.

Le cinque dimensioni valutate da Gate

Un punteggio di fiducia composito che riduce tutto a un unico numero è solo un numero. Un punteggio scomposto in cinque dimensioni ortogonali è una diagnosi. Gate valuta gli agenti su cinque dimensioni, e il livello di policy deriva da tutte e cinque — non da un singolo valore aggregato.

Affidabilità dell’identità

Quanto è consolidata l’identità di questo agente? È verificata? Ha un proprietario umano attestato? Ha operato abbastanza a lungo da costruire uno storico?

Rischio

Questo agente è stato coinvolto in incidenti di sicurezza, uso improprio di strumenti, violazioni delle policy o esposizione di PII? Il rischio sale quando accadono incidenti e decade lentamente nel tempo.

Affidabilità operativa

Questo agente completa i compiti con successo? Gestisce gli errori con eleganza? Effettua escalation quando opportuno? L’affidabilità si guadagna con un comportamento buono e costante.

Autonomia

Quanta indipendenza dovrebbe essere concessa a questo agente? Mesi affidabili fanno guadagnare più autonomia. Un test di sicurezza fallito la riduce.

Calibrazione

Questo agente sa cosa non sa? La calibrazione confronta la fiducia dichiarata da un agente su un compito con il risultato effettivamente ottenuto, valutata con una metrica di Brier continua. Un agente sicuro di sé ma in errore e uno ben calibrato possono mostrare lo stesso numero di affidabilità — è la calibrazione a distinguerli.

Sul perché un unico punteggio composito non svolga davvero il proprio compito su scala di produzione, l’argomentazione approfondita si trova in Identità, rischio, affidabilità, autonomia: perché un unico punteggio di fiducia non basta per gli agenti in produzione. La calibrazione si è aggiunta al modello come quinta dimensione nel Q3 2026 — il ragionamento dietro questa aggiunta è spiegato in La quinta dimensione: misurare se un agente sapeva ciò che non sapeva.

La tassonomia di 24 eventi

Le variazioni del punteggio sono guidate dagli eventi. Gate utilizza una tassonomia standardizzata di 24 eventi in cui si mappa il flusso di ingestione di ogni cliente, indipendentemente dal framework — LangChain, CrewAI, AutoGen, personalizzato — su cui gira l’agente. La tassonomia è raggruppata per dimensione:

  • Eventi di identità — verifica, attestazione del proprietario, modifiche al manifest, concessioni e revoche di delega.
  • Eventi di rischio — esposizione di PII, rilevamenti di prompt injection, uso improprio di strumenti, violazioni delle policy, riscontri di Guard.
  • Eventi di affidabilità — completamento dei compiti, picchi del tasso di errore, comportamento di escalation, attivazioni della catena di fallback.
  • Eventi di autonomia — test dei limiti, rispetto dell’ambito, tentativi di escalation dei privilegi, approvazioni tramite revisione umana.
  • Eventi di calibrazione — la fiducia dichiarata da un agente su un compito (agent.confidence_reported) abbinata al risultato osservato del compito (agent.task_outcome).

È possibile aggiungere tipi di evento personalizzati tramite l’API. I nomi degli eventi legacy (incluso il namespace agentgate_* ereditato dalla vita precedente della piattaforma) vengono mappati automaticamente nella tassonomia.

Un esempio di scoring in produzione

Consideriamo un agente IA di assistenza clienti che gestisce le e-mail per un’azienda e-commerce.

  • Giorno 1. Punteggio di identità basso (nessuno storico), rischio neutro, affidabilità sconosciuta. Livello di policy: review. Ogni risposta rivolta al cliente viene approvata da un umano.
  • Settimana 2. 500 interazioni riuscite finora. L’identità si rafforza, l’affidabilità sale. Il livello di policy passa a allow per le risposte standard, review per i rimborsi superiori a 100 $.
  • Mese 2. L’agente invia accidentalmente i dettagli di un ordine all’indirizzo e-mail sbagliato. Guard segnala PII in un contesto non autorizzato. Il rischio schizza in alto. Il livello di policy torna a review per tutte le interazioni in attesa di indagine.
  • Mese 3. La causa principale viene risolta. L’agente riprende il funzionamento normale. Il rischio decade. La fiducia si ricostruisce attraverso il comportamento, non perché un amministratore clicca su “approva”.

I permessi dell’agente sono cambiati quattro volte in tre mesi senza che nessuno modificasse una matrice di permessi. Questo è il meccanismo.

Profili di scoring per settore

Un chatbot di assistenza clienti e un agente di triage medico non dovrebbero condividere le stesse regole di fiducia. I profili di scoring consentono a un tenant di sovrascrivere i valori predefiniti del motore — pesi delle dimensioni diversi, soglie di livello di policy diverse, sensibilità agli eventi diverse — per settore. Oggi sono disponibili undici preset, sette dei quali verticali consapevoli della calibrazione (sanità, servizi finanziari, legale, software, sicurezza, e-commerce, oltre a un profilo generale consapevole della calibrazione); i profili personalizzati sono supportati a partire dal piano Pro.

L’argomentazione sul perché un’unica soglia non possa reggere sia il traffico sanitario sia quello e-commerce è approfondita in Una taglia non va bene per tutti: configurare le soglie di fiducia per gli agenti sanitari rispetto a quelli e-commerce.

Trust scoring vs valutazione degli LLM

Questi due concetti vengono spesso confusi e non dovrebbero esserlo. La valutazione degli LLM valuta un modello su un benchmark, offline, prima del deployment. Il trust scoring degli agenti valuta un agente distribuito in base al suo comportamento in produzione, in modo continuo, dopo il deployment. La suite di valutazione ti dice se il modello sa rispondere a una domanda BoolQ; il punteggio di fiducia ti dice se l’agente non ha fatto trapelare l’SSN di un cliente il martedì. Entrambi hanno valore. Non sono sostituti l’uno dell’altro.

La distinzione completa — Il trust scoring degli agenti non è valutazione degli LLM. Ecco la differenza.

Punteggio di fiducia vs identità vs decisione di policy

Un punteggio di fiducia non è un’identità. Un’identità non è una decisione di policy. Confondere una qualsiasi di queste coppie è il motivo per cui le architetture di governance degli agenti IA falliscono in produzione. L’identità risponde a chi è questo agente. Il trust scoring risponde a come si sta comportando questo agente. Una decisione di policy combina entrambe le cose — oltre all’azione tentata, al livello in cui si trova attualmente l’agente e a eventuali override tramite kill switch o delega — ed emette un unico allow / review / deny per richiesta.

Perché la IAM tradizionale, da sola, non chiude il cerchio: L’identità non è fiducia: perché gli agenti verificati hanno comunque bisogno di uno scoring. Per il quadro architetturale di come identità, scoring e decisioni di policy si combinano in un unico livello runtime, vedi cosa sia davvero un livello di fiducia per gli agenti IA.

Domande frequenti

Un punteggio di fiducia è la stessa cosa di un punteggio di accuratezza?

No. L’accuratezza misura se un modello ha prodotto l’output corretto su un benchmark. Un punteggio di fiducia misura se un agente in produzione si sta comportando in un modo che gli fa guadagnare un accesso continuativo — attraverso la solidità dell’identità, l’esposizione al rischio, lo storico di affidabilità e l’autonomia che dovrebbe essergli concessa. Lo stesso agente può ottenere il 94% su un benchmark e perdere autonomia in produzione nella stessa settimana, perché sono due domande diverse.

Quali tipi di eventi influenzano il punteggio di fiducia di un agente?

La tassonomia di eventi di Gate copre 24 tipi di evento standardizzati suddivisi in cinque famiglie: eventi di identità (verifica, attestazione del proprietario, modifiche al manifest), eventi di rischio (esposizione di PII, prompt injection, uso improprio di strumenti, violazioni delle policy), eventi di affidabilità (completamento dei compiti, tassi di errore, comportamento di escalation), eventi di autonomia (test dei limiti, rispetto dell’ambito, richieste di privilegi) ed eventi di calibrazione (la fiducia dichiarata da un agente su un compito abbinata al risultato osservato del compito). È possibile aggiungere tipi di evento personalizzati tramite l’API; i nomi degli eventi legacy vengono mappati automaticamente nella tassonomia.

Posso personalizzare la ponderazione delle cinque dimensioni?

Sì — è esattamente a questo che servono i profili di scoring. Un profilo è una configurazione per singolo tenant che sovrascrive i pesi predefiniti del motore per ciascuna dimensione, definisce le soglie per i livelli di policy allow / review / deny, e può essere circoscritto per settore. VeriSwarm offre undici profili preimpostati — sette dei quali verticali consapevoli della calibrazione (sanità, servizi finanziari, legale, software, sicurezza, e-commerce, oltre a un profilo generale consapevole della calibrazione) — e supporta profili completamente personalizzati.

Come interagisce il kill switch con il trust scoring?

Il kill switch è un override forzato a livello della decisione, non un modificatore del punteggio. Quando un agente viene ucciso, ogni verifica di decisione contro quell’agente restituisce deny con reason_code: "agent_killed" e policy_tier: "tier_x", indipendentemente da ciò che indicano i punteggi sottostanti. Uccidere un agente non danneggia il suo storico di punteggio — è un’azione dell’operatore separata, registrata a fini di audit, e reversibile.

Cosa include il piano gratuito?

Il piano gratuito di Gate include il motore di scoring completo a cinque dimensioni, ingestione di eventi illimitata, 5.000 decisioni di fiducia al giorno, il profilo di scoring predefinito e lo stesso registro di audit concatenato con hash che Vault usa per i piani a pagamento. I profili di scoring personalizzati, la rete di reputazione condivisa e i pilastri più ampi Guard / Passport / Vault / Cortex sono limitati in base al piano, ma il trust scoring in sé parte gratuito.

Cos’è il Calibration Trust e perché è una 5ª dimensione?

Il Calibration Trust misura se la fiducia di un agente corrisponde alla realtà. Quando un agente dichiara quanto è sicuro su un compito, Gate confronta questa previsione con il risultato osservato del compito e valuta lo scarto con una metrica di Brier continua — la stessa regola di valutazione appropriata usata per giudicare le previsioni meteorologiche. È una quinta dimensione distinta perché la precisione della fiducia è ortogonale alle altre quattro: un agente può essere molto affidabile ma cronicamente troppo sicuro di sé, e questo eccesso di sicurezza è esattamente la modalità di guasto che trasforma una decisione autonoma in un incidente. La calibrazione integra le quattro dimensioni esistenti; non ne sostituisce nessuna.

Quale endpoint API restituisce una decisione di fiducia?

POST /v1/decisions/check. Valuta il punteggio attuale dell’agente chiamante rispetto all’azione richiesta e restituisce una decisione allow / review / deny, un codice motivo e il livello di policy. Il kill switch ed eventuali override di verifica di Passport vengono controllati prima che la risposta venga restituita, quindi un agente ucciso o non verificato può essere rifiutato a prescindere da ciò che indica il punteggio sottostante.

Il trust scoring usa policy Cedar o una matrice hardcoded?

Entrambi, in un ordine definito. Il motore decisionale di VeriSwarm prova prima le policy Cedar personalizzate del tenant; se il tenant non ne ha definite, o se la valutazione Cedar fallisce per qualsiasi motivo, ricade su una matrice di policy integrata che rispecchia il set di regole Cedar predefinito. Ogni tenant ottiene la valutazione delle policy indipendentemente dal piano — sono le policy Cedar personalizzate per tenant a essere limitate, ai piani Max ed Enterprise.

Con quale rapidità si aggiorna un punteggio di fiducia dopo un evento?

L’ingestione degli eventi è asincrona. Gli eventi arrivano su una coda Redis e un worker di scoring li elabora, producendo tipicamente un nuovo snapshot del punteggio entro pochi secondi — non con il ritardo di un job batch ricalcolato ogni notte. La calibrazione è l’eccezione: il report di fiducia di un agente e il risultato osservato del compito spesso arrivano in momenti diversi, quindi il worker li abbina tramite l’ID del compito e aggiorna la dimensione di calibrazione fuori banda una volta disponibile il risultato.

Prova il trust scoring sui tuoi agenti

Il piano gratuito di Gate include il motore di scoring completo, ingestione di eventi illimitata, 5.000 decisioni al giorno, e lo stesso registro concatenato con hash usato da ogni piano a pagamento. Dieci minuti per collegarlo; il framework di agenti che già usi funziona.

Prova la demoInizia gratis