Skip to content
VeriSwarm
Sobre
DocumentaçãoPreçosHabilidade do agente
EntrarCadastrar
  1. Início
  2. /Learn
  3. /Agent trust scoring
VeriSwarm
  • English
  • Español
  • Deutsch
  • Français
  • Italiano
  • ✓ Português
  • 日本語
  • 한국어
  • 简体中文

Produto

  • Preços
  • Documentação
  • API
  • Habilidade do agente
  • Especificação OATS

Confiança

  • Central de confiança
  • Segurança
  • Conformidade
  • Status
  • Changelog

Empresa

  • Sobre
  • Blog
  • Código aberto
  • Investidores
  • Imprensa

Jurídico

  • Termos
  • Privacidade
  • SLA
  • DPA
  • Acessibilidade
Guia técnico

Pontuação de confiança de agentes

Agentes de IA não são determinísticos. O mesmo agente com as mesmas permissões pode ser confiável na terça-feira e vazar PII na sexta-feira. A pontuação de confiança de agentes substitui o controle de acesso binário por permissões baseadas em comportamento que se atualizam continuamente, em produção, ao longo de cinco dimensões do comportamento do agente. É assim que o VeriSwarm Gate pontua agentes — e por que uma pontuação vale mais para um operador do que uma concessão de permissão.

O que é a pontuação de confiança de agentes

A pontuação de confiança de agentes é um sistema de classificação em tempo de execução, ponderado por comportamento, que quantifica quanta autonomia um agente de IA específico deveria receber em um determinado momento, com base em seu comportamento observado nas dimensões de identidade, risco, confiabilidade, autonomia e calibração. Ao contrário do controle de acesso estático, a pontuação se atualiza à medida que novos eventos chegam e determina um nível de política — allow, review ou deny — para cada decisão que o agente tenta tomar.

Por que o controle de acesso binário não é suficiente

O controle de acesso tradicional é binário. Um agente tem permissão ou não tem. Esse modelo funcionava quando o software era determinístico; uma função com permissão para ler um banco de dados sempre o lia da mesma forma. Agentes não são determinísticos. O mesmo agente com as mesmas permissões pode:

  • Responder perguntas com precisão por semanas e então começar a alucinar.
  • Seguir seus limites perfeitamente e então tentar acessar dados fora do seu escopo.
  • Tratar PII com cuidado e então começar a vazá-los por meio de chamadas de ferramentas.
  • Operar dentro do seu papel e então começar a tentar escalar suas próprias permissões.

O controle de acesso binário não capta nada disso. Um agente que vem se comportando mal nas últimas 48 horas mantém o mesmo acesso de um que tem sido perfeito por seis meses. A pontuação de confiança fecha essa lacuna.

As cinco dimensões que o Gate pontua

Uma pontuação de confiança composta que reduz tudo a um único número é apenas um número. Uma pontuação decomposta em cinco dimensões ortogonais é um diagnóstico. O Gate pontua agentes em cinco dimensões, e o nível de política é derivado de todas as cinco — não de um único valor consolidado.

Confiança de identidade

Quão bem estabelecida é a identidade deste agente? Ela é verificada? Existe um proprietário humano atestado? O agente já operou tempo suficiente para construir um histórico?

Risco

Este agente já esteve envolvido em incidentes de segurança, uso indevido de ferramentas, violações de política ou exposição de PII? O risco sobe quando ocorrem incidentes e decai lentamente ao longo do tempo.

Confiabilidade

Este agente conclui tarefas com sucesso? Ele lida bem com erros? Ele escala quando apropriado? A confiabilidade é conquistada por meio de comportamento bom e consistente.

Autonomia

Quanta independência deveria ser concedida a este agente? Meses confiáveis rendem mais autonomia. Um teste de segurança reprovado a reduz.

Calibração

Este agente sabe o que não sabe? A calibração compara a confiança que um agente relata sobre uma tarefa com o resultado que ele realmente obteve, pontuada com uma métrica de Brier contínua. Um agente confiante mas errado e um agente bem calibrado podem apresentar o mesmo número de confiabilidade — a calibração é o que os diferencia.

Sobre por que uma única pontuação composta realmente não cumpre a função em escala de produção, o argumento aprofundado está em Identidade, Risco, Confiabilidade, Autonomia: Por que uma única pontuação de confiança não é suficiente para agentes em produção. A calibração foi incorporada ao modelo como a quinta dimensão no 3º trimestre de 2026 — o raciocínio por trás dessa adição está em A quinta dimensão: medindo se um agente sabia o que não sabia.

A taxonomia de 24 eventos

As mudanças de pontuação são impulsionadas por eventos. O Gate usa uma taxonomia padronizada de 24 eventos na qual o fluxo de ingestão de cada cliente é mapeado, independentemente do framework — LangChain, CrewAI, AutoGen, personalizado — em que o agente roda. A taxonomia é agrupada por dimensão:

  • Eventos de identidade — verificação, atestado de proprietário, alterações de manifesto, concessões e revogações de delegação.
  • Eventos de risco — exposição de PII, detecções de prompt injection, uso indevido de ferramentas, violações de política, achados do Guard.
  • Eventos de confiabilidade — conclusão de tarefas, picos de taxa de erro, comportamento de escalonamento, acionamentos da cadeia de fallback.
  • Eventos de autonomia — testes de limites, aderência ao escopo, tentativas de escalonamento de privilégios, aprovações por revisão humana.
  • Eventos de calibração — a confiança relatada por um agente sobre uma tarefa (agent.confidence_reported) pareada com o resultado observado da tarefa (agent.task_outcome).

Tipos de evento personalizados podem ser adicionados via API. Nomes de eventos legados (incluindo o namespace agentgate_* herdado da vida anterior da plataforma) são mapeados automaticamente na taxonomia.

Um exemplo de pontuação em produção

Considere um agente de IA de atendimento ao cliente que gerencia e-mails para uma empresa de e-commerce.

  • Dia 1. Pontuação de identidade baixa (sem histórico), risco neutro, confiabilidade desconhecida. Nível de política: review. Toda resposta voltada ao cliente é aprovada por um humano.
  • Semana 2. Já são 500 interações bem-sucedidas. A identidade se fortalece, a confiabilidade sobe. O nível de política é elevado para allow nas respostas padrão, review em reembolsos acima de US$ 100.
  • Mês 2. O agente envia acidentalmente os detalhes de um pedido para o endereço de e-mail errado. O Guard sinaliza PII em um contexto não autorizado. O risco dispara. O nível de política volta para review em todas as interações enquanto o caso é investigado.
  • Mês 3. A causa raiz é corrigida. O agente retoma a operação normal. O risco decai. A confiança é reconstruída por meio do comportamento, não porque um administrador clicou em “aprovar”.

As permissões do agente mudaram quatro vezes em três meses sem que ninguém editasse uma matriz de permissões. Esse é o mecanismo.

Perfis de pontuação por setor

Um chatbot de atendimento ao cliente e um agente de triagem médica não deveriam compartilhar as mesmas regras de confiança. Os perfis de pontuação permitem que um tenant substitua os padrões do motor — pesos de dimensão diferentes, limiares de nível de política diferentes, sensibilidades de eventos diferentes — por setor. Onze perfis pré-configurados estão disponíveis hoje, sete deles verticais com consciência de calibração (saúde, serviços financeiros, jurídico, software, segurança, e-commerce, além de um perfil geral com consciência de calibração); perfis personalizados são suportados a partir do plano Pro.

O argumento sobre por que um único limiar não sobrevive tanto ao tráfego de saúde quanto ao de e-commerce está detalhado em Tamanho único não serve para todos: configurando limiares de confiança para agentes de saúde vs. e-commerce.

Pontuação de confiança vs. avaliação de LLM

Essas coisas costumam ser confundidas e não deveriam ser. A avaliação de LLM classifica um modelo em um benchmark, offline, antes da implantação. A pontuação de confiança de agentes classifica um agente implantado com base em seu comportamento em produção, continuamente, após a implantação. A suíte de avaliação diz se o modelo consegue responder a uma pergunta do BoolQ; a pontuação de confiança diz se o agente não vazou o SSN de um cliente na terça-feira. Ambas têm valor. Não são substitutas uma da outra.

A delimitação completa — Pontuação de agentes não é avaliação de LLM. Eis a diferença.

Pontuação de confiança vs. identidade vs. decisão de política

Uma pontuação de confiança não é uma identidade. Uma identidade não é uma decisão de política. Confundir qualquer um desses pares é o motivo pelo qual as arquiteturas de governança de agentes de IA falham em produção. A identidade responde quem é este agente. A pontuação de confiança responde como este agente está se comportando. Uma decisão de política combina as duas — além da ação sendo tentada, do nível em que o agente atualmente se encontra, e de quaisquer substituições por kill switch ou delegação — e emite um único allow / review / deny por solicitação.

Por que o IAM tradicional, sozinho, não fecha o ciclo: Identidade não é confiança: por que agentes verificados ainda precisam de pontuação. Para a visão arquitetural de como identidade, pontuação e decisões de política se combinam em uma única camada de execução, veja o que realmente é uma camada de confiança para agentes de IA.

Perguntas frequentes

Uma pontuação de confiança é a mesma coisa que uma pontuação de acurácia?

Não. Acurácia mede se um modelo produziu a saída correta em um benchmark. Uma pontuação de confiança mede se um agente em produção está se comportando de uma forma que lhe garante acesso contínuo — considerando força de identidade, exposição a risco, histórico de confiabilidade e a autonomia que deveria lhe ser concedida. O mesmo agente pode obter 94% em um benchmark e perder autonomia em produção na mesma semana, porque são duas perguntas diferentes.

Que tipos de eventos afetam a pontuação de confiança de um agente?

A taxonomia de eventos do Gate cobre 24 tipos de eventos padronizados em cinco famílias: eventos de identidade (verificação, atestado de proprietário, alterações de manifesto), eventos de risco (exposição de PII, prompt injection, uso indevido de ferramentas, violações de política), eventos de confiabilidade (conclusão de tarefas, taxas de erro, comportamento de escalonamento), eventos de autonomia (testes de limites, aderência ao escopo, solicitações de privilégio) e eventos de calibração (a confiança relatada por um agente sobre uma tarefa pareada com o resultado observado da tarefa). Tipos de evento personalizados podem ser adicionados via API; nomes de eventos legados são mapeados automaticamente na taxonomia.

Posso personalizar como as cinco dimensões são ponderadas?

Sim — é exatamente para isso que servem os perfis de pontuação. Um perfil é uma configuração por tenant que substitui os pesos padrão do motor para cada dimensão, define limiares para os níveis de política allow / review / deny, e pode ser delimitado por setor. A VeriSwarm oferece onze perfis pré-configurados — sete deles verticais com consciência de calibração (saúde, serviços financeiros, jurídico, software, segurança, e-commerce, além de um perfil geral com consciência de calibração) — e suporta perfis totalmente personalizados.

Como o kill switch interage com a pontuação de confiança?

O kill switch é uma substituição rígida na camada de decisão, não um modificador de pontuação. Quando um agente é eliminado, toda verificação de decisão contra esse agente retorna deny com reason_code: "agent_killed" e policy_tier: "tier_x", independentemente do que dizem as pontuações subjacentes. Eliminar um agente não danifica seu histórico de pontuação — é uma ação de operador separada, registrada para auditoria, e reversível.

O que está incluído no plano gratuito?

O plano gratuito do Gate inclui o motor de pontuação completo de cinco dimensões, ingestão ilimitada de eventos, 5.000 decisões de confiança por dia, o perfil de pontuação padrão, e o mesmo livro-razão de auditoria encadeado por hash que o Vault usa nos planos pagos. Perfis de pontuação personalizados, a rede de reputação compartilhada, e os pilares mais amplos Guard / Passport / Vault / Cortex são restritos por plano, mas a pontuação de confiança em si começa gratuita.

O que é o Calibration Trust e por que ele é uma 5ª dimensão?

O Calibration Trust mede se a confiança de um agente corresponde à realidade. Quando um agente relata o quanto está confiante sobre uma tarefa, o Gate compara essa previsão com o resultado observado da tarefa e pontua a diferença com uma métrica de Brier contínua — a mesma regra de pontuação adequada usada para avaliar previsões do tempo. É uma quinta dimensão distinta porque a precisão da confiança é ortogonal às outras quatro: um agente pode ser altamente confiável e ainda assim cronicamente excessivo em sua confiança, e esse excesso de confiança é exatamente o modo de falha que transforma uma decisão autônoma em um incidente. A calibração complementa as quatro dimensões existentes; não substitui nenhuma delas.

Qual endpoint da API retorna uma decisão de confiança?

POST /v1/decisions/check. Ele avalia a pontuação atual do agente que faz a chamada em relação à ação solicitada e retorna uma decisão allow / review / deny, um código de motivo, e o nível de política. O kill switch e qualquer substituição de verificação do Passport são checados antes que a resposta seja retornada, de modo que um agente eliminado ou não verificado pode ser negado independentemente do que a pontuação subjacente indicar.

A pontuação de confiança usa políticas Cedar ou uma matriz fixa?

Ambas, em uma ordem definida. O motor de decisão da VeriSwarm tenta primeiro as políticas Cedar personalizadas do tenant; se o tenant não tiver definido nenhuma, ou se a avaliação Cedar falhar por qualquer motivo, ele recorre a uma matriz de políticas integrada que espelha o conjunto de regras Cedar padrão. Todo tenant recebe avaliação de políticas independentemente do plano — as políticas Cedar personalizadas por tenant são a parte restrita, aos planos Max e Enterprise.

Com que rapidez uma pontuação de confiança é atualizada após um evento?

A ingestão de eventos é assíncrona. Os eventos chegam a uma fila do Redis e um worker de pontuação os consome, normalmente gerando um novo snapshot de pontuação em segundos — não com o atraso de um job em lote recalculado à noite. A calibração é a exceção: o relato de confiança de um agente e o resultado observado da tarefa muitas vezes chegam em momentos diferentes, então o worker os pareia pelo ID da tarefa e atualiza a dimensão de calibração fora de banda assim que o resultado chega.

Teste a pontuação de confiança nos seus próprios agentes

O plano gratuito do Gate inclui o motor de pontuação completo, ingestão ilimitada de eventos, 5.000 decisões por dia, e o mesmo livro-razão encadeado por hash usado por todo plano pago. Dez minutos para configurar; o framework de agentes que você já usa funciona.

Testar a demoComeçar grátis