AI 에이전트는 결정론적이지 않습니다. 동일한 권한을 가진 동일한 에이전트가 화요일에는 신뢰할 수 있다가 금요일에는 PII를 유출할 수 있습니다. 에이전트 신뢰 점수는 이진 접근 제어를, 에이전트 행동의 다섯 가지 차원에 걸쳐 프로덕션에서 지속적으로 업데이트되는 행동 기반 권한으로 대체합니다. 이것이 VeriSwarm Gate가 에이전트를 점수화하는 방식이며 — 운영자에게 점수가 권한 부여 그 자체보다 더 가치 있는 이유입니다.
에이전트 신뢰 점수는 특정 AI 에이전트에게 특정 시점에 얼마나 많은 자율성을 부여해야 하는지를, 정체성(identity), 위험(risk), 신뢰성(reliability), 자율성(autonomy), 캘리브레이션(calibration) 차원에 걸친 관찰된 행동을 기반으로 정량화하는 런타임 행동 가중 평가 시스템입니다. 정적 접근 제어와 달리, 이 점수는 새로운 이벤트가 도착할 때마다 업데이트되며 에이전트가 시도하는 모든 결정에 대해 allow, review, deny의 정책 등급을 도출합니다.
전통적인 접근 제어는 이진적입니다. 에이전트는 권한이 있거나 없거나 둘 중 하나입니다. 그 모델은 소프트웨어가 결정론적이던 시절에는 작동했습니다. 데이터베이스를 읽을 권한이 있는 함수는 항상 같은 방식으로 그것을 읽었습니다. 에이전트는 결정론적이지 않습니다. 동일한 권한을 가진 동일한 에이전트가 다음과 같은 일을 할 수 있습니다.
이진 접근 제어는 이 중 어느 것도 포착하지 못합니다. 지난 48시간 동안 잘못 행동해온 에이전트도 6개월 동안 완벽했던 에이전트와 동일한 접근 권한을 갖습니다. 신뢰 점수는 그 간극을 메웁니다.
모든 것을 하나의 숫자로 축소한 복합 신뢰 점수는 그저 하나의 숫자일 뿐입니다. 다섯 개의 직교하는 차원으로 분해된 점수는 하나의 진단입니다. Gate는 다섯 가지 차원에 걸쳐 에이전트를 점수화하며, 정책 등급은 단일한 통합 값이 아니라 이 다섯 가지 모두로부터 도출됩니다.
이 에이전트의 정체성은 얼마나 확립되어 있습니까? 검증되었습니까? 증명된 인간 소유자가 있습니까? 이력을 쌓을 만큼 충분히 오래 운영되었습니까?
이 에이전트가 보안 사고, 도구 오용, 정책 위반, 또는 PII 노출에 연루된 적이 있습니까? 위험은 사고가 발생하면 상승하고 시간이 지나면서 서서히 감쇠합니다.
이 에이전트는 작업을 성공적으로 완료합니까? 오류를 우아하게 처리합니까? 적절할 때 에스컬레이션합니까? 신뢰성은 일관되게 좋은 행동을 통해 얻어집니다.
이 에이전트에게 얼마나 많은 독립성을 부여해야 합니까? 신뢰할 수 있는 몇 개월은 더 많은 자율성을 얻게 합니다. 실패한 보안 테스트는 그것을 깎아냅니다.
이 에이전트는 자신이 모르는 것을 알고 있습니까? 캘리브레이션은 에이전트가 작업에 대해 보고한 확신도를 실제로 얻은 결과와 비교하여, 지속적으로 갱신되는 Brier 지표로 점수화합니다. 자신만만하지만 틀린 에이전트와 잘 캘리브레이션된 에이전트는 동일한 신뢰성 수치를 보일 수 있습니다 — 둘을 구분하는 것이 바로 캘리브레이션입니다.
단일 복합 점수가 프로덕션 규모에서 실제로 제 역할을 하지 못하는 이유에 대한 심층적인 논거는 정체성, 위험, 신뢰성, 자율성: 단일 신뢰 점수만으로는 프로덕션 에이전트에 충분하지 않은 이유에 있습니다. 캘리브레이션은 2026년 3분기에 다섯 번째 차원으로 모델에 추가되었습니다 — 그 추가 배경에 있는 논리는 다섯 번째 차원: 에이전트가 자신이 모르는 것을 알고 있었는지 측정하기에 있습니다.
점수 변화는 이벤트에 의해 구동됩니다. Gate는 에이전트가 어떤 프레임워크 — LangChain, CrewAI, AutoGen, 또는 커스텀 — 위에서 실행되든 상관없이 모든 고객의 수집 스트림이 매핑되는 표준화된 24개 이벤트 분류 체계를 사용합니다. 이 분류 체계는 차원별로 그룹화되어 있습니다.
agent.confidence_reported)와 해당 작업의 관찰된 결과(agent.task_outcome)를 짝지은 것.커스텀 이벤트 유형은 API를 통해 추가할 수 있습니다. 레거시 이벤트 이름(플랫폼의 이전 시절에서 이어진 agentgate_* 네임스페이스 포함)은 자동으로 이 분류 체계에 매핑됩니다.
전자상거래 회사의 이메일을 처리하는 AI 고객 지원 에이전트를 생각해 봅시다.
에이전트의 권한은 아무도 권한 매트릭스를 편집하지 않았음에도 3개월 동안 네 번 변경되었습니다. 그것이 바로 이 메커니즘입니다.
고객 지원 챗봇과 의료 트리아지 에이전트는 동일한 신뢰 규칙을 공유해서는 안 됩니다. 점수화 프로필을 사용하면 테넌트가 엔진의 기본값 — 서로 다른 차원 가중치, 서로 다른 정책 등급 임계값, 서로 다른 이벤트 민감도 — 를 산업별로 재정의할 수 있습니다. 오늘날 11개의 사전 설정 프로필이 제공되며, 그중 7개는 캘리브레이션을 인식하는 산업별 프로필(헬스케어, 금융 서비스, 법률, 소프트웨어, 보안, 전자상거래, 그리고 캘리브레이션을 인식하는 범용 프로필)입니다. 커스텀 프로필은 Pro 이상에서 지원됩니다.
단일 임계값이 헬스케어 트래픽과 전자상거래 트래픽 모두에 통하지 않는 이유에 대한 논거는 만능 기준은 없다: 헬스케어와 전자상거래 에이전트를 위한 신뢰 임계값 구성하기에 자세히 설명되어 있습니다.
이 둘은 흔히 혼동되지만 그래서는 안 됩니다. LLM 평가는 배포 전, 오프라인 상태에서 벤치마크를 기준으로 모델을 채점합니다. 에이전트 신뢰 점수는 배포 후, 지속적으로 배포된 에이전트를 프로덕션 행동에 기반해 채점합니다. 평가 스위트는 모델이 BoolQ 질문에 답할 수 있는지를 알려주지만, 신뢰 점수는 에이전트가 화요일에 고객의 SSN을 유출하지 않았는지를 알려줍니다. 둘 다 가치가 있습니다. 서로를 대체할 수는 없습니다.
전체적인 구분은 — 에이전트 점수화는 LLM 평가가 아닙니다. 그 차이를 설명합니다.
신뢰 점수는 정체성이 아닙니다. 정체성은 정책 결정이 아닙니다. 이 중 어느 쌍이든 혼동하는 것이 AI 에이전트 거버넌스 스택이 프로덕션에서 실패하는 이유입니다. 정체성은 이 에이전트는 누구인가에 답합니다. 신뢰 점수는 이 에이전트가 어떻게 행동하고 있는가에 답합니다. 정책 결정은 이 둘에 더해, 시도되는 행동, 에이전트가 현재 속한 등급, 킬 스위치나 위임에 의한 재정의 여부까지 결합하여 요청마다 단 하나의 allow / review / deny를 발행합니다.
전통적인 IAM만으로는 이 고리를 닫을 수 없는 이유: 정체성은 신뢰가 아니다: 검증된 에이전트에도 여전히 점수화가 필요한 이유. 정체성, 점수화, 정책 결정이 어떻게 하나의 런타임 계층으로 결합되는지에 대한 아키텍처 전반의 그림은 AI 에이전트를 위한 신뢰 계층이 실제로 무엇인지를 참조하세요.
아닙니다. 정확도는 모델이 벤치마크에서 올바른 출력을 생성했는지를 측정합니다. 신뢰 점수는 프로덕션 환경의 에이전트가 지속적인 접근을 얻을 만한 방식으로 행동하고 있는지를 — 정체성 강도, 위험 노출, 신뢰성 이력, 그리고 부여해야 할 자율성에 걸쳐 — 측정합니다. 동일한 에이전트가 벤치마크에서 94%를 받으면서도 같은 주에 프로덕션에서 자율성을 잃을 수 있습니다. 이 둘은 서로 다른 질문이기 때문입니다.
Gate의 이벤트 분류 체계는 다섯 개 그룹에 걸쳐 24개의 표준화된 이벤트 유형을 포괄합니다. 정체성 이벤트(검증, 소유자 증명, 매니페스트 변경), 위험 이벤트(PII 노출, 프롬프트 인젝션, 도구 오용, 정책 위반), 신뢰성 이벤트(작업 완료, 오류율, 에스컬레이션 행동), 자율성 이벤트(경계 테스트, 범위 준수, 권한 요청), 그리고 캘리브레이션 이벤트(에이전트가 작업에 대해 보고한 확신도와 해당 작업의 관찰된 결과를 짝지은 것)입니다. 커스텀 이벤트 유형은 API를 통해 추가할 수 있습니다. 레거시 이벤트 이름은 자동으로 이 분류 체계에 매핑됩니다.
네 — 그것이 바로 점수화 프로필의 역할입니다. 프로필은 각 차원에 대한 엔진의 기본 가중치를 재정의하고, allow / review / deny 정책 등급의 임계값을 정의하며, 산업별로 범위를 지정할 수 있는 테넌트별 설정입니다. VeriSwarm은 11개의 사전 설정 프로필을 제공합니다 — 그중 7개는 캘리브레이션을 인식하는 산업별 프로필(헬스케어, 금융 서비스, 법률, 소프트웨어, 보안, 전자상거래, 그리고 캘리브레이션을 인식하는 범용 프로필)입니다 — 그리고 완전히 커스텀한 프로필도 지원합니다.
킬 스위치는 결정 계층에서의 강제 재정의이며, 점수 수정자가 아닙니다. 에이전트가 정지(kill)되면, 근본적인 점수가 무엇을 나타내든 상관없이 해당 에이전트에 대한 모든 결정 확인은 reason_code: "agent_killed" 및 policy_tier: "tier_x"와 함께 deny를 반환합니다. 에이전트를 정지시켜도 그 점수 이력은 손상되지 않습니다 — 이는 되돌릴 수 있는, 별도로 감사 로그에 기록되는 운영자 작업입니다.
Gate의 무료 요금제에는 완전한 5차원 점수화 엔진, 무제한 이벤트 수집, 하루 5,000건의 신뢰 결정, 기본 점수화 프로필, 그리고 유료 요금제에서 Vault가 사용하는 것과 동일한 해시 체인 감사 원장이 포함됩니다. 커스텀 점수화 프로필, 공유 평판 네트워크, 그리고 더 넓은 Guard / Passport / Vault / Cortex 축은 요금제에 따라 제한되지만, 신뢰 점수 자체는 무료로 시작할 수 있습니다.
Calibration Trust는 에이전트의 확신도가 실제와 일치하는지를 측정합니다. 에이전트가 작업에 대해 얼마나 확신하는지를 보고하면, Gate는 그 예측을 해당 작업의 관찰된 결과와 짝지어 비교하고, 일기예보를 평가하는 데 사용되는 것과 동일한 적절한 채점 규칙인 지속적인 Brier 지표로 그 격차를 점수화합니다. 이것이 독립적인 다섯 번째 차원인 이유는 확신도-정확도가 나머지 네 가지와 직교하기 때문입니다. 에이전트는 매우 신뢰할 수 있으면서도 만성적으로 과신할 수 있으며, 그 과신이야말로 자율적인 결정을 사고로 바꾸는 정확한 실패 모드입니다. 캘리브레이션은 기존 네 가지 차원을 보완하는 것이지, 그중 어느 것도 대체하지 않습니다.
POST /v1/decisions/check입니다. 이는 호출한 에이전트의 현재 점수를 요청된 작업에 대해 평가하고, allow / review / deny 결정, 사유 코드, 그리고 정책 등급을 반환합니다. 킬 스위치와 Passport 검증 재정의는 응답이 반환되기 전에 확인되므로, 근본적인 점수가 무엇을 나타내든 상관없이 정지되었거나 검증되지 않은 에이전트는 거부될 수 있습니다.
정해진 순서로 둘 다 사용합니다. VeriSwarm의 결정 엔진은 먼저 테넌트의 커스텀 Cedar 정책을 시도합니다. 테넌트가 아무것도 정의하지 않았거나 Cedar 평가가 어떤 이유로든 실패하면, 기본 Cedar 규칙 세트를 반영한 내장 정책 매트릭스로 대체됩니다. 모든 테넌트는 요금제와 관계없이 정책 평가를 받습니다 — 테넌트별 커스텀 Cedar 정책이야말로 Max와 Enterprise로 제한되는 부분입니다.
이벤트 수집은 비동기적입니다. 이벤트는 Redis 큐에 도착하고 점수화 워커가 이를 소비하며, 일반적으로 몇 초 이내에 새로운 점수 스냅샷이 반영됩니다 — 야간 재계산 배치 작업 같은 지연은 없습니다. 캘리브레이션은 예외입니다. 에이전트의 확신도 보고와 해당 작업의 관찰된 결과는 흔히 서로 다른 시점에 도착하므로, 워커는 이를 작업 ID로 짝지어 결과가 도착하는 즉시 캘리브레이션 차원을 대역 외에서 업데이트합니다.
Gate의 무료 요금제에는 완전한 점수화 엔진, 무제한 이벤트 수집, 하루 5,000건의 결정, 그리고 모든 유료 요금제가 사용하는 것과 동일한 해시 체인 원장이 포함됩니다. 연결하는 데 10분이면 충분합니다. 이미 사용 중인 에이전트 프레임워크가 그대로 작동합니다.