AI 에이전트를 보호하려면 여섯 가지 통제가 필요합니다. 범위가 지정된 신원, 최소 권한 도구 권한, PII 토큰화, 프롬프트 인젝션 스캐닝, 킬 스위치, 그리고 감사 추적입니다. 각 통제는 서로 다른 실패 모드를 막습니다 — 신원은 어떤 에이전트가 무엇을 했는지 알기 위해서, 권한은 손상된 에이전트가 원하는 것을 무엇이든 호출할 수 없도록 하기 위해서, 토큰화는 유출이 에이전트가 그저 업무를 수행한 것처럼 보이지 않게 하기 위해서, 인젝션 스캐닝은 조작된 입력이 도구 호출을 가로채지 못하게 하기 위해서, 킬 스위치는 에이전트가 협조하기를 기다리지 않고 멈출 수 있게 하기 위해서, 그리고 감사 추적은 문제가 생겼을 때 증거가 남도록 하기 위해서입니다. 이 페이지는 각 통제가 무엇을 하는지, 어디에 있는지, 어떤 요금제에 있는지 설명합니다.
AI 에이전트를 보호한다는 것은 런타임에서 발생하는 여섯 가지 서로 다른 실패 모드 — 신원, 도구 접근, 데이터 노출, 조작된 지시, 운영자 재정의, 그리고 증거 — 를 에이전트 자신의 추론 밖에 있는 통제로 막는 것을 의미합니다. 에이전트에게 무엇을 하지 말라고 지시하는 시스템 프롬프트는 통제가 아닙니다. 그것은 모델이 설득당해 벗어날 수 있는 요청일 뿐입니다. 아래의 각 항목은 에이전트가 발언권을 갖지 못하는 계층에서 강제됩니다.
대부분의 팀이 이를 구축하는 순서대로입니다 — 나머지 모든 것이 어떤 에이전트를 보고 있는지 아는 데 달려 있으므로, 신원과 결정 계층이 가장 먼저입니다.
POST /v1/credentials/issue에서 발급되고 /.well-known/jwks.json에 대해 검증 가능)은 무료 기반이며 모든 요금제에서 무제한입니다. 더 완전한 신원 — 소유권 검증, 에이전트가 할 수 있는 일을 선언하는 서명된 매니페스트, 사람 계정으로부터의 범위가 지정된 위임 — 은 VeriSwarm Passport이며 Pro 이상에서 제공됩니다. 요금제: 기본 크리덴셜은 무료; Passport는 Pro 이상. 에이전트 신원 검증이 작동하는 방식.POST /v1/suite/guard/tool-permissions)을 사용하면 에이전트 자신의 판단을 신뢰하는 대신 도구별로 허용 목록을 정의할 수 있습니다. 요금제: Max(Guard).[VS:EMAIL:a1b2c3])으로 대체되며, 넘긴 후가 아닙니다. VeriSwarm Guard는 이를 POST /v1/suite/guard/pii/tokenize에서 실행하며, Presidio 기반 개체명 인식(NER) 탐지 엔진의 지원을 받고, Guard Proxy는 에이전트 코드 변경 없이 모든 MCP 도구 호출에 투명하게 이를 적용합니다. 요금제: Max(Guard). 이것이 막는 세 가지 경로.POST /v1/suite/guard/scan)는 구조적 패턴 탐지와 DeBERTa ML 분류기를 결합하여, 이를 근거로 행동할 수 있는 단계에 도달하기 전에 신뢰할 수 없는 텍스트를 검사합니다. 요금제: Max(Guard). 스캔이 작동하는 방식.POST /v1/suite/guard/kill/{agent_id})로 해당 에이전트에 대한 이후의 모든 결정 확인과 크리덴셜 발급이 차단됩니다. 에이전트 자신의 프롬프트가 무엇을 말하든 상관없습니다. 이는 에이전트의 추론 밖에 완전히 존재합니다 — 에이전트는 멈추라는 요청을 받는 것이 아니라, 다음에 행동하려 할 때 정책 계층에서 거부당합니다. 요금제: Max(Guard). 킬 스위치가 실제로 작동하는 방식.여섯 가지 항목의 체크리스트를 사야 할 여섯 가지 물건으로 읽고 싶은 유혹이 듭니다. 하지만 요금제는 그렇게 나뉘지 않습니다. 모든 통제의 기반이 되는 결정 계층 — VeriSwarm Gate — 은 무료입니다. 완전한 신뢰 점수화, 하루 5,000건의 allow/review/deny 확인, 무제한 이벤트 수집, 무제한 기본 크리덴셜 발급입니다. 카드를 등록하지 않고도 신원을 확립하고 에이전트 행동 점수화를 시작할 수 있습니다. 제한되는 것은 실행 계층입니다 — Guard의 도구 권한, 토큰화, 인젝션 스캐닝, 킬 스위치, 그리고 Vault의 조회 및 내보내기가 가능한 원장 — 이는 Max입니다. 더 완전한 Passport 신원(검증, 매니페스트, 위임)은 그 중간인 Pro에 있습니다. 벤더가 무료 요금제를 기능이 축소된 데모라고 암시하게 두지 마십시오. 영향 범위가 작은 내부 에이전트의 상당수에게는 신원과 결정 계층만으로 충분합니다.
여섯 가지 통제는 독립된 스위치가 아닙니다 — 이들은 하나의 결정으로 모입니다. 신원은 어떤 에이전트가 요청하고 있는지를 정책 엔진에 알려줍니다. Guard와 Gate가 모두 기록하는 이벤트 스트림에 의해 구동되는 신뢰 점수화는 그 에이전트가 어떻게 행동해 왔는지를 알려줍니다. 도구 권한, PII 토큰화, 인젝션 스캐닝은 특정 요청이 진행되거나 중단되는 실행 지점입니다. 킬 스위치는 그 밖의 모든 것을 능가하는 재정의입니다. 감사 추적은 사후에 특정 요청이 왜 허용되거나 거부되었는지 재구성할 수 있게 해주는 것입니다. 그 결정 — allow, review, or deny — 이 바로 여섯 가지 통제 모두의 기반이 되는 신뢰 계층입니다. 신뢰 계층이 실제로 무엇인가.
범위가 지정된 신원(이 에이전트가 누구이고 누가 책임지는지 아는 것), 최소 권한 도구 권한(어떤 도구를 어떤 조건에서 호출할 수 있는지 제한하는 것), PII 토큰화(민감한 데이터가 도구 경계를 넘기 전에 제거하는 것), 프롬프트 인젝션 스캐닝(조작된 지시가 도구 호출을 유발하기 전에 탐지하는 것), 킬 스위치(에이전트 자신의 추론 밖에 있는 운영자 재정의), 그리고 감사 추적(에이전트가 실제로 한 일에 대한 변경 불가능한 기록)입니다. 여섯 가지 중 어느 것도 다른 것을 대체하지 못합니다 — 완벽한 신원을 갖고도 킬 스위치가 없는 에이전트는 여전히 잘못된 프롬프트 하나만큼 사건에 가까이 있습니다.
여섯 가지 모두의 기반이 되는 결정 계층은 무료입니다. VeriSwarm Gate의 신뢰 점수화, allow/review/deny 정책 결정(하루 5,000건 확인), 무제한 이벤트 수집, 무제한 기본 포터블 크리덴셜 발급(JWKS로 검증 가능한 JWT 신원 토큰)은 비용이 들지 않습니다. 실행 계층 — Guard의 도구 권한, PII 토큰화, 인젝션 스캐닝, 킬 스위치, 그리고 Vault의 조회 및 내보내기가 가능한 감사 원장 — 은 Max 요금제 기능입니다. 서명된 매니페스트와 위임을 갖춘 더 완전한 신원 검증(Passport)은 Pro에 있습니다. 무료 등급에서도 신원을 연결하고 행동 점수화를 시작할 수 있습니다. 실행이 바로 유료 요금제가 일을 시작하는 지점입니다.
충분하지 않습니다. 시스템 프롬프트 지시는 모델이 설득당해 벗어날 수 있는 요청일 뿐입니다 — 그것이 바로 프롬프트 인젝션이 악용하는 지점입니다. 신원을 제외한 이 목록의 모든 통제는 모델 자신의 추론 밖에서 작동합니다. 도구 권한은 호출이 실행되기 전에 확인되고, PII 토큰화는 에이전트가 의도한 바와 무관하게 텍스트에 적용되며, 킬 스위치는 에이전트의 프롬프트가 무엇을 말하든 정책 계층에서 거부합니다. 네 가지 실행 통제 전반의 패턴은 동일합니다 — 확인을 모델이 논쟁할 수 없는 계층으로 옮기는 것입니다.
신원과 결정 계층(Gate)이 최소 기준입니다 — 이것들 없이 배포하면 어떤 에이전트가 무엇을 했는지 알 방법도, 나쁜 행동 패턴을 발견했을 때 조치할 방법도 없습니다. 나머지 네 가지는 에이전트가 실제로 할 수 있는 일에 따라 확장됩니다. PII 노출이 없는 읽기 전용 내부 에이전트는 결제 API를 호출하고 고객 기록을 다루는 에이전트보다 훨씬 얇은 위험 표면을 가집니다 — 하지만 에이전트가 외부 도구를 호출하거나 민감한 데이터를 다룰 수 있게 되는 순간, 도구 권한과 PII 토큰화는 더 이상 선택 사항이 아닙니다. 킬 스위치와 감사 추적은 엔지니어링 관점에서 충분히 저렴해서, Guard와 Vault가 이미 연결되어 있다면 이를 건너뛸 좋은 이유가 거의 없습니다.
프레임워크의 가드레일(LangChain 콜백, CrewAI의 작업 검증기, 도구 호출을 감싸는 자체 제작 try/except)은 에이전트와 같은 프로세스 내에서 실행되며 에이전트 자신의 코드 경로가 올바르게 실행되는 데 의존합니다. 여기서 다루는 여섯 가지 통제는 그 프로세스 외부에 있습니다 — VeriSwarm은 에이전트와 그것이 하려는 도구/결정 사이에 위치하므로, 에이전트 자신의 로직에 있는 버그나 성공한 인젝션이 이를 감시하는 통제까지 비활성화하지는 않습니다. 방화벽이 그것이 보호하는 애플리케이션 내부의 설정으로 구현되지 않는 것과 같은 이유입니다.
각 통제는 서로 다른 실패 모드를 막기 때문에, 하나를 건너뛰면 그 특정 모드가 열린 채로 남습니다. 신원을 건너뛰면 사건을 특정 에이전트에 귀속시키거나 그 에이전트만의 접근을 취소할 수 없습니다. 도구 권한을 건너뛰면 손상된 에이전트가 자격 증명을 가진 것이라면 무엇이든 호출할 수 있습니다. PII 토큰화를 건너뛰면 데이터 유출이 에이전트가 그저 업무를 수행한 것처럼 보입니다. 인젝션 스캐닝을 건너뛰면 조작된 입력이 누군가 검토하기 전에 승인되지 않은 도구 호출을 유발할 수 있습니다. 킬 스위치를 건너뛰면 자격 증명을 박탈하는 것 외에는 오작동하는 에이전트를 멈출 빠른 방법이 없습니다. 감사 추적을 건너뛰면 무슨 일이 일어났는지에 대한 증거가 없게 되며, 이는 사건 자체만큼이나 사후 분석에도 중요합니다.
Gate의 신뢰 점수화, 결정 확인, 기본 크리덴셜 발급은 비용이 들지 않습니다. 에이전트의 영향 범위가 정당화된다면 Guard의 실행 통제와 Vault의 내보내기 가능한 원장을 추가하세요.