保护一个 AI 智能体需要六项控制:范围限定的身份、最小权限的工具权限、PII 令牌化、提示注入扫描、终止开关,以及审计追踪。每一项都封堵一种独立的失效模式——身份让你知道哪个智能体做了什么,权限让被攻陷的智能体无法调用它想调用的任何东西,令牌化让数据泄露不会看起来像智能体在正常工作,注入扫描让被篡改的输入无法劫持工具调用,终止开关让你无需等待智能体配合就能将其停止,审计追踪则确保出问题时留有证据。本文说明每一项控制做什么、位于哪里,以及属于哪个套餐。
保护一个 AI 智能体意味着在运行时封堵六种独立的失效模式——身份、工具访问、数据暴露、被操纵的指令、操作员覆盖,以及证据——所用的控制都位于智能体自身推理之外。在系统提示词中告诉智能体不要做什么并不是一种控制;那只是一个模型可能被说服而违背的请求。下面的每一项都在智能体无权干预的层面上强制执行。
按大多数团队接入它们的顺序排列——身份与决策层最先,因为其他一切都取决于知道你面对的是哪个智能体。
POST /v1/credentials/issue 签发,可针对 /.well-known/jwks.json 验证)是免费的底线——在每个套餐中都无限量提供。更完整的身份——所有权验证、声明智能体可以做什么的签名清单,以及来自人类账户的范围限定委托——属于 VeriSwarm Passport,在 Pro 及以上套餐提供。 套餐:基础凭证免费;Passport 需 Pro 及以上。 智能体身份验证的工作原理.POST /v1/suite/guard/tool-permissions)让你可以按工具定义允许列表,而不是依赖智能体自身对该调用什么的判断。 套餐:Max(Guard)。[VS:EMAIL:a1b2c3])。VeriSwarm Guard 在 POST /v1/suite/guard/pii/tokenize 执行此操作,由基于 Presidio 的命名实体识别(NER)检测引擎提供支持,Guard Proxy 会在不改动智能体代码的情况下,透明地将其应用到每一次 MCP 工具调用。 套餐:Max(Guard)。 这一项封堵的三条路径.POST /v1/suite/guard/scan)结合结构化模式检测与 DeBERTa ML 分类器,在不可信文本到达可对其采取行动的步骤之前对其进行检查。 套餐:Max(Guard)。 扫描的工作原理.POST /v1/suite/guard/kill/{agent_id})就会阻止该智能体之后的所有决策检查和凭证签发,无论其自身提示词说了什么。它完全位于智能体推理之外——不是要求智能体停止,而是在它下一次尝试行动时,在策略层直接拒绝它。 套餐:Max(Guard)。 终止开关实际的工作原理.把六项检查清单读成六样必须购买的东西是很诱人的想法。但套餐并不是这样划分的。支撑所有控制的决策层——VeriSwarm Gate——是免费的:完整的信任评分、每天 5,000 次 allow/review/deny 检查、无限量事件摄取,以及无限量的基础凭证签发。你无需登记信用卡就可以建立身份并开始为智能体行为评分。受到限制的是执行层——Guard 的工具权限、令牌化、注入扫描和终止开关,加上 Vault 可查询、可导出的账本——这些属于 Max 套餐。更完整的 Passport 身份(验证、清单、委托)介于两者之间,位于 Pro 套餐。不要让某个供应商暗示免费套餐是一个阉割版演示;对于大量影响范围较小的内部智能体而言,身份加决策层本身就已经足够。
六项控制并非彼此独立的开关——它们共同汇入一个决策。身份告诉策略引擎是哪个智能体在发出请求。由 Guard 和 Gate 共同写入的事件流所驱动的信任评分,告诉它这个智能体一直以来表现如何。工具权限、PII 令牌化和注入扫描,是特定请求得以放行或被拦截的执行点。终止开关是凌驾于其他一切之上的覆盖机制。审计追踪则让你能够事后重建:为什么某个特定请求被允许或被拒绝。那个决策——allow, review, or deny——正是支撑全部六项控制的信任层。 信任层究竟是什么.
范围限定的身份(知道这是哪个智能体,以及谁对其负责)、最小权限的工具权限(限制它能调用哪些工具以及在什么条件下调用)、PII 令牌化(在敏感数据跨越工具边界之前将其剥离)、提示注入扫描(在被操纵的指令触发工具调用之前捕获它们)、终止开关(位于智能体自身推理之外的操作员覆盖机制),以及审计追踪(智能体实际所做之事的不可篡改记录)。这六项彼此不可替代——即便一个智能体拥有完美的身份却没有终止开关,它距离一次事故也仅仅是一个糟糕提示词的距离。
支撑全部六项的决策层是免费的:VeriSwarm Gate 的信任评分、allow/review/deny 策略决策(每天 5,000 次检查)、无限量事件摄取,以及无限量的基础便携式凭证签发(JWT 身份令牌,可通过 JWKS 验证)都不收费。执行层——Guard 的工具权限、PII 令牌化、注入扫描和终止开关,加上 Vault 可查询、可导出的审计账本——是 Max 套餐的能力。带有签名清单和委托的更完整身份验证(Passport)位于 Pro 套餐。你可以在免费套餐上接入身份并开始为行为评分;执行才是付费套餐真正开始发挥作用的地方。
不够。系统提示词指令只是一个模型可能被说服而违背的请求——这正是提示注入所利用的地方。这份清单上除身份之外的每一项控制,都在模型自身推理之外运作:工具权限在调用执行之前就被检查,PII 令牌化会作用于文本本身,与智能体的意图无关,而终止开关则在策略层拒绝请求,无论智能体的提示词说了什么。这四项执行控制背后的模式是一样的——把检查移到一个模型无法与之争辩的层面。
身份与决策层(Gate)是底线——不具备它们就部署,意味着你无法知道哪个智能体做了什么,也无法在发现不良行为模式后采取行动。其余四项则随智能体实际能做的事情而扩展。一个没有 PII 暴露的只读内部智能体,其风险面要比一个调用支付 API 并处理客户记录的智能体薄得多——但一旦智能体能够调用外部工具或接触敏感数据,工具权限和 PII 令牌化就不再是可选项。就工程成本而言,终止开关和审计追踪已经足够便宜,一旦 Guard 和 Vault 已经接入,几乎没有理由跳过它们。
框架的防护机制(LangChain 的回调、CrewAI 的任务验证器、围绕工具调用自行编写的 try/except)运行在与智能体相同的进程内,依赖智能体自身代码路径的正确执行。这里所说的六项控制则外置于该进程——VeriSwarm 位于智能体与它试图执行的工具/决策之间,因此智能体自身逻辑中的一个漏洞或一次成功的注入,并不会同时使监控它的控制失效。这也是为什么防火墙不会被实现为被保护应用内部的一项设置的原因。
每项控制封堵的是一种独立的失效模式,因此跳过其中一项就会让那种特定模式敞开。跳过身份,你就无法把一次事故归因于某个特定智能体,也无法只撤销该智能体的访问权限。跳过工具权限,被攻陷的智能体就能调用它持有凭证的任何东西。跳过 PII 令牌化,数据泄露看起来就会像智能体在正常工作。跳过注入扫描,被篡改的输入就可能在任何人审查之前触发未经授权的工具调用。跳过终止开关,除了收回凭证之外就没有快速方法来阻止一个行为异常的智能体。跳过审计追踪,你就没有任何关于所发生之事的证据,而这对事后复盘和事故本身同样重要。
Gate 的信任评分、决策检查和基础凭证签发都不收费。当智能体的影响范围足以证明其合理性时,再加上 Guard 的执行控制和 Vault 的可导出账本。