Skip to content
VeriSwarm
关于我们
文档定价智能体技能
登录注册
  1. 首页
  2. /Learn
  3. /Agent trust scoring
VeriSwarm
  • English
  • Español
  • Deutsch
  • Français
  • Italiano
  • Português
  • 日本語
  • 한국어
  • ✓ 简体中文

产品

  • 定价
  • 文档
  • API
  • 智能体技能
  • OATS 规范

信任

  • 信任中心
  • 安全
  • 合规
  • 状态
  • 更新日志

公司

  • 关于我们
  • 博客
  • 开源
  • 投资者
  • 新闻

法律

  • 条款
  • 隐私
  • SLA
  • DPA
  • 无障碍
技术指南

智能体信任评分

AI 智能体不是确定性的。拥有相同权限的同一个智能体,可能周二还很可靠,周五就泄露了 PII。智能体信任评分用基于行为的权限取代二元访问控制,这些权限会在生产环境中跨智能体行为的五个维度持续更新。这就是 VeriSwarm Gate 对智能体评分的方式——也是为什么对运营者而言,一个分数比一次权限授予更有价值。

什么是智能体信任评分

智能体信任评分是一种运行时的、按行为加权的评级系统,根据智能体在身份(identity)、风险(risk)、可靠性(reliability)、自主性(autonomy)和校准(calibration)这些维度上被观察到的行为,量化在给定时刻应赋予某个特定 AI 智能体多少自主权。与静态访问控制不同,该分数会随着新事件的到来而更新,并为智能体尝试做出的每一个决策驱动一个策略等级——allow、review 或 deny。

为什么二元访问控制还不够

传统的访问控制是二元的。一个智能体要么有权限,要么没有。当软件是确定性的时候,这种模型是可行的;一个拥有数据库读取权限的函数,总是以同样的方式读取数据。智能体不是确定性的。拥有相同权限的同一个智能体可能会:

  • 连续数周准确回答问题,然后开始产生幻觉。
  • 完美地遵守边界,然后又尝试访问其权限范围之外的数据。
  • 谨慎处理 PII,然后开始通过工具调用泄露它。
  • 在其角色范围内运行,然后开始试图升级自己的权限。

二元访问控制无法捕捉到这些情况中的任何一种。一个过去 48 小时行为不端的智能体,与一个六个月来表现完美的智能体拥有相同的访问权限。信任评分弥补了这一差距。

Gate 评分的五个维度

一个把所有内容压缩成单一数字的综合信任分数,只是一个数字而已。一个拆解为五个正交维度的分数,则是一份诊断。Gate 在五个维度上对智能体进行评分,策略等级由这五个维度共同决定——而不是由单一的汇总值决定。

身份可信度

这个智能体的身份建立得有多稳固?是否已验证?是否有经过证实的人类所有者?它是否已运行足够长的时间以建立可追溯的记录?

风险

这个智能体是否曾涉及安全事件、工具滥用、策略违规或 PII 泄露?风险会在事件发生时上升,并随时间缓慢衰减。

可靠性

这个智能体是否能成功完成任务?它能否妥善处理错误?它是否会在适当的时候升级处理?可靠性是通过持续良好的行为赢得的。

自主性

应该赋予这个智能体多大的独立性?可靠的数月表现会赢得更多自主权。一次未通过的安全测试则会削减它。

校准

这个智能体知道自己不知道什么吗?校准将智能体对某项任务所报告的置信度与其实际获得的结果进行比较,并用一个持续更新的 Brier 指标进行评分。一个自信满满却犯错的智能体,和一个校准良好的智能体,可能表现出相同的可靠性数字——正是校准把两者区分开来。

关于为何单一综合分数在生产规模下真的无法胜任这项工作,深入的论证见于身份、风险、可靠性、自主性:为何单一信任分数不足以应对生产环境中的智能体。校准作为第五个维度于 2026 年第三季度加入该模型——这项新增背后的推理见于第五个维度:衡量智能体是否知道自己不知道什么。

24 种事件分类体系

分数的变化由事件驱动。无论智能体运行在哪种框架之上——LangChain、CrewAI、AutoGen,还是自定义方案——Gate 都使用一套标准化的 24 种事件分类体系,每个客户的事件接入流都映射到其中。该分类体系按维度分组:

  • 身份事件 ——验证、所有者证明、清单变更、委托授予与撤销。
  • 风险事件 ——PII 泄露、提示注入检测、工具滥用、策略违规、Guard 检测结果。
  • 可靠性事件 ——任务完成、错误率激增、升级处理行为、回退链触发。
  • 自主性事件 ——边界测试、范围遵守情况、权限升级尝试、人工审核批准。
  • 校准事件 ——智能体对某项任务报告的置信度(agent.confidence_reported)与该任务观察到的结果(agent.task_outcome)的配对。

自定义事件类型可以通过 API 添加。旧版事件名称(包括源自平台早期阶段的 agentgate_* 命名空间)会自动映射到该分类体系中。

生产环境中的评分示例

设想一个为电商公司处理邮件的 AI 客服智能体。

  • 第 1 天。 身份分数低(无历史记录),风险中性,可靠性未知。策略等级:review。每一条面向客户的回复都需要人工批准。
  • 第 2 周。 已完成 500 次成功交互。身份增强,可靠性提升。标准回复的策略等级升级为allow,超过 100 美元的退款则为review。
  • 第 2 个月。 智能体意外将订单详情发送到了错误的邮箱地址。Guard 在未经授权的上下文中标记出 PII。风险飙升。在调查完成之前,所有交互的策略等级都回落至review。
  • 第 3 个月。 根本原因已修复。智能体恢复正常运行。风险衰减。信任是通过行为重新建立的,而不是靠管理员点击“批准”。

在没有任何人编辑权限矩阵的情况下,该智能体的权限在三个月内改变了四次。这就是其运作机制。

按行业划分的评分配置

客服聊天机器人和医疗分诊智能体不应共用相同的信任规则。评分配置允许租户按行业覆盖引擎的默认设置——不同的维度权重、不同的策略等级阈值、不同的事件敏感度。目前提供十一种预设配置,其中七种是具备校准感知能力的行业配置(医疗健康、金融服务、法律、软件、安全、电子商务,以及一个具备校准感知能力的通用配置);自 Pro 版起支持完全自定义的配置。

关于为何单一阈值既无法适应医疗健康流量、也无法适应电子商务流量的论证,详见没有放之四海而皆准的标准:为医疗健康与电子商务智能体配置信任阈值。

信任评分与 LLM 评测的区别

这两者经常被混为一谈,但不应如此。LLM 评测是在部署前、离线状态下,依据基准测试对模型打分。智能体信任评分则是在部署后,持续依据生产环境中的实际行为对已部署的智能体打分。评测套件能告诉你模型是否能回答一个 BoolQ 问题;信任分数能告诉你智能体在周二是否没有泄露某位客户的社保号(SSN)。两者都有价值。它们并不能相互替代。

完整的区分详见——智能体评分不是 LLM 评测。这就是区别所在。

信任分数、身份与策略决策的区别

信任分数不是身份。身份不是策略决策。混淆这几组概念中的任何一对,正是 AI 智能体治理体系在生产环境中失败的原因。身份回答的是这个智能体是谁。信任评分回答的是这个智能体的行为如何。一项策略决策会将两者结合——再加上正在尝试执行的操作、智能体当前所处的等级,以及任何终止开关(kill switch)或委托方面的覆盖——并针对每个请求给出唯一的 allow / review / deny 结果。

为什么仅靠传统 IAM 无法闭环:身份不等于信任:为何已验证的智能体仍然需要评分。关于身份、评分与策略决策如何组合成一个运行时层的架构全景,参见AI 智能体的信任层究竟是什么。

常见问题

信任分数和准确率分数是一回事吗?

不是。准确率衡量的是模型在基准测试中是否产生了正确的输出。信任分数衡量的是生产环境中的智能体是否以能够赢得持续访问权限的方式行事——涵盖身份强度、风险敞口、可靠性历史,以及应赋予它的自主权。同一个智能体可能在基准测试中拿到 94% 的分数,却在同一周的生产环境中失去自主权,因为这是两个不同的问题。

哪些类型的事件会影响智能体的信任分数?

Gate 的事件分类体系涵盖五大类共 24 种标准化事件类型:身份事件(验证、所有者证明、清单变更)、风险事件(PII 泄露、提示注入、工具滥用、策略违规)、可靠性事件(任务完成、错误率、升级处理行为)、自主性事件(边界测试、范围遵守情况、权限请求),以及校准事件(智能体对某项任务报告的置信度与该任务观察到的结果的配对)。自定义事件类型可以通过 API 添加;旧版事件名称会自动映射到该分类体系中。

我可以自定义这五个维度的权重吗?

可以——这正是评分配置存在的意义。配置是一种按租户设置的配置项,可以覆盖引擎针对每个维度的默认权重,定义 allow / review / deny 策略等级的阈值,并可按行业限定范围。VeriSwarm 提供十一种预设配置——其中七种是具备校准感知能力的行业配置(医疗健康、金融服务、法律、软件、安全、电子商务,以及一个具备校准感知能力的通用配置)——并支持完全自定义的配置。

终止开关(kill switch)如何与信任评分交互?

终止开关是决策层面的强制覆盖,而不是分数修正因子。当一个智能体被终止(killed)后,无论底层分数显示什么,针对该智能体的每一次决策检查都会返回 deny,并附带 reason_code: "agent_killed" 与 policy_tier: "tier_x"。终止一个智能体不会损坏它的分数历史——这是一个独立的、可撤销的、会被记录在审计日志中的运营者操作。

免费套餐包含哪些内容?

Gate 的免费套餐包括完整的五维评分引擎、无限量的事件接入、每天 5,000 次信任决策、默认评分配置,以及与付费套餐中 Vault 所使用的相同的哈希链审计账本。自定义评分配置、共享信誉网络,以及更广泛的 Guard / Passport / Vault / Cortex 支柱功能都按套餐分级限制,但信任评分本身可以免费开始使用。

什么是 Calibration Trust,为什么它是第五个维度?

Calibration Trust 衡量的是智能体的置信度是否与现实相符。当一个智能体报告它对某项任务有多大把握时,Gate 会将该预测与该任务观察到的结果进行配对,并用一个持续更新的 Brier 指标——与评估天气预报所用的恰当评分规则相同——对差距进行评分。它之所以是一个独立的第五维度,是因为置信度与准确性的一致性与其他四个维度是正交的:一个智能体可能高度可靠,却又长期过度自信,而这种过度自信正是把一次自主决策变成一起事故的失效模式。校准是对现有四个维度的补充,而不是替代其中任何一个。

哪个 API 端点会返回信任决策?

POST /v1/decisions/check。它会依据请求的操作评估发起调用的智能体当前的分数,并返回一个 allow / review / deny 决策、一个原因代码,以及策略等级。终止开关以及任何 Passport 验证覆盖都会在返回响应之前被检查,因此无论底层分数显示什么,一个已被终止或未经验证的智能体都可能被拒绝。

信任评分使用的是 Cedar 策略还是硬编码矩阵?

两者都用,且顺序是确定的。VeriSwarm 的决策引擎会首先尝试租户自定义的 Cedar 策略;如果该租户未定义任何策略,或 Cedar 评估因任何原因失败,系统就会回退到反映默认 Cedar 规则集的内置策略矩阵。无论套餐等级如何,每个租户都能获得策略评估——按租户自定义的 Cedar 策略才是受套餐限制的部分,仅限 Max 和 Enterprise 套餐。

事件发生后,信任分数多快会更新?

事件接入是异步的。事件进入 Redis 队列,由评分工作进程(worker)消费,通常在几秒钟内就会生成新的分数快照——而不是像夜间批量重新计算那样存在延迟。校准是个例外:智能体的置信度报告与该任务观察到的结果往往在不同时间到达,因此工作进程会按任务 ID 将两者配对,并在结果到达后带外(out-of-band)更新校准维度。

在你自己的智能体上试用信任评分

Gate 的免费套餐包括完整的评分引擎、无限量的事件接入、每天 5,000 次决策,以及与每个付费套餐相同的哈希链账本。接入只需十分钟;你现有的智能体框架无需改动即可使用。

试用演示免费开始