AIエージェントは決定論的ではありません。同じ権限を持つ同じエージェントが、火曜日は信頼できても金曜日にはPIIを漏洩することがあります。エージェント信頼スコアリングは、二値のアクセス制御を、エージェントの行動の5つの次元にわたって本番環境で継続的に更新される、行動ベースの権限に置き換えます。これがVeriSwarm Gateがエージェントをスコアリングする仕組みです——そして、なぜスコアが運用者にとって権限付与そのものより価値があるのかの理由です。
エージェント信頼スコアリングとは、特定のAIエージェントにある時点でどれだけの自律性を与えるべきかを、識別性(identity)、リスク(risk)、信頼性(reliability)、自律性(autonomy)、キャリブレーション(calibration)の各次元にわたる観測済みの行動に基づいて定量化する、実行時の行動加重評価システムです。静的なアクセス制御とは異なり、スコアは新しいイベントが届くたびに更新され、エージェントが試みるすべての決定に対してポリシー階層——allow、review、deny——を導きます。
従来のアクセス制御は二値です。エージェントには権限があるか、ないかのどちらかです。そのモデルは、ソフトウェアが決定論的だった頃には機能していました。データベースを読み取る権限を持つ関数は、常に同じ方法でそれを読み取っていました。エージェントは決定論的ではありません。同じ権限を持つ同じエージェントが次のようなことをする可能性があります。
二値のアクセス制御はこれらのいずれも捉えられません。過去48時間ずっと不適切に振る舞ってきたエージェントも、6か月間完璧だったエージェントと同じアクセス権を持ちます。信頼スコアリングはそのギャップを埋めます。
すべてを1つの数値に集約した複合信頼スコアは、単なる1つの数値にすぎません。5つの直交する次元に分解されたスコアは診断です。Gateはエージェントを5つの次元にわたってスコアリングし、ポリシー階層は単一の集約値ではなく、その5つすべてから導かれます。
このエージェントの識別情報はどれほど確立されていますか?検証済みですか?証明された人間の所有者がいますか?実績を積み上げるのに十分な期間、稼働してきましたか?
このエージェントはセキュリティインシデント、ツールの不正使用、ポリシー違反、PIIの漏洩に関与したことがありますか?リスクはインシデントが発生すると上昇し、時間とともにゆっくりと減衰します。
このエージェントはタスクを正常に完了しますか?エラーを適切に処理しますか?適切なタイミングでエスカレーションしますか?信頼性は一貫した良好な行動によって獲得されます。
このエージェントにどれだけの独立性を与えるべきですか?信頼できる月々が続けば自律性が増します。セキュリティテストの失敗はそれを削ります。
このエージェントは自分が知らないことを知っていますか?キャリブレーションは、エージェントがタスクについて報告した確信度と実際に得られた結果を比較し、継続的なBrierメトリクスでスコアリングします。自信満々だが間違っているエージェントと、よくキャリブレーションされたエージェントは同じ信頼性の数値を示すことがあります——両者を見分けるのがキャリブレーションです。
なぜ単一の複合スコアが本番規模では実際には機能しないのかについての詳しい論拠は、アイデンティティ、リスク、信頼性、自律性:単一の信頼スコアが本番環境のエージェントには不十分な理由にあります。キャリブレーションは2026年第3四半期に5番目の次元としてモデルに加わりました——その追加の背景にある理由は、第5の次元:エージェントが自分の知らないことを知っていたかどうかを測定するにあります。
スコアの変化はイベントによって駆動されます。Gateは、エージェントが動作しているフレームワーク——LangChain、CrewAI、AutoGen、独自実装——を問わず、すべての顧客の取り込みストリームがマッピングされる標準化された24種類のイベント分類体系を使用します。この分類体系は次元ごとにグループ化されています。
agent.confidence_reported)と、そのタスクの観測された結果(agent.task_outcome)のペア。カスタムのイベントタイプはAPI経由で追加できます。レガシーのイベント名(プラットフォームの以前の姿から引き継がれたagentgate_* 名前空間を含む)は自動的にこの分類体系にマッピングされます。
Eコマース企業のメール対応を行うAIカスタマーサポートエージェントを考えてみましょう。
エージェントの権限は、誰も権限マトリクスを編集することなく、3か月間で4回変化しました。それがこの仕組みです。
カスタマーサポートのチャットボットと医療トリアージエージェントは、同じ信頼ルールを共有すべきではありません。スコアリングプロファイルを使えば、テナントはエンジンのデフォルト設定——次元ごとの重み、ポリシー階層のしきい値、イベントの感度など——を業種ごとに上書きできます。現在、11のプリセットが提供されており、そのうち7つはキャリブレーションに対応した業種別プロファイル(ヘルスケア、金融サービス、法律、ソフトウェア、セキュリティ、eコマース、およびキャリブレーションに対応した汎用プロファイル)です。カスタムプロファイルはPro以上でサポートされます。
単一のしきい値がヘルスケアとeコマースの両方のトラフィックに対応できない理由については、画一的な基準では通用しない:ヘルスケアとeコマースのエージェント向けに信頼しきい値を設定するで詳しく説明しています。
この2つはしばしば混同されますが、そうあるべきではありません。LLM評価は、デプロイ前にオフラインでベンチマークに基づきモデルを評価します。エージェント信頼スコアリングは、デプロイ後、継続的に本番環境での行動に基づきデプロイ済みのエージェントを評価します。評価スイートはモデルがBoolQの質問に答えられるかどうかを教えてくれますが、信頼スコアはエージェントが火曜日に顧客の社会保障番号(SSN)を漏洩しなかったかどうかを教えてくれます。どちらにも価値があります。両者は互いの代替にはなりません。
完全な区分については——エージェントのスコアリングはLLM評価ではない。その違いを解説する。
信頼スコアは識別情報ではありません。識別情報はポリシー決定ではありません。これらのいずれかのペアを混同することが、AIエージェントガバナンススタックが本番環境で失敗する原因です。識別性が答えるのはこのエージェントは誰かです。信頼スコアリングが答えるのはこのエージェントはどのように振る舞っているかです。ポリシー決定は、両者に加えて、試みられているアクション、エージェントが現在属している階層、そしてキルスイッチや委任によるオーバーライドの有無を組み合わせて、リクエストごとに単一のallow / review / denyを発行します。
従来のIAMだけではこの輪を閉じられない理由:アイデンティティは信頼ではない:検証済みエージェントにもスコアリングが必要な理由。識別性、スコアリング、ポリシー決定が単一のランタイムレイヤーにどう組み合わさるかという構造的な全体像については、AIエージェントにとっての信頼レイヤーとは実際には何かを参照してください。
いいえ。正確性は、モデルがベンチマークで正しい出力を生成したかどうかを測定します。信頼スコアは、本番環境のエージェントが、継続的なアクセスに値するような振る舞いをしているかどうかを、識別性の強さ、リスクへの露出、信頼性の履歴、そして与えるべき自律性にわたって測定します。同じエージェントがベンチマークで94%を獲得しながら、同じ週の本番環境で自律性を失うこともあります。それは2つの異なる問いだからです。
Gateのイベント分類体系は、5つのファミリーにわたる24種類の標準化されたイベントタイプをカバーしています。識別性イベント(検証、所有者証明、マニフェストの変更)、リスクイベント(PIIの漏洩、プロンプトインジェクション、ツールの不正使用、ポリシー違反)、信頼性イベント(タスクの完了、エラー率、エスカレーション行動)、自律性イベント(境界テスト、スコープの遵守、権限リクエスト)、そしてキャリブレーションイベント(エージェントがタスクについて報告した確信度と、そのタスクの観測された結果のペア)です。カスタムのイベントタイプはAPI経由で追加できます。レガシーのイベント名は自動的にこの分類体系にマッピングされます。
はい——それがスコアリングプロファイルの役割です。プロファイルとは、各次元についてエンジンのデフォルトの重みを上書きし、allow / review / denyのポリシー階層のしきい値を定義し、業種ごとに範囲を絞ることができる、テナントごとの設定です。VeriSwarmは11のプリセットプロファイルを提供しています——そのうち7つはキャリブレーションに対応した業種別プロファイル(ヘルスケア、金融サービス、法律、ソフトウェア、セキュリティ、eコマース、およびキャリブレーションに対応した汎用プロファイル)です——そして完全にカスタムなプロファイルもサポートしています。
キルスイッチは決定レイヤーにおける強制的なオーバーライドであり、スコアの修飾子ではありません。エージェントが停止(kill)されると、そのエージェントに対するすべての決定チェックは、基盤となるスコアが何を示していようと、reason_code: "agent_killed" および policy_tier: "tier_x" を伴うdenyを返します。エージェントを停止しても、そのスコア履歴は損なわれません——それは元に戻すことができる、監査ログに記録された別個のオペレーター操作です。
Gateの無料プランには、完全な5次元スコアリングエンジン、無制限のイベント取り込み、1日5,000件の信頼決定、デフォルトのスコアリングプロファイル、そして有料プランでVaultが使用するのと同じハッシュチェーン監査台帳が含まれます。カスタムスコアリングプロファイル、共有レピュテーションネットワーク、そしてより広範なGuard / Passport / Vault / Cortexの各柱はプランによって制限されますが、信頼スコアリング自体は無料から始められます。
Calibration Trustは、エージェントの確信度が現実と一致しているかどうかを測定します。エージェントがあるタスクについてどれだけ自信があるかを報告すると、Gateはその予測をそのタスクの観測された結果と照らし合わせ、天気予報の評価に使われるのと同じ適切なスコアリングルールである継続的なBrierメトリクスでそのギャップをスコアリングします。これが独立した5番目の次元である理由は、確信度と正確性の一致が他の4つの次元とは直交しているからです。エージェントは非常に信頼できると同時に慢性的に過信している可能性があり、その過信こそが自律的な決定をインシデントに変える故障モードそのものです。キャリブレーションは既存の4つの次元を補完するものであり、そのいずれも置き換えるものではありません。
POST /v1/decisions/checkです。これは、呼び出し元のエージェントの現在のスコアを要求されたアクションと照らして評価し、allow / review / denyの決定、理由コード、そしてポリシー階層を返します。キルスイッチおよびPassportの検証によるオーバーライドはレスポンスが返される前にチェックされるため、停止済みまたは未検証のエージェントは、基盤となるスコアが何を示していようと拒否される可能性があります。
両方を、決められた順序で使用します。VeriSwarmの決定エンジンは、まずテナントのカスタムCedarポリシーを試みます。テナントが何も定義していない場合、またはCedarの評価が何らかの理由で失敗した場合は、デフォルトのCedarルールセットを反映した組み込みのポリシーマトリクスにフォールバックします。すべてのテナントはプランに関係なくポリシー評価を受けられます——テナントごとのカスタムCedarポリシーこそが、MaxおよびEnterpriseに制限されている部分です。
イベントの取り込みは非同期です。イベントはRedisキューに届き、スコアリングワーカーがそれを消費します。通常、数秒以内に新しいスコアスナップショットが反映されます——夜間の再計算バッチジョブのような遅延はありません。キャリブレーションは例外です。エージェントの確信度の報告とそのタスクの観測された結果は、しばしば異なるタイミングで届くため、ワーカーはそれらをタスクIDでペアリングし、結果が届いた時点でキャリブレーション次元を帯域外で更新します。
Gateの無料プランには、完全なスコアリングエンジン、無制限のイベント取り込み、1日5,000件の決定、そしてすべての有料プランが使用するのと同じハッシュチェーン台帳が含まれています。接続にかかる時間はわずか10分。すでにお使いのエージェントフレームワークがそのまま動作します。