AIエージェントを保護するには6つの制御が必要です。スコープ付きID、最小権限のツール許可、PIIトークン化、プロンプトインジェクション検知、キルスイッチ、そして監査証跡です。それぞれが異なる失敗モードを塞ぎます — IDはどのエージェントが何をしたかを把握するため、許可は侵害されたエージェントが何でも呼び出せないようにするため、トークン化は漏えいがエージェントの通常業務のように見えないようにするため、インジェクション検知は改ざんされた入力がツール呼び出しを乗っ取れないようにするため、キルスイッチはエージェントの協力を待たずに停止できるようにするため、そして監査証跡は何か問題が起きたときに証拠を残すためです。それぞれが何をするか、どこに存在するか、どのプランで使えるかを説明します。
AIエージェントを保護するとは、ランタイムにおける6つの異なる失敗モード — ID、ツールアクセス、データ漏えい、操作された指示、オペレーターによるオーバーライド、そして証拠 — を、エージェント自身の推論の外側にある制御で塞ぐことを意味します。エージェントに「これをするな」と伝えるシステムプロンプトの指示は制御ではありません。それはモデルが説得されて破ることができる要求にすぎません。以下の各項目は、エージェントに発言権のないレイヤーで強制されます。
多くのチームが実装する順序どおりです — 他のすべてがどのエージェントを見ているかを知ることに依存するため、ID決定レイヤーが最初になります。
POST /v1/credentials/issueで発行され、/.well-known/jwks.jsonに対して検証可能)は無料の基盤であり、どのプランでも無制限です。より完全なID — 所有権の検証、エージェントが何をできるかを宣言する署名済みマニフェスト、人間のアカウントからのスコープ付き委任 — はVeriSwarm Passportで、Pro以上で提供されます。 プラン:基本クレデンシャルは無料。PassportはPro以上。 エージェントのID検証の仕組み.POST /v1/suite/guard/tool-permissions)を使えば、エージェント自身の判断に頼るのではなく、ツールごとに許可リストを定義できます。 プラン:Max(Guard)。[VS:EMAIL:a1b2c3])に置き換えられます。事後ではありません。VeriSwarm GuardはこれをPOST /v1/suite/guard/pii/tokenizeで実行し、Presidioベースのエンティティ検出(NER)エンジンに支えられ、Guard Proxyはエージェントのコード変更なしにすべてのMCPツール呼び出しに対して透過的にこれを適用します。 プラン:Max(Guard)。 これが塞ぐ3つの経路.POST /v1/suite/guard/scan)は、構造的パターン検出とDeBERTa MLクラシファイアを組み合わせて、それに基づいて行動できるステップに到達する前に信頼できないテキストをチェックします。 プラン:Max(Guard)。 スキャンの仕組み.POST /v1/suite/guard/kill/{agent_id})で、そのエージェントに関するその後のすべての決定チェックとクレデンシャル発行がブロックされます。エージェント自身のプロンプトが何を言おうと関係ありません。それはエージェントの推論の外側に完全に存在します — エージェントは停止を求められるのではなく、次に行動しようとしたときにポリシーレイヤーで拒否されます。 プラン:Max(Guard)。 キルスイッチが実際にどう機能するか.6項目のチェックリストを、買うべき6つのものとして読みたくなるかもしれません。しかしプランの分け方はそうではありません。すべての制御の土台にある決定レイヤー — VeriSwarm Gate — は無料です。完全な信頼スコアリング、1日5,000件のallow/review/deny判定、無制限のイベント取り込み、無制限の基本クレデンシャル発行です。カードを登録しなくても、IDを確立しエージェントの振る舞いのスコアリングを始められます。制限されているのは実行レイヤーです — Guardのツール許可、トークン化、インジェクション検知、キルスイッチ、そしてVaultの照会・エクスポート可能な台帳 — これらはMaxです。より完全なPassport ID(検証、マニフェスト、委任)はその中間のProにあります。ベンダーに無料プランが機能を削ったデモだと思わせてはいけません。影響範囲の小さい社内エージェントの多くにとって、IDと決定レイヤーだけで十分です。
6つの制御は独立したスイッチではありません — それらは1つの決定に情報を供給します。IDはどのエージェントが要求しているかをポリシーエンジンに伝えます。GuardとGateの両方が書き込むイベントストリームに基づく信頼スコアリングは、そのエージェントがどのように振る舞ってきたかを伝えます。ツール許可、PIIトークン化、インジェクション検知は、特定のリクエストが進むか止められるかを決める実行ポイントです。キルスイッチはそれ以外のすべてに優先するオーバーライドです。監査証跡は、あるリクエストがなぜ許可または拒否されたのかを事後に再構築できるようにするものです。その決定 — allow, review, or deny — が、6つの制御すべての土台にある信頼レイヤーです。 信頼レイヤーとは実際には何か.
スコープ付きID(どのエージェントか、誰がその責任を負うかを把握する)、最小権限のツール許可(どのツールをどの条件で呼び出せるかを制限する)、PIIトークン化(機微データがツール境界を越える前に取り除く)、プロンプトインジェクション検知(操作された指示がツール呼び出しを引き起こす前に検出する)、キルスイッチ(エージェント自身の推論の外側にあるオペレーターのオーバーライド)、そして監査証跡(エージェントが実際に何をしたかの改ざん不能な記録)です。6つのうちどれも他の代わりにはなりません — 完璧なIDを持ちキルスイッチのないエージェントでも、悪いプロンプト1つでインシデントに至る可能性があります。
6つすべての土台にある決定レイヤーは無料です。VeriSwarm Gateの信頼スコアリング、allow/review/denyのポリシー判定(1日5,000件)、無制限のイベント取り込み、そして無制限の基本ポータブルクレデンシャル発行(JWT ID トークン、JWKSで検証可能)は無料です。実行レイヤー — Guardのツール許可、PIIトークン化、インジェクション検知、キルスイッチ、そしてVaultの照会・エクスポート可能な監査台帳 — はMaxプランの機能です。署名付きマニフェストと委任によるより完全なID検証(Passport)はProにあります。無料ティアでもIDを組み込み振る舞いのスコアリングを始められます。有料プランが働き始めるのは実行の部分からです。
不十分です。システムプロンプトの指示は、モデルが説得されて破ることができる要求にすぎません — それこそがプロンプトインジェクションが悪用するものです。このリストのうちIDを除くすべての制御は、モデル自身の推論の外側で動作します。ツール許可は呼び出しが実行される前にチェックされ、PIIトークン化はエージェントの意図にかかわらずテキストに対して実行され、キルスイッチはエージェントのプロンプトが何を言おうとポリシーレイヤーで拒否します。4つの実行制御すべてに共通するパターンは同じです — チェックをモデルが議論できないレイヤーに移すことです。
IDと決定レイヤー(Gate)は最低ラインです — これらなしにデプロイすると、どのエージェントが何をしたかを知る方法も、悪い振る舞いのパターンに気づいたときに対処する方法もありません。残りの4つは、そのエージェントが実際に何をできるかに応じてスケールします。PII露出のない読み取り専用の社内エージェントは、決済APIを呼び出し顧客記録を扱うエージェントよりもリスク面がはるかに薄いものです。しかしエージェントが外部ツールを呼び出せたり機微データに触れられたりする瞬間から、ツール許可とPIIトークン化はオプションではなくなります。キルスイッチと監査証跡は、GuardとVaultがすでに組み込まれていればエンジニアリング的に十分安価なので、スキップする正当な理由はめったにありません。
フレームワークのガードレール(LangChainのコールバック、CrewAIのタスクバリデーター、ツール呼び出しを囲む自前のtry/except)は、エージェントと同じプロセス内で実行され、エージェント自身のコードパスが正しく実行されることに依存します。ここで挙げた6つの制御はそのプロセスの外部にあります — VeriSwarmはエージェントと、それが試みているツールや決定との間に位置するため、エージェント自身のロジック内のバグや成功したインジェクションが、それを監視している制御まで無効化することはありません。ファイアウォールが、それが保護しているアプリケーション内の設定として実装されないのと同じ理由です。
各制御は異なる失敗モードを塞ぐため、1つをスキップするとその特定のモードが開いたままになります。IDをスキップすると、インシデントを特定のエージェントに帰属させたり、そのエージェントだけのアクセスを取り消したりできなくなります。ツール許可をスキップすると、侵害されたエージェントは自分が持つ認証情報で呼び出せるものなら何でも呼び出せます。PIIトークン化をスキップすると、データ漏えいがエージェントの通常業務のように見えます。インジェクション検知をスキップすると、誰かがレビューする前に、改ざんされた入力が不正なツール呼び出しを引き起こす可能性があります。キルスイッチをスキップすると、認証情報を剥奪する以外に、不正動作するエージェントを止める迅速な方法がなくなります。監査証跡をスキップすると、何が起きたかの証拠がなくなり、それはインシデント自体と同じくらい事後検証にとって重要です。
Gateの信頼スコアリング、決定チェック、基本クレデンシャル発行は無料です。エージェントの影響範囲が正当化する場合は、Guardの実行制御とVaultのエクスポート可能な台帳を追加してください。