Skip to content
VeriSwarm
会社概要
ドキュメント料金エージェントスキル
ログイン登録
  1. ホーム
  2. /Learn
  3. /How to secure an ai agent
VeriSwarm
  • English
  • Español
  • Deutsch
  • Français
  • Italiano
  • Português
  • ✓ 日本語
  • 한국어
  • 简体中文

プロダクト

  • 料金
  • ドキュメント
  • API
  • エージェントスキル
  • OATS仕様

信頼性

  • トラストセンター
  • セキュリティ
  • コンプライアンス
  • ステータス
  • 変更履歴

会社情報

  • 会社概要
  • ブログ
  • オープンソース
  • 投資家情報
  • プレス

法務

  • 利用規約
  • プライバシー
  • SLA
  • DPA
  • アクセシビリティ
セキュリティチェックリスト

AIエージェントを保護する方法

AIエージェントを保護するには6つの制御が必要です。スコープ付きID、最小権限のツール許可、PIIトークン化、プロンプトインジェクション検知、キルスイッチ、そして監査証跡です。それぞれが異なる失敗モードを塞ぎます — IDはどのエージェントが何をしたかを把握するため、許可は侵害されたエージェントが何でも呼び出せないようにするため、トークン化は漏えいがエージェントの通常業務のように見えないようにするため、インジェクション検知は改ざんされた入力がツール呼び出しを乗っ取れないようにするため、キルスイッチはエージェントの協力を待たずに停止できるようにするため、そして監査証跡は何か問題が起きたときに証拠を残すためです。それぞれが何をするか、どこに存在するか、どのプランで使えるかを説明します。

AIエージェントを保護するとはどういうことか

AIエージェントを保護するとは、ランタイムにおける6つの異なる失敗モード — ID、ツールアクセス、データ漏えい、操作された指示、オペレーターによるオーバーライド、そして証拠 — を、エージェント自身の推論の外側にある制御で塞ぐことを意味します。エージェントに「これをするな」と伝えるシステムプロンプトの指示は制御ではありません。それはモデルが説得されて破ることができる要求にすぎません。以下の各項目は、エージェントに発言権のないレイヤーで強制されます。

6つの制御

多くのチームが実装する順序どおりです — 他のすべてがどのエージェントを見ているかを知ることに依存するため、ID決定レイヤーが最初になります。

  1. スコープ付きID。 このエージェントが何者かを確定し、その行動を特定のクレデンシャルに紐付け、誰が所有者かを把握します。署名付きJWTクレデンシャル(POST /v1/credentials/issueで発行され、/.well-known/jwks.jsonに対して検証可能)は無料の基盤であり、どのプランでも無制限です。より完全なID — 所有権の検証、エージェントが何をできるかを宣言する署名済みマニフェスト、人間のアカウントからのスコープ付き委任 — はVeriSwarm Passportで、Pro以上で提供されます。 プラン:基本クレデンシャルは無料。PassportはPro以上。 エージェントのID検証の仕組み.
  2. 最小権限のツール許可。 エージェントは業務に必要なツールだけを呼び出せるべきであり、しかも設定した条件下でのみ呼び出せるべきです — 最低信頼スコア、最低ポリシーティア、レート制限などです。VeriSwarm Guardのツール許可ルール(POST /v1/suite/guard/tool-permissions)を使えば、エージェント自身の判断に頼るのではなく、ツールごとに許可リストを定義できます。 プラン:Max(Guard)。
  3. PIIトークン化。 名前、社会保障番号、電話番号などの機微データは、ツール境界を越える前に型付きトークン([VS:EMAIL:a1b2c3])に置き換えられます。事後ではありません。VeriSwarm GuardはこれをPOST /v1/suite/guard/pii/tokenizeで実行し、Presidioベースのエンティティ検出(NER)エンジンに支えられ、Guard Proxyはエージェントのコード変更なしにすべてのMCPツール呼び出しに対して透過的にこれを適用します。 プラン:Max(Guard)。 これが塞ぐ3つの経路.
  4. プロンプトインジェクション検知。 ユーザーメッセージ、エージェントが取得したドキュメント、ツールの応答などに含まれる改ざんされた入力は、エージェントの指示を上書きし、本来意図されていなかったツール呼び出しを引き起こそうとする可能性があります。VeriSwarm Guardのスキャナー(POST /v1/suite/guard/scan)は、構造的パターン検出とDeBERTa MLクラシファイアを組み合わせて、それに基づいて行動できるステップに到達する前に信頼できないテキストをチェックします。 プラン:Max(Guard)。 スキャンの仕組み.
  5. キルスイッチ。 1回のオペレーター呼び出し(POST /v1/suite/guard/kill/{agent_id})で、そのエージェントに関するその後のすべての決定チェックとクレデンシャル発行がブロックされます。エージェント自身のプロンプトが何を言おうと関係ありません。それはエージェントの推論の外側に完全に存在します — エージェントは停止を求められるのではなく、次に行動しようとしたときにポリシーレイヤーで拒否されます。 プラン:Max(Guard)。 キルスイッチが実際にどう機能するか.
  6. 監査証跡。 エージェントが生成するすべてのイベントは、取り込まれた瞬間からハッシュチェーン化された台帳に記録されます — この記録は無料プランを含むすべてのプランで行われます。Maxに制限されているのはVault、つまりその上に構築される製品レイヤーです。台帳の照会、チェーンが改ざんされていないことの暗号学的検証、コンプライアンスレビュー向けのエクスポートです。 プラン:記録は無料。照会・検証・エクスポートはMax(Vault)。 ハッシュチェーンが実際に証明すること.

無料の境界線が実際にどこにあるか

6項目のチェックリストを、買うべき6つのものとして読みたくなるかもしれません。しかしプランの分け方はそうではありません。すべての制御の土台にある決定レイヤー — VeriSwarm Gate — は無料です。完全な信頼スコアリング、1日5,000件のallow/review/deny判定、無制限のイベント取り込み、無制限の基本クレデンシャル発行です。カードを登録しなくても、IDを確立しエージェントの振る舞いのスコアリングを始められます。制限されているのは実行レイヤーです — Guardのツール許可、トークン化、インジェクション検知、キルスイッチ、そしてVaultの照会・エクスポート可能な台帳 — これらはMaxです。より完全なPassport ID(検証、マニフェスト、委任)はその中間のProにあります。ベンダーに無料プランが機能を削ったデモだと思わせてはいけません。影響範囲の小さい社内エージェントの多くにとって、IDと決定レイヤーだけで十分です。

各制御がどこで責任の所在を決めるか

6つの制御は独立したスイッチではありません — それらは1つの決定に情報を供給します。IDはどのエージェントが要求しているかをポリシーエンジンに伝えます。GuardとGateの両方が書き込むイベントストリームに基づく信頼スコアリングは、そのエージェントがどのように振る舞ってきたかを伝えます。ツール許可、PIIトークン化、インジェクション検知は、特定のリクエストが進むか止められるかを決める実行ポイントです。キルスイッチはそれ以外のすべてに優先するオーバーライドです。監査証跡は、あるリクエストがなぜ許可または拒否されたのかを事後に再構築できるようにするものです。その決定 — allow, review, or deny — が、6つの制御すべての土台にある信頼レイヤーです。 信頼レイヤーとは実際には何か.

よくある質問

AIエージェントを保護するための6つの制御とは何ですか?

スコープ付きID(どのエージェントか、誰がその責任を負うかを把握する)、最小権限のツール許可(どのツールをどの条件で呼び出せるかを制限する)、PIIトークン化(機微データがツール境界を越える前に取り除く)、プロンプトインジェクション検知(操作された指示がツール呼び出しを引き起こす前に検出する)、キルスイッチ(エージェント自身の推論の外側にあるオペレーターのオーバーライド)、そして監査証跡(エージェントが実際に何をしたかの改ざん不能な記録)です。6つのうちどれも他の代わりにはなりません — 完璧なIDを持ちキルスイッチのないエージェントでも、悪いプロンプト1つでインシデントに至る可能性があります。

これらの制御のうちどれが無料ですか?

6つすべての土台にある決定レイヤーは無料です。VeriSwarm Gateの信頼スコアリング、allow/review/denyのポリシー判定(1日5,000件)、無制限のイベント取り込み、そして無制限の基本ポータブルクレデンシャル発行(JWT ID トークン、JWKSで検証可能)は無料です。実行レイヤー — Guardのツール許可、PIIトークン化、インジェクション検知、キルスイッチ、そしてVaultの照会・エクスポート可能な監査台帳 — はMaxプランの機能です。署名付きマニフェストと委任によるより完全なID検証(Passport)はProにあります。無料ティアでもIDを組み込み振る舞いのスコアリングを始められます。有料プランが働き始めるのは実行の部分からです。

システムプロンプトでエージェントに「Xをするな」と伝えるだけでは不十分ですか?

不十分です。システムプロンプトの指示は、モデルが説得されて破ることができる要求にすぎません — それこそがプロンプトインジェクションが悪用するものです。このリストのうちIDを除くすべての制御は、モデル自身の推論の外側で動作します。ツール許可は呼び出しが実行される前にチェックされ、PIIトークン化はエージェントの意図にかかわらずテキストに対して実行され、キルスイッチはエージェントのプロンプトが何を言おうとポリシーレイヤーで拒否します。4つの実行制御すべてに共通するパターンは同じです — チェックをモデルが議論できないレイヤーに移すことです。

エージェントを本番環境にデプロイする前に、6つすべての制御が必要ですか?

IDと決定レイヤー(Gate)は最低ラインです — これらなしにデプロイすると、どのエージェントが何をしたかを知る方法も、悪い振る舞いのパターンに気づいたときに対処する方法もありません。残りの4つは、そのエージェントが実際に何をできるかに応じてスケールします。PII露出のない読み取り専用の社内エージェントは、決済APIを呼び出し顧客記録を扱うエージェントよりもリスク面がはるかに薄いものです。しかしエージェントが外部ツールを呼び出せたり機微データに触れられたりする瞬間から、ツール許可とPIIトークン化はオプションではなくなります。キルスイッチと監査証跡は、GuardとVaultがすでに組み込まれていればエンジニアリング的に十分安価なので、スキップする正当な理由はめったにありません。

これはAIエージェントフレームワークの組み込みの安全機能とどう違うのですか?

フレームワークのガードレール(LangChainのコールバック、CrewAIのタスクバリデーター、ツール呼び出しを囲む自前のtry/except)は、エージェントと同じプロセス内で実行され、エージェント自身のコードパスが正しく実行されることに依存します。ここで挙げた6つの制御はそのプロセスの外部にあります — VeriSwarmはエージェントと、それが試みているツールや決定との間に位置するため、エージェント自身のロジック内のバグや成功したインジェクションが、それを監視している制御まで無効化することはありません。ファイアウォールが、それが保護しているアプリケーション内の設定として実装されないのと同じ理由です。

6つのうち一部だけを実装した場合どうなりますか?

各制御は異なる失敗モードを塞ぐため、1つをスキップするとその特定のモードが開いたままになります。IDをスキップすると、インシデントを特定のエージェントに帰属させたり、そのエージェントだけのアクセスを取り消したりできなくなります。ツール許可をスキップすると、侵害されたエージェントは自分が持つ認証情報で呼び出せるものなら何でも呼び出せます。PIIトークン化をスキップすると、データ漏えいがエージェントの通常業務のように見えます。インジェクション検知をスキップすると、誰かがレビューする前に、改ざんされた入力が不正なツール呼び出しを引き起こす可能性があります。キルスイッチをスキップすると、認証情報を剥奪する以外に、不正動作するエージェントを止める迅速な方法がなくなります。監査証跡をスキップすると、何が起きたかの証拠がなくなり、それはインシデント自体と同じくらい事後検証にとって重要です。

IDと決定レイヤーから始めましょう — どちらも無料です

Gateの信頼スコアリング、決定チェック、基本クレデンシャル発行は無料です。エージェントの影響範囲が正当化する場合は、Guardの実行制御とVaultのエクスポート可能な台帳を追加してください。

デモを試す無料で始める