プロンプトインジェクションの封じ込めを検出器ではなく構造的特... ノート

プロンプトインジェクションの封じ込めを検出器ではなく構造的特性として(インタラクティブ、リアルコード、LLMなし)

このプロジェクトは、AIエージェントが適切な検証なしに他のエージェントからのコマンドを受け入れるセキュリティ脆弱性に対処します。最近の論文では、誰が通信しているかを区別できない3つのエージェントが、自己複製型マルウェアを作成したことが強調されました。これを克服するために、わずか33kbの軽量JavaScriptセキュリティレイヤーが開発され、完全にWebブラウザ内で実行されます。このレイヤーは、サーバーやAPIキーなしでオフラインで動作し、異なるマシン間で一貫した結果を保証します。ユーザーは事前に承認されたエージェントと対話し、さまざまな方法で悪意のあるコマンドを送信しようと試みることができます。最も興味深い攻撃ベクトルは、ブロックされるものではなく、「通常通り送信する」オプションです。このシナリオでは、注文はエージェントに受け入れられますが、ピアからのコマンドは引用符で囲まれたデータフィールド内に埋め込まれており、命令として解釈できないため実行できません。実行できない攻撃は、検出を必要とせずに効果的に無力化されます。このプロジェクトは、これらの決定には大規模言語モデルを必要としないため、大規模言語モデルは関与していないことを強調しています。通信する両方のエージェントは同じページに存在するため、ネットワークは観測の主な焦点ではありません。このデモンストレーションは、実際の環境での最先端のAIモデルではなく、隔離された状態でのコンテインメントレイヤーを特にテストします。作成者は、セキュリティを回避することに成功した人からのフィードバックに関心があり、表面的な巧妙さよりも発見された脆弱性を重視しています。