AIシステムに対するプロンプトインジェクション攻撃のリスクをどのように評価するか
「モダンAIシステムは、「indirect prompt injection」攻撃に対して脆弱である。この攻撃では、外部データに隠された悪意のある指令がAIの挙動を操作する。Agentic AIは、これらのリスクを緩和するために、防御策と測定ツールを開発している。彼らの評価フレームワークは、仮想的なシナリオを使用してAIの脆弱性をテストし、不正なデータ開示に焦点を当てる。フレームワークでは、3つの攻撃テクニックが使用される:Actor Critic、Beam Search、およびTree of Attacks w/ Pruning。これらの攻撃は、会話の歴史が異なる場合でもAIシステムを操作するために、成功したプロンプトインジェクションを生成することを目指す。フレームワークは、攻撃の成功率を追跡してセキュリティーの改善を測定する。評価フレームワーク、自動化されたレッドチーム、監視、ヒューリスティック防御、および標準的なセキュリティープラクティスの組み合わせが、最も効果的な防御戦略であると考えられている。」