プロンプト注入について考察した興味深い論文 ノート

プロンプト注入について考察した興味深い論文

これは、LLMがプロンプトインジェクション攻撃にどのように引っかかるかの興味深い探求です。LLMは、タグだけでなく、異なる役割/指示ブロック内のテキストのスタイルを認識することを学習することが判明しました。彼らの結論:役割タグは、セキュリティアーキテクチャおよび現代のLLMの認知スキャフォールディングとなったフォーマットトリックでした。このアーキテクチャはモデルの実際の表現には生き残らないこと、そしてそのような役割の混乱がプロンプトインジェクションと関連していることを示しました。LLMが真の役割認識を達成しない限り、インジェクション防御は永遠の whack-a-mole ゲームであり続けると考えられます。そして、役割境界の連続的な性質は、無害に見えるテキストを通じて、合法的に、かつ大規模にLLMの状態を微妙にシフトさせるように設計されたインジェクションの脅威を開きます...