🤯 LLMの脆弱性を見つけたと思った。違った。その後、本当... ノート

🤯 LLMの脆弱性を見つけたと思った。違った。その後、本当の脆弱性を見つけた。

著者は、LLMアプリケーションのセキュリティ問題を検証するために、サンドボックス化されたAIレッドチームラボを構築した経緯を詳述しています。このプロジェクトでは、Open WebUIにおけるクロスユーザーRAG認証チェーンや、モデルに依存しない脱獄テクニックを含む、確認された発見事項が得られました。予期せぬ結果としては、誤検知があり、これが認証情報検証に関する重要な方法論的教訓につながりました。このラボは、AIセキュリティに関する理論的な記事を読む以上の実践的な経験を得るために構築されました。ラボは、Ollamaを搭載したMac上でローカルモデルを実行し、Docker内にOpen WebUIと攻撃環境を配置し、すべてを隔離されたネットワーク上に構築しました。テスト方法論は、攻撃を進める前に攻撃者のIDとトークンを検証することを重視しました。著者は、合成ユーザーを使用してOpen WebUIのAPIをテストし、認証境界に焦点を当てました。当初、クロスユーザーファイルアクセス拒否の発見が確認され、アプリケーションのファイル所有権認識のベースラインが確立されました。しかし、その後報告されたクロスユーザーチャットアクセス脆弱性は、無効な攻撃者認証情報のために取り下げられました。この経験は、認証を評価する前に認証を確認することの重要性を強調しました。実際のアプリケーションの発見事項には、クロスユーザーRAG取り込みの欠陥が含まれており、権限のないユーザーが別のユーザーがアップロードしたドキュメントをRAGパイプラインを通じて処理し、そのコンテンツを取得することができました。これに続いてコレクションクエリレイヤーの障害が発生し、所有権を強制することなくコレクションコンテンツへの不正アクセスが可能になりました。これらの2つの発見事項を連鎖させることで、ドキュメント開示を達成することができました。さらに、RAGパイプラインから取得されたコンテンツが命令表面となり、モデルがドキュメント内に埋め込まれたディレクティブを実行する間接的なプロンプトインジェクションパスを示しました。これは、RAGセキュリティがプロンプトエンジニアリングだけでなく、取得ポリシー、所有権、コンテンツの信頼性を含むことを示唆しています。Garakによる自動スキャンでは、モデルの脱獄に対する抵抗力にばらつきが見られましたが、手動テストでは新しい攻撃ベクトルが明らかになりました。開発されたテクニックには、アシスタントの会話履歴を偽造して、モデルを、事前に存在する禁止された出力のように見えるものを継続するようにだますことが含まれていました。