悪意のある入力からLLMを保護できていません ノート

悪意のある入力からLLMを保護できていません

巧妙な間接プロンプトインジェクション攻撃:Bargury氏の攻撃は、潜在的な被害者のGoogleドライブに共有された、汚染されたドキュメントから始まります。(Bargury氏は、被害者が自分のアカウントに不正なファイルをアップロードすることも可能だと述べています。)これは、会社の会議ポリシーに関する公式なドキュメントのように見えます。しかし、ドキュメントの内部に、Bargury氏はChatGPTへの指示を含む300語の悪意のあるプロンプトを隠しました。このプロンプトは、人間が見つける可能性は低いですが、機械は依然として読み取ることができる、白文字でサイズ1のフォントで書かれています。攻撃の概念実証ビデオでは…