野に放たれたAIの脅威:ウェブ上におけるプロンプトインジェクションの現状
Googleの脅威インテリジェンスチームは、AIシステムにとって大きなセキュリティ上の懸念事項である間接プロンプトインジェクション(IPI)攻撃を積極的に監視しています。彼らは、大規模なウェブアーカイブであるCommon Crawlを使用して公開ウェブをスキャンし、現実世界でのIPIの悪用を調査しました。彼らの研究は、脅威アクターがどのようにIPIを使用しているかを特定することを目的としていました。チームは、パターンマッチング、Geminiによる分類、手動レビューを含む多段階のアプローチを開発し、誤検知をフィルタリングしました。分析の結果、無害ないたずら、SEO、悪意のある活動など、AIを操作しようとする試みが明らかになりました。悪意のある試みには、データ流出や破壊が含まれていましたが、これらは一般的に洗練されていませんでした。調査結果は、IPI攻撃の洗練度は低いものの増加しており、悪意のある試みは32%増加していることを示唆しています。Googleは、今後、IPI攻撃の規模と洗練度の両方が増加すると予測しています。彼らは、モデルの強化とレッドチームへの投資を行っており、脆弱性報奨金プログラムを通じて外部の研究者の参加も行っています。Googleのリアルタイムデータ処理能力により、脅威を特定し、無効化することができます。彼らは、GenAIセキュリティ研究をさらに探求するためのリソースを提供しています。