AIメモリセキュリティ設計図 ノート

AIメモリセキュリティ設計図

RAGシステムにより、フロンティアの大規模言語モデルは大幅に操作される可能性があります。少数の悪意のある文書を大規模コーパスに注入するだけで、研究者はほぼ常にLLMの出力を制御できるようになりました。PoisonedRAGとして知られるこの攻撃は、モデルやリトリーバーのコードへの直接アクセスを回避します。攻撃者は単に、インデックス化される悪意のある文書を導入するだけです。その後の研究であるCorruptRAGは、単一の悪意のある文書でも高い成功率を達成できることを実証しました。これは、少数の文書を感染させる方が多数を感染させるよりも現実的であるため、脅威をより現実的なものにします。コーパスのわずか0.04%のような小さな割合が汚染されていても、98%以上の攻撃成功につながる可能性があります。これらの汚染攻撃は、かなりの割合のインスタンスでシステム障害を引き起こす可能性があります。これらの発見は、精度向上のためにRAGを追加するだけではリスクのない取り組みではないことを強調しています。エンタープライズRAGシステムには、堅牢なセキュリティ対策が不可欠です。