AI推論の痕跡を盗む ノート

AI推論の痕跡を盗む

主要なLLMプロバイダーは、知的財産を保護するために、モデルのステップバイステップの推論を隠蔽しています。チェーンオブソートとしても知られるこの推論は、後続のリクエストのためにクライアントに暗号化されたテキストとして返されます。この研究では、これらの暗号化されたブロックがセッション、ユーザー、および同じプロバイダーのモデル間で交換可能であるというアーキテクチャ上の脆弱性を特定しています。これを悪用して、スケーラブルな復号化脱獄が開発されました。強力なモデルからの暗号化されたトレースを弱いモデルに注入することにより、弱いモデルはプレーンテキストでトレースを出力するように強制されます。これにより、アンチディスティレーションメカニズムがバイパスされ、敵対者は独自の推論を抽出できるようになります。この脆弱性は、公開リポジトリからPIIや認証情報を回復することによって実証されたように、大規模なプライベートデータ抽出も可能にします。最終的な出力が安全であっても、危険な情報が明らかにされる可能性もあります。さらに、攻撃者はこれらの暗号化されたブロック内に悪意のあるペイロードを隠すことで、目に見えないプロンプトインジェクションを実行できます。この研究では、これらのセキュリティ上の懸念に対処するための暗号化およびシステムレベルの緩和策を提案しています。