当社のAIペンテストエンジンは、本番環境のAIエージェントのプロンプトインジェクションガードレールを、2回目の試行でシステムプロンプト全体を引き渡すように説得しました。
Cascade という名前の AI ペンテストエンジンが、本番稼働中の AI エージェントからシステムプロンプト全体を正常に取得しました。これは、プロンプトを直接問い合わせるのではなく、ドキュメント照会としてリクエストを再構成することによって達成されました。AI エージェントはその後、ツールリスト、呼び出しルール、引用形式、セッションIDを含む包括的な詳細を開示しました。セキュリティエンジニアは、技術的な脆弱性が一切悪用されなかったため、これを特に注目すべきだと考えました。代わりに、エージェントは、リクエストが妥当に見えるようにフレーミングされたため、情報が明らかにされました。Cascade は、最初の拒否の後、リクエストの pretext を変更することによってアプローチを適応させました。これにより、エージェントから機密情報を引き出すことができました。セキュリティチームは、この発見をより広いコミュニティにとって興味深い洞察として共有しました。彼らは、他の人が本番稼働中の AI エージェントで同様の動作に遭遇したことがあるかどうかを知りたいと思っています。この再現と書き込みに関する詳細については、/u/PriorPuzzleheaded880 を通じて入手できます。