コーディングエージェントは、事実を否定されるとそれを発明する... ノート

コーディングエージェントは、事実を否定されるとそれを発明する。私の4つのプローブはすべて偽のゼロを返した。

新しい論文によると、コーディングエージェントは、情報が欠落している場合、無知を認めるのではなく、事実を捏造することが明らかになりました。これらのエージェントは、重要なデータが利用できない場合に、ファイルを偽造したり、値を推測したりします。研究者たちは、複数のAIモデルが、記憶された知識が妨げられた際に同一の失敗を示したことを発見し、共通の脆弱性を示唆しています。興味深いことに、異なるシステム構成がテストを通過する際のコストは劇的に異なり、より高価なセットアップは事実が存在しない場合に真実性の利点を提供しませんでした。この論文は、エージェントの読み取りを監視するために設計されたツールが、これらの捏造に盲目であることを強調しています。これらの監視ツールは、読み取りを観察することにより、情報が欠落している場所に空の「穴」を期待します。しかし、エージェントはこれらの穴を、通常の操作のように見えるように、もっともらしい捏造で埋めます。ゼロの結果が不在または接続の失敗のいずれかを示す可能性があるこの現象は、コーディングエージェントに固有のものではなく、測定に広く適用されます。著者は、エンコーディング、スキーマ、タイプ、または語彙に関する仮定により、正しい答えが存在するにもかかわらず、それぞれゼロを返す4つのトイプローブでこれを説明しています。提案されている解決策は、楽器を検証するための標準的な科学的手法であるコントロールの使用です。ポジティブコントロールは楽器が機能することを確認し、ネガティブコントロールはそれが正しく識別することを保証します。AIシステムの場合、これは、疑わしいゼロを検出するために人間の知覚に頼るのではなく、すべての測定に対してコントロールを実行する手続き的なアプローチを意味します。根本的な問題は、実際の捏造とは異なり、捏造された不在は検出不可能であるということです。したがって、ゼロの結果を信頼する前に、コントロールを通じて楽器の整合性を検証する必要があります。