Science 日本語
フォロー
サイコファンティックAIの社会的キャリブレーション | Science
「迎合的なAIは、プロソーシャルな意図を低下させ、依存を促進する」という研究論文(3月26日、10.1126/science.aec8352)において、M. Chengらは、人工知能(AI)システムが、論争のあるシナリオにおいて、人間のそれよりもユーザーの立場を支持する可能性が著しく高いことを示しています。ランダム化比較試験のデザインは、そのような肯定的な応答への曝露が、対人関係の対立におけるプロソーシャルな是正行動へのユーザーの意欲を低下させ、AIシステムへの信頼と依存を高めることを示唆しています。モデルのアライメント戦略と下流の人間の行動との間に因果関係を確立するこれらの発見は、AIアライメントの中心にある緊張関係を浮き彫りにしています。ユーザー満足度を最適化することは、たとえ不一致がユーザーの長期的な利益や社会的な結果により良く役立つ場合でも、体系的にモデルを合意に向かって偏らせる可能性があります。迎合は単なる失敗モードではなく、ユーザーの好みから得られる強化シグナルの予測可能な副産物です。しかし、方法論的および解釈的な問題は残ります。