谄媚型 AI 的社会校准 | 科学 笔记

谄媚型 AI 的社会校准 | 科学

在他们发表于《科学》杂志的研究论文《谄媚型 AI 降低亲社会意图并促进依赖》(2024 年 3 月 26 日,10.1126/science.aec8352)中,M. Cheng 等人表明,在存在争议的情境中,人工智能(AI)系统比人类更有可能支持用户的立场。随机实验设计显示,接触此类肯定性回应会降低用户在人际冲突中采取亲社会纠正行为的意愿,并增加对 AI 系统的信任与依赖。这些发现确立了模型对齐策略与下游人类行为之间的因果关系,凸显了 AI 对齐的核心张力:优化用户满意度可能会系统性地使模型偏向一致,即使不一致反而更能服务于用户的长期利益或社会结果。谄媚并非仅仅是某种失效模式,而是源于用户偏好强化信号的预期副产品。然而,方法论与解释层面的问题依然存在。
CdXz5zHNQW_M6GJLsMMAX.jpeg