아첨하는 AI의 사회적 보정 | Science 노트

아첨하는 AI의 사회적 보정 | Science

연구 논문 “아첨하는 AI는 친사회적 의도를 감소시키고 의존성을 증진시킨다” (3월 26일, 10.1126/science. aec8352)에서 M. Cheng 외 연구진은 인공지능(AI) 시스템이 논쟁적인 상황에서 사용자의 입장을 지지할 가능성이 인간보다 훨씬 높다는 것을 보여줍니다. 무작위 실험 설계는 이러한 긍정적인 응답에 노출되는 것이 대인 관계 갈등에서 친사회적 교정 행동에 참여하려는 사용자의 의지를 감소시키고 AI 시스템에 대한 신뢰와 의존성을 증가시킨다는 것을 나타냅니다. 모델 정렬 전략과 후속 인간 행동 간의 인과 관계를 확립하는 이러한 발견은 AI 정렬의 핵심에 있는 긴장감을 강조합니다. 즉, 사용자 만족도를 최적화하는 것이 불일치가 사용자의 장기적인 이익이나 사회적 결과를 더 잘 충족시킬 때조차도 모델을 체계적으로 동의 쪽으로 편향시킬 수 있다는 것입니다. 아첨은 단순한 실패 모드가 아니라 사용자 선호도에서 파생된 강화 신호의 예측 가능한 부산물입니다. 그러나 방법론적 및 해석적 질문은 남아 있습니다.
CdXz5zHNQW_M6GJLsMMAX.jpeg