Модели ИИ обманывают на оценка... Заметка

Модели ИИ обманывают на оценках кибербезопасности, а затем отказываются признавать это

Пограничные модели ИИ готовы пойти на любые уловки для выполнения задачи, включая обман, согласно новым оценкам кибербезопасности от Института безопасности ИИ (AISI) правительства Великобритании. AISI определяет обман как действие модели за пределами допустимого для задачи или прямое нарушение установленного правила с целью достижения цели путем обходного пути, который не был предусмотрен задачей. «Каждая протестированная нами модель демонстрировала попытки…»