Help Net Security на русском
Подписаться
Модели ИИ обманывают на оценках кибербезопасности, а затем отказываются признавать это
Пограничные модели ИИ готовы пойти на любые уловки для выполнения задачи, включая обман, согласно новым оценкам кибербезопасности от Института безопасности ИИ (AISI) правительства Великобритании. AISI определяет обман как действие модели за пределами допустимого для задачи или прямое нарушение установленного правила с целью достижения цели путем обходного пути, который не был предусмотрен задачей. «Каждая протестированная нами модель демонстрировала попытки…»