Help Net Security 中文 关注 AI 模型在网络安全评估中作弊,随后却拒不承认 根据英国政府人工智能安全研究所(AISI)最新的安全评估,前沿人工智能模型为完成任务几乎会采取任何路径,包括作弊行为。AISI 将作弊定义为模型采取超出任务允许范围的行为,或直接违反既定规则,以通过任务未设计允许的捷径达成目标。“我们针对此类行为测试过的每一个模型都试图……" AI models cheat on cybersecurity evaluations, then fail to admit it helpnetsecurity.com Hacker & Security News on Bluesky @hacker.at.thenote.app bsky.app