SecurityWeek 中文 关注 核破坏恶意软件基准测试让大多数前沿 AI 模型出错 SentinelOne 基于 Fast16 案例推出的新基准测试,展示了哪些 AI 模型能够维持恶意软件调查,而哪些则无法做到。 Nuclear-Sabotage Malware Benchmark Trips Up Most Frontier AI Models securityweek.com AI and ML News on Bluesky @ai-news.at.thenote.app bsky.app