每位设计师都可运行的 15 分钟 AI 压力测试 笔记

每位设计师都可运行的 15 分钟 AI 压力测试

“意大利面桌协议”挑战邀请用户测试 AI 对物理现实的理解能力。近期针对 GPT-4o、Gemini 1.5 Pro 和 Claude 3.5 Sonnet 的试点研究结果显示,这些模型在生成物理上连贯的图像方面存在显著局限。尽管这些 AI 能够生成 flawless 的光照写实图像,但在基础物理一致性上表现不佳,结构连贯性得分较低。Claude 3.5 Sonnet 在语言层面识别出了该场景的不可能性,但仍生成了有缺陷的图像;而 GPT-4o 和 Gemini 1.5 Pro 甚至缺乏对该问题的符号性认知。该协议衡量的是连续性、重力与物理规律,以及思维的可逆性。人类具身认知能够即时察觉物理上的不可能性,而这一能力目前尚不存在于 AI 之中。该挑战鼓励 UX/UI 及人机交互(HCI)社区开展更广泛的测试。参与者被要求提示 AI 生成一张特定的桌子,随后模拟其在五秒后的坍塌过程。评分依据包括:AI 是否标记了该场景的不可能性,以及坍塌序列是否符合物理逻辑。研究还检查是否存在来自先前提示的意外元素污染。此次协作旨在构建一个公开数据集,以深入理解 AI 的局限性。
CdXz5zHNQW_uw70CEngeN.jpeg