すべてのデザイナーが実行できる15分間のAIストレステスト
Spaghetti Table Protocolチャレンジは、ユーザーがAIの物理的現実の理解度をテストすることを奨励しています。GPT-4o、Gemini 1.5 Pro、Claude 3.5 Sonnetの最近のパイロットスタディの結果は、物理的に一貫性のある画像を生成する上で顕著な限界を示しました。完璧なフォトリアリスティックな生成にもかかわらず、AIは基本的な物理学に苦戦し、構造的な一貫性において低いスコアでした。Claude 3.5 Sonnetは言語的に不可能性を認識しましたが、それでも不完全な画像を生成しました。GPT-4oとGemini 1.5 Proは、問題に対する象徴的な認識さえ欠いていました。このプロトコルは、連続性、重力と物理学、思考の可逆性を測定します。人間の身体化された認知は、物理的な不可能性を即座に検出しますが、これは現在AIにはない能力です。このチャレンジは、UX/UIおよびHCIコミュニティによるより広範なテストを奨励しています。参加者は、AIに特定のテーブルを生成させ、その後5秒後にその崩壊をシミュレートするようにプロンプトを与えることが求められます。結果は、AIが不可能性を指摘したかどうか、そして崩壊シーケンスが物理的な論理に従っているかどうかに基づいて採点されます。この研究では、以前のプロンプトからの意図しない要素の混入もチェックします。この共同の取り組みは、AIの限界を理解するための公開データセットを構築することを目的としています。