なぜ高得点がヘルスAIのアプリケーション準備完了を意味しない... ノート

なぜ高得点がヘルスAIのアプリケーション準備完了を意味しないのか

大規模言語モデルはヘルスケアアプリケーションのベンチマークで高スコアを達成していますが、敵対的ストレステストにより、ショートカットへの依存、脆弱な視覚的根拠、および捏造された推論の痕跡といった、広く見られる脆さが明らかになりました。これは、ベンチマークのパフォーマンスと、医療意思決定支援および患者向けアプリケーションの準備ができているという主張を裏付けるために必要な堅牢性の証拠との間に、かなりのギャップがあることを露呈しています。