为何高分并不等同于健康人工智能的应用就绪 笔记

为何高分并不等同于健康人工智能的应用就绪

大型语言模型在健康应用基准测试中取得高分,然而对抗性压力测试现已揭示出普遍存在的脆弱性——包括对捷径的依赖、脆弱的视觉 grounding 以及伪造的推理轨迹——这暴露了基准表现与医疗决策支持及面向患者应用所需的支持就绪性证据之间的显著差距。