Nature | Medicine 한국어 팔로우 높은 점수가 헬스 AI 애플리케이션 준비 상태를 의미하지 않는 이유 대규모 언어 모델은 건강 애플리케이션 벤치마크에서 높은 점수를 달성하지만, 적대적 스트레스 테스트는 이제 만연한 취약성을 드러냅니다. 즉, 지름길 의존, 취약한 시각적 근거, 조작된 추론 흔적 등이 그것인데, 이는 벤치마크 성능과 의료 의사 결정 지원 및 환자 대면 애플리케이션에 대한 준비 상태 주장을 뒷받침하는 데 필요한 견고성 증거 사이에 상당한 격차를 노출시킵니다. Why high scores do not mean application readiness for health AI nature.com