높은 점수가 헬스 AI 애플리케이션 준비 상태를 의미하... 노트

높은 점수가 헬스 AI 애플리케이션 준비 상태를 의미하지 않는 이유

대규모 언어 모델은 건강 애플리케이션 벤치마크에서 높은 점수를 달성하지만, 적대적 스트레스 테스트는 이제 만연한 취약성을 드러냅니다. 즉, 지름길 의존, 취약한 시각적 근거, 조작된 추론 흔적 등이 그것인데, 이는 벤치마크 성능과 의료 의사 결정 지원 및 환자 대면 애플리케이션에 대한 준비 상태 주장을 뒷받침하는 데 필요한 견고성 증거 사이에 상당한 격차를 노출시킵니다.