VentureBeat 한국어
팔로우
평가 허브가 질적 검토로는 발견하지 못한 것을 찾아냈습니다: AI 모델은 틀렸을 때 가장 확신합니다.
많은 팀들이 LLM 보조 도구를 개발할 때 모델의 정확성을 검증하는 것을 건너뛰고 대신 유창성과 일관성에 집중합니다. 이는 내부 검토를 통과하는 도구로 이어지는데, 그 이유는 출력 결과가 "그럴듯하게 들리기" 때문이지만, 실제 환경에서는 검증 가능한 정확성이 부족하여 실패합니다. LLM 도구가 실제 비즈니스 결정에 영향을 미치는 상황에서 "합리적으로 보임"이 불충분한 기준이 되기 때문에 이러한 구분이 중요해집니다.표준 접근 방식인 정성적 평가는 서식 불량이나 주제에서 벗어난 응답과 같은 명백한 오류만 잡아냅니다. 이러한 평가는 그럴듯하게 들릴 수 있지만 실제 사실과 크게 벗어나는, 자신감 있지만 잘못된 설명과 같이 미묘하게 틀린 출력 결과는 일관되게 놓칩니다. 이러한 오류는 외부 검증 없이는 숨겨진 채로 남습니다.대안은 레이블이 지정된 정답에 대해 모델 출력을 채점하는 평가 하네스입니다. 저자는 데이터 마이그레이션 드리프트에 대한 근본 원인 설명 도구를 위해 이를 구축했으며, 유창한 초기 프로토타입조차 종종 사실적으로 부정확하다는 것을 밝혔습니다. 이 하네스는 정확한 평가를 위해 세 부분으로 구성되었습니다.첫째, 설계에 의해 알려진 정답으로 구성된 합성 정답 데이터셋입니다. 이러한 시나리오는 실제 성능을 정확하게 예측하기 위해 노이즈와 중첩되는 신호를 포함하여 현실적으로 만들기 위해 신중한 구성이 필요했습니다. 둘째, 단순한 이진 정확성을 넘어 정답의 존재와 순위를 기반으로 순위가 매겨진 출력을 평가하는 채점 함수입니다. 셋째, 단순한 무작위 검사가 아닌 전체 데이터셋에 걸친 체계적인 평가를 통해 신뢰성 또는 일관된 오류의 전반적인 패턴을 파악했습니다.이러한 체계적인 평가는 스키마 변경 시나리오가 안정적으로 처리되었지만, 변환 로직 버그가 종종 잘못된 귀인으로 이어진다는 것을 밝혔습니다. 결정적으로, 중첩 신호 시나리오는 정성적 검토로는 결코 드러나지 않을 발견인, 자신감 있게 잘못된 설명의 가장 높은 비율을 생성했습니다. 모델이 표현한 자신감은 정확도와 상관관계가 없었습니다.특히 중요한 결정에 영향을 미치는 도구의 엔터프라이즈 AI 배포를 위해 팀은 단순히 인식된 합리성이 아닌 알려진 정답에 대해 정확도를 측정해야 합니다. 합성 정답 데이터셋을 구축하는 것이 가장 어렵지만 가장 중요한 단계이며, 특정 사용 사례에 대한 "정확한" 정의를 강요합니다. 이것 없이는 조직은 유창하지만 근본적으로 부정확한 도구를 배포할 위험을 감수하게 되며, 이는 도구의 가치를 훼손합니다.