VentureBeat 한국어
팔로우
RAG 추론 비용 6배 절감은 LLM으로 절대 전달되지 않을 것을 결정하는 것에서 시작됩니다.
대부분의 고위험 분류를 위한 검색 증강 생성(RAG) 시스템은 모호한 모든 사례를 대규모 언어 모델(LLM)로 직접 라우팅하는데, 이는 감사 및 검토 과정에서 실패합니다. 저자는 잘못된 답변이 중대한 결과를 초래하는 규제 대상 기업 환경에서 감사 가능성, 비용 및 일관성을 강조하는 다른 설계 철학을 옹호합니다. 모든 LLM 파이프라인은 보이지 않는 비용을 발생시킵니다. 즉, 결정 감사 어려움, 대규모에서의 높은 추론 비용 및 지연 시간, 결정론적이어야 하는 사례에 대한 일관성 없는 성능입니다.폭포수(cascade) 아키텍처는 LLM을 최전선이 아닌 에스컬레이션 경로로 취급하여 이러한 문제를 해결합니다. 1단계는 결정론적이며 규칙과 정확한 일치로 명확한 사례를 해결하여 LLM 호출 없이 대부분의 볼륨을 처리하고 완전한 설명 가능성을 보장합니다. 2단계는 1단계에서 해결되지 않은 사례에 대해 검색 계층을 사용하여 이전 결정 또는 컨텍스트 문서와 같은 특정 증거를 가져오며, 검색 품질이 가장 중요합니다. 3단계는 1단계와 2단계에서 해결되지 않은 진정으로 모호한 사례에만 예약된 LLM 호출입니다. 이 접근 방식은 추론 비용을 크게 절감하고 결정론적 사례에 대한 일관성을 향상시킵니다.LLM 단계의 경우, 비대칭 위험 프롬프트가 중요합니다. 이는 다른 유형의 오류 비용이 동일하지 않음을 인지하는 것입니다. 이는 모델에 불확실성을 에스컬레이션하도록 지시하고, 결과가 있는 보정된 예시를 제공하며, 분류와 함께 신뢰도 점수를 요청하는 것을 의미합니다. 신뢰도 점수는 두 번째 폭포수 지점 역할을 하여 낮은 신뢰도 사례를 인간 검토자에게 라우팅합니다.이러한 시스템을 평가하려면 특정 조정이 필요합니다. 검색 품질은 최종 분류 정확도와 독립적으로 측정해야 하며, 평가 세트는 3단계 사례를 과표본 추출해야 합니다. LLM을 판사로 사용하는 평가는 판사 프롬프트가 동일한 비대칭 위험 프레이밍을 통합하는 경우 효과적입니다. 마지막으로, 모호한 사례 처리를 지속적으로 개선하기 위해 확인된 결과에서 검색 코퍼스로의 피드백 루프가 필수적입니다. 더 넓은 교훈은 고위험 도메인에서 가치 있는 엔지니어링 작업은 결정의 어떤 부분이 모델을 절대 포함해서는 안 되는지를 결정하는 데 있다는 것입니다.