몇 주에서 하루로: LLM 평가를 반복할 만큼 빠르게 ... 노트

몇 주에서 하루로: LLM 평가를 반복할 만큼 빠르게 만드는 방법

프로덕션 언어 모델 시스템을 배포하려면 개선 사항에 대한 빠른 반복이 필요하며, 이는 모델과 평가 프로세스의 비결정적 특성으로 인해 어렵습니다. Airbnb는 엔지니어링 개선 및 통합에 중점을 두고 4개 계층에 걸쳐 안정적인 LLM 인프라를 구축하여 이러한 과제를 해결했습니다. 핵심 원칙은 구성 요소 간의 이음새에서 문제가 발생하며 포괄적인 엔드투엔드 테스트가 중요하다는 것입니다.계층 1은 평가 노이즈의 진단 프레이밍에 중점을 두고 데이터와 판단 불확실성을 구분하여 성능 변동을 이해합니다. LLM 평가의 노이즈는 심사위원이 입력에 다르게 점수를 매기거나 LLM 생성 참조가 변경되어 실제 모델 개선을 구별하기 어렵게 만드는 것에서 비롯될 수 있습니다. 인식 불확실성(모델/심사위원 한계)과 무작위 불확실성(작업 모호성)을 분리하는 것이 정확한 진단에 중요합니다.계층 2는 심사위원에게 입력을 안정화하여 결정론적 평가 기반을 구축합니다. 이는 참조 및 심사위원 점수에 대한 샘플별 캐시를 통해 달성되며, 동일한 입력이 캐시된 결과를 생성하도록 보장하고 평가를 재현 가능하고 효율적으로 만듭니다. 이러한 결정론적 측정은 계층 1의 진단 기능에 필수적입니다.계층 3은 마이크로 어댑터를 통해 제한적이고 범위가 지정된 모델 변이를 가능하게 합니다. 이는 특정 버그에 대해 훈련된 작은 LoRA 패치로, 빠른 1시간 훈련 및 핫픽스 스타일 배포를 허용합니다. 세 가지 수명 주기 규칙(공동 트리거 패치 융합, 누적 시 재훈련, 사용되지 않는 패치 언로드)은 어댑터 스택이 저하되는 것을 방지합니다.계층 4는 시스템의 이음새에서 엔드투엔드 유효성 검사를 제공합니다. 개별 구성 요소는 괜찮아 보일 수 있지만 상호 작용으로 인해 예기치 않은 동작이 발생할 수 있습니다. 이 계층은 전체 프로덕션 경로를 통해 대표적인 입력을 실행하여 결합된 품질과 지연 시간을 측정하고 배포 전에 이음새의 버그가 드러나도록 합니다. 이 네 계층은 각 계층의 효과가 다른 계층에 의존하는 종속 스택을 형성합니다.
CdXz5zHNQW_y2WUihSDGZ.png