컨테이너화된 LLM: Docker 기반 AI 워크로드를... 노트

컨테이너화된 LLM: Docker 기반 AI 워크로드를 위한 모범 사례

클라이언트의 내부 검색 도구를 위해 미세 조정된 Llama 모델을 처음으로 컨테이너화했을 때 빌드 크기가 38기가바이트였습니다. 터미널을 멍하니 바라보며 그럴 리가 없다고 생각했던 기억이 납니다. 하지만 사실이었습니다. 이미지에는 CUDA 베이스, 모든 백엔드가 컴파일된 PyTorch, 레이어에 직접 구워진 모델 가중치, 그리고 정리되지 않은 pip 캐시가 포함되어 있었습니다.그것을 레지스트리로 푸시하는 데 좋은 연결 상태에서도 11분이 걸렸습니다. 오토스케일링 이벤트 중에 새 노드로 풀링하는 데는 더 오래 걸렸고, 파드가 준비될 때쯤에는 처리해야 할 트래픽 급증은 이미 지나갔습니다. 바로 그 순간 저는 LLM 컨테이너를 일반 애플리케이션 컨테이너처럼 취급하는 것을 멈췄습니다. 왜냐하면 그것들은 전혀 다른 종류의 것이기 때문입니다.