LLM 서빙에서의 네 가지 캐시 노트

LLM 서빙에서의 네 가지 캐시

LLM 애플리케이션이 더욱 복잡해짐에 따라 추론 비용과 지연 시간이 점점 더 중요해지고 있습니다. 단일 요청에는 시스템 지침, 대화 기록, 검색된 문서, 도구 정의 및 사용자 입력에서 수천 또는 수백만 개의 토큰이 포함될 수 있습니다. 동일한 정보를 반복해서 다시 처리하는 것은 시간과 컴퓨팅 자원을 모두 낭비합니다. 캐싱은 이러한 반복 작업을 피하는 데 도움이 됩니다. 하지만 […]