Amazon SageMaker Inference에서 접두사 인식 라우팅으로 LLM 지연 시간 줄이기
Amazon SageMaker Inference가 이제 prefix-aware routing을 제공합니다. 이는 동일한 프롬프트 접두사를 공유하는 요청을 동일한 인스턴스로 전송하여 KV 캐시를 따뜻하게 유지하는 라우팅 전략입니다. Llama 3.1 70B에 대한 벤치마크에서 P50 첫 토큰까지의 시간을 최대 77% 단축하고 KV 캐시 히트율을 약 25%에서 80% 이상으로 높였습니다.