VentureBeat 한국어
팔로우
Nvidia는 단순 선형 수학으로 비용이 많이 드는 AI 모델 핸드오프를 대체할 수 있다는 것을 발견했습니다.
에이전트 AI 시스템은 수신 모델이 전체 대화 기록을 다시 계산해야 하므로, 서로 다른 크기의 대규모 언어 모델 간 전환 시 상당한 병목 현상에 직면합니다. 이 재계산은 상당한 컴퓨팅 비용과 지연 시간을 발생시켜 장기적이고 다중 LLM 워크플로우를 방해합니다. Nvidia의 연구원들은 이 문제를 해결하기 위해 크로스 모델 KV 캐시 전송 기술을 개발했습니다. 이 방법은 사전 계산된 키-값(Key-Value) 캐시를 소스 모델에서 대상 모델로 직접 매핑합니다. 이 과정은 엔터프라이즈 AI 애플리케이션의 컴퓨팅 비용과 지연 시간을 크게 줄입니다. 실험 결과, 이 선형 매핑 기술은 캐시를 재계산하는 것보다 2.7배에서 25배 더 빠릅니다. 또한 호환되는 모델 쌍에서 대상 모델의 독립적인 정확도를 최대 98%까지 유지합니다. 이 기술은 KV 캐시의 선형 구조를 활용하며, 비용이 많이 드는 딥러닝 훈련 대신 간단한 대수적 방법을 사용합니다. 이를 통해 출력 품질 향상을 위해 더 작은 모델에서 더 큰 모델로 원활하게 업그레이드할 수 있습니다. 또한 초기 대규모 처리 후 더 큰 모델에서 더 작은 모델로 전환하여 비용 절감을 촉진합니다. 초기에는 동일 계열 내 모델 전송에 중점을 두었지만, 이 프레임워크는 더 광범위한 응용 가능성을 보여줍니다. 이 발전은 추론 비용을 관리하면서 다중 모델 에이전트 시스템을 확장하기 위한 중요한 도구를 제공합니다.