TPU에서 Ray 실행하기, 파트 2: Ray AI 라이브러리
이 두 번째 부분에서는 Ray의 상위 레벨 라이브러리인 Serve, Data, Train이 Google의 TPU 슬라이스에서 AI 워크로드를 실행하는 복잡성을 어떻게 추상화하는지 살펴봅니다. Ray Serve는 간단한 토폴로지 구성을 사용하여 대규모 멀티 호스트 모델을 올바르게 갱 스케줄링하는 반면, Ray Data는 네이티브 JAX 배치로 가속기에 직접 데이터를 공급하여 데이터 로딩 병목 현상을 제거합니다. 마지막으로 JaxTrainer는 크로스 슬라이스 조정, 체크포인팅 및 내결함성을 자동으로 처리하여 TPU 전반의 분산 학습을 간소화합니다.