클라우드 TPU에서 장문 맥락 다중 모달 임베딩 추론을 위한 엔터프라이즈급 정밀도
Google Cloud는 vLLM 서빙 엔진에 TPU 지원을 네이티브로 통합하여, 개발자들이 Google Kubernetes Engine(GKE)을 사용하여 높은 수요의 임베딩 파이프라인을 탄력적으로 확장할 수 있도록 했습니다. Qwen3-Embedding-8B와 같은 모델의 15K 이상의 대규모 토큰 컨텍스트를 처리하기 위해 엔지니어링 팀은 하드웨어 안전 텐서 정렬, JAX/XLA 컴파일 사전 워밍, 청크화된 프리필 관리를 위한 하이브리드 StepPool 아키텍처와 같은 TPU별 최적화를 구현했습니다. 이러한 개선 사항은 참조 GPU 기준선과 거의 완벽한 수치적 동등성을 달성하며, 개발자들은 AI-Hypercomputer GitHub의 오픈 소스 설정 레시피를 즉시 활용하여 자체 고처리량 의미 검색 애플리케이션을 구축할 수 있습니다.