DZone.com Feed 한국어 팔로우 당신의 Spark Job이 느린 이유는 잘못된 코드 때문이 아닙니다. 잘못된 Join 때문입니다. 저는 이 교훈을 혹독하게 배웠습니다.우리는 매일 3시간 이상 실행되는 중요한 데이터 파이프라인을 가지고 있었습니다. 로직은 완벽하게 깔끔했습니다. 전반적인 스키마는 명백히 올바랐습니다. 명백한 메모리 누수는 전혀 없었고, 원시 PySpark 변환에서 근본적으로 잘못된 것은 전혀 없어 보였습니다. Your Spark Job Isn't Slow Because of Bad Code. It's Slow Because of the Wrong Join dzone.com DZone.com Feed 한국어 RSS thenote.app