HDFS에서의 삭제 코딩: 복제 비용을 200%에서 50%로 낮추는 방법
단순 복제에 비해 삭제 코드는 데이터 손실을 허용하는 더 효율적인 방법을 제공합니다. 파일의 여러 전체 복사본을 저장하는 대신, 삭제 코드는 데이터를 청크로 나누고 유한체 수학을 사용하여 계산된 패리티 청크를 추가합니다. 일부가 손실되더라도 원래 파일을 복구하는 데는 이러한 데이터 및 패리티 청크의 특정 수만 있으면 됩니다. 이 접근 방식은 스토리지 오버헤드를 크게 줄입니다. 예를 들어, 6+3 구성표(6개의 데이터 청크, 3개의 패리티 청크)는 삼중 복제의 200%에 비해 50% 더 많은 공간을 사용합니다. HDFS, S3 객체 스토리지 및 RAID 6와 같은 시스템은 하드웨어 장애에 대한 데이터 내구성을 보장하기 위해 삭제 코드를 활용합니다. 기본 수학, 주로 Reed-Solomon 코드는 놀랍도록 강력하며 다양한 기술에 응용됩니다. 삭제 코드를 구현하려면 원하는 내결함성에 따라 k+m 구성표를 선택하고 절충점을 이해해야 합니다. 효율적이지만 삭제 코드는 데이터 복구 중에 CPU 비용을 발생시키고 데이터 재구축이 필요할 때 지연 시간을 유발할 수 있습니다. 작은 파일에 대한 잠재적 오버헤드로 인해 차갑거나 자주 액세스하지 않는 데이터에 특히 유용합니다. 효과적인 내결함성을 위해 조각 분포에 대한 신중한 고려도 중요합니다. 삭제 코드를 가능하게 하는 동일한 유한체 산술은 QR 코드, CD 및 심지어 심우주 통신에서도 오류 수정을 지원합니다.