Talk Python to Me: #562: DuckL... 노트

Talk Python to Me: #562: DuckLake: SQL과 Parquet로만 이루어진 Lakehouse

DuckLake는 데이터에 액세스하기 전에 수많은 JSON 및 메타데이터 파일을 파싱하는 대신 단일 SQL 질문을 함으로써 차별화됩니다. 메타데이터는 실제 데이터베이스에 상주하며, 데이터 자체는 일반 Parquet 파일에 저장됩니다. 리드 개발자인 Pedro Holanda는 2018년에 DuckDB에 합류했습니다. Guillermo Sanchez Dionis 또한 DuckLake와 새로운 Quack 프로토콜에 기여하고 있습니다. Quack 카탈로그는 DuckLake가 높은 경합 상태에서도 초당 200건의 트랜잭션을 처리할 수 있도록 하여 다른 오픈 테이블 형식을 능가합니다. 이 에피소드는 Six Feet Up과 Talk Python Courses의 후원을 받습니다. 게스트로는 Pedro Holanda와 Guillermo Sanchez가 참여하며, 그들의 링크가 제공됩니다. 추가 링크는 progressive indexes, SQLite, Litestream, DuckDB, Iceberg, 그리고 DuckLake의 사양을 자세히 설명합니다. DuckLake-dataframe 및 Polars 코스도 강조됩니다. CSV 파싱, zero-copy Arrow, ART indexes, 그리고 DuckDB 내의 async I/O에 대한 정보도 제공됩니다. 마지막으로, YouTube에서 에피소드를 시청하고 스크립트를 찾을 수 있는 링크가 포함되어 있습니다.