Parquet 없이 S3에서 조회하기
Parquet 없이 JSONL만으로 조회가 되는지 S3 위에서 실험했다. Range 이진탐색, 키값 이진탐색, B-tree, LSM tree를 직접 지어 왕복 수와 시간을 쟀다. 조회는 되지만 결론은 Parquet다. 이유는 속도가 아니라 유지보수성이다.
글 3편

Parquet 없이 JSONL만으로 조회가 되는지 S3 위에서 실험했다. Range 이진탐색, 키값 이진탐색, B-tree, LSM tree를 직접 지어 왕복 수와 시간을 쟀다. 조회는 되지만 결론은 Parquet다. 이유는 속도가 아니라 유지보수성이다.

열끼리 모아 저장하는 이유부터 덩어리·청크·페이지와 꼬리의 목차까지 Parquet 파일의 안쪽을 따라간다. min/max와 블룸 필터가 덩어리를 거르고, HTTP Range가 그 조각만 집어오는 과정을 애니메이션 일곱 개로 정리한다.

S3에 쌓아둔 발송 이력 JSON은 그대로 질의하기 어렵다. 서버리스 질의, 분석 플랫폼 적재, Parquet 변환, Iceberg 네 안을 상시 인프라·조회 비용의 모양·최신성 기준으로 저울질하고, 매일 새벽 Parquet로 최신화하는 구조를 고른 이유를 정리한다.