대용량 데이터를 저장하고 처리하는 스택을 다룬다. 단일 노드 관계형 데이터베이스는 Database 에 있다.
클러스터를 올리기 전 호스트 준비는 사전 작업 에 모아 두었다. 제품마다 개요 · 요구사항 · 구성 요소 · 설치 가이드 · 트러블슈팅 링크를 갖는다.
아래 목록은 제품의 성격으로 나누었다. 저장소 · 처리 엔진 · 수집 경로 · 메타데이터와 권한 · 배포판 순이며, 한 제품을 여러 곳에 두지 않았다.
- 클러스터를 올리기 전 호스트 준비 — hosts · IPv6 · 계정 · SELinux · Java.
- 하나의 질의를 어디까지 쪼개 병렬 실행하는가로 엔진을 가르는 기준.
- 데이터 아키텍처 전반을 훑는 참고 지식베이스.
- 분산 파일 시스템(HDFS). NameNode 이중화 · 밸런싱 · distcp · 백업.
- Hadoop 계열 오브젝트 스토리지. OM · SCM · DataNode 구성, S3 · ofs 인터페이스.
- 볼륨 → 버킷 → 키 3단계 네임스페이스와 FSO · OBS 레이아웃 확인 방법.
- 행 단위 갱신과 열 지향 스캔을 함께 지원하는 저장소. 파티션 설계 · 리밸런싱 · 운영 기록.
- HDFS 위의 컬럼 지향 NoSQL. 리전 · TTL · compaction · 스냅샷 · Phoenix.
- Redis · Valkey · MongoDB.
- 대용량 분석 테이블을 메타데이터 파일로 관리하는 테이블 형식. 스냅샷 · 스키마 변경 · 엔진 지원.
- 자원 관리자. 기본 포트와
yarn-site.xml.
- 분산 처리 모델.
mapred-site.xml 과 JobHistory Server.
- 배치 · SQL · 스트리밍 · 머신러닝을 한 런타임에서 다루는 분산 처리 엔진.
- HDFS 위의 SQL. Metastore · HiveServer2 · Tez · Spark Thrift Server.
- Impala · Trino · Denodo · Teiid.
- 메시지 브로커. 4.x KRaft 설치, 설정, 인증 · ACL, 모니터링, MirrorMaker 2, Debezium.
- 관계형 데이터베이스와 HDFS 사이의 이관. 2021년 은퇴(Attic) — 기존 잡 유지용.
- 잡마다 복사되는 libjars 를 공용 경로로 돌려 제출 시간과 작은 파일을 줄인다.
- DAG 기반 워크플로. 3.x Celery 설치 · Helm 차트 배포.
- Hadoop 잡 스케줄러. 2025년 은퇴(Attic) — 기존 워크플로 유지용.
- 하둡 생태계의 메타데이터 · lineage · 분류 관리. Hive · Spark · Kafka 훅으로 이벤트를 받는다.
- curl 로 테이블과 컬럼을 조회하고, 전용 훅이 없는 Kudu 를 HMS 경유로 올린다.
- 하둡 생태계의 접근 통제를 정책 하나로 모으는 도구. 플러그인 구조와 정책 종류.
- 공급망 관리 데이터를 대상으로 한 거버넌스 체계 구축 제안 참고 문서.
- 디스크 쓰기 지연이 성능을 가르는 이유와 dataDir · dataLogDir 분리.
- 고정 엔드포인트 하나로 접속하게 하는 TCP 모드 구성과 상태 확인.
status=203/EXEC 와 서비스 Type 선택, 기동 실패를 읽는 순서.
- 요구사항부터 서비스 등록 · 방화벽 · 동작 확인까지의 단일 노드 설치.
- 인수인계받은 인스턴스의 버전을 알아내는 방법과 리더 상태 불일치 대응.
- 웹 워크벤치. SQL 편집기 · 파일 브라우저 · 워크플로 편집기.
- Oracle · PostgreSQL · Trino 같은 외부 DB 를 인터프리터로 추가한다.
- Django 애플리케이션이 쓰는 자체 RDBMS 의 주요 테이블과 세션 정리.
- Kerberos · HTTPS 환경에서 REST API 를 쓰는 두 경로와 CSRF 토큰 처리.
- Rocky Linux 9 에서 CM Agent 의 DB 커넥션 테스트가 실패하는 원인.
- 권한 문제로 오해하기 쉬운 HttpFS 401 과 CSRF 403 을 갈라 본다.
- Hadoop 에코시스템 통합 배포판. Cloudera Manager 로 설치·설정·업그레이드를 관리한다.
- Spark 기반 관리형 플랫폼. 런타임 · 클러스터 · 노트북 · PySpark.
- SAS Institute 의 상용 분석 플랫폼. 배포 모델 · 구성 요소 · 요구사항.
- "HDFS 는 웨어하우스인가", "Snowflake 나 Redshift 는 분산 저장을 안 하는가" 같은 질문이 반복된다. 셋을 가르는 기준이…
- Apache Hudi 는 데이터 레이크에 놓인 파일 묶음을 갱신·삭제할 수 있는 테이블처럼 다루게 해 주는 테이블 포맷이자 그 위에서 도는 적…
- MQTT(Message Queuing Telemetry Transport) 는 대역폭이 좁거나 끊기기 쉬운 회선을 전제로 만든 경량 메시징 프…
- Apache SeaTunnel 은 서로 다른 시스템 사이에서 데이터를 옮기는 데이터 통합 엔진이다. 2017년 Waterdrop 이라는 이름으…
- SolrCloud 는 색인 하나를 여러 조각으로 나눠 여러 노드에 흩는다. 컬렉션을 만들 때 정하는 값들이 그 배치를 결정한다.
- Apache Superset 을 컨테이너로 올려 하둡 클러스터의 Hive Metastore 나 Hive · Impala 를 조회하는 구성이다.…