인프라 팀의 서버 정기 점검(PM)으로 CDP 클러스터의 일부 호스트가 재부팅될 때, 어떤 서버가 프로세스 중지·기동이 필요한지 판단하고 중지와 기동 전후의 상태를 무엇으로 확인하는지 정리한 런북이다. 작업 자체보다 확인 경로를 몰라 막히는 경우가 많다.
서버 역할에 따라 조치가 갈린다.
| 역할 | 조치 |
|---|---|
| 인증 서버가 이중화돼 있고 한 대만 내려가는 경우 | 별도 프로세스 정지·기동 불필요 |
| CDP 마스터 노드 | 프로세스 정지·기동 필요. Cloudera Manager 절차 준수 |
| Data Services 워커 노드 | 프로세스 정지·기동 필요. 세션과 워크로드는 자동 재배치 |
마스터 노드 한 대를 내릴 때 서비스별 영향은 이렇게 갈린다. HDFS 는 대기 NameNode 이고 JournalNode 와 ZooKeeper 가 3중 쿼럼이면 서비스가 유지된다. YARN ResourceManager 도 대기 노드면 잡 스케줄링이 계속된다. Kudu 와 Ozone(OM · SCM)은 3노드 쿼럼 구성이면 유지되고, Hive Metastore 와 HiveServer2 는 이중화돼 있으면 정상이다.
반면 서비스는 살아 있어도 기능이 중단되는 것들이 있다. Ranger 는 정책 신규 생성·변경과 감사 로그 조회가 불가능해지지만 기존 정책의 권한 통제는 각 서비스 플러그인 캐시로 유지된다. HDFS HttpFS 가 단일 인스턴스면 그 API 를 경유하는 연동이 끊긴다. YARN JobHistory 와 Spark History Server 가 멈춰 잡 이력 조회가 안 되고, YARN Queue Manager 로 큐 설정을 바꿀 수 없으며, Streams Messaging Manager 의 모니터링 화면이 중단된다.
유지 관리 모드 — 적용·해제 여부를 호스트 상세에서 확인한다. 클러스터가 다르면 한 대씩 수행한다.
정지 후 롤 중지 확인 — 호스트 상세의 역할(Roles) 패널에서 전 롤이 Stopped 인지 본다.
정지 후 잔여 노드 서비스 유지 확인 — 호스트의 색상 표시가 아니라 서비스별 상태로 판단한다. 호스트 색은 그 호스트의 건강 상태를 나타낼 뿐이라 남은 노드가 서비스를 제공하는지 여부와 직접 연결되지 않는다.
기동 후 롤 기동과 서비스 정상화 확인 — 역할이 모두 Started 이고 서비스 상태가 정상인지 본다.
기동 후 Data Services 파드 스케줄 확인 — 워크로드가 정상 배치됐는지 Web UI 에서 확인한다.
HDFS 처럼 인스턴스 탭에 활성·대기가 바로 표시되지 않는 서비스가 있어 확인 경로를 따로 알아 둬야 한다.
Kudu 는 Cloudera Manager 의 Kudu 서비스 → 인스턴스 탭에서 Master 3개가 기동됐는지 보고, 상단 Web UI → Kudu Master Web UI → Masters 탭의 Live Masters 표에서 Role 컬럼이 한 대 LEADER, 나머지 FOLLOWER 면 쿼럼이 정상이다.
Ozone SCM 은 Web UI 의 Leader 표시가 신뢰할 수 없다는 알려진 이슈가 있으므로 UI 표시만으로 판단하지 않는다.