현행 버전: Cloudera Base on premises 7.3.2 · Cloudera Manager 7.13.2
Cloudera 는 Apache Hadoop 생태계를 상용 배포판으로 묶어 제공하는 엔터프라이즈 데이터 플랫폼이다. 온프레미스 제품군은 클러스터를 설치·관리하는 Cloudera Manager, 저장·처리 엔진을 파셀로 배포하는 Cloudera Runtime, 컨테이너 위에서 도는 Data Services(CDE · CDW · Cloudera AI) 세 층으로 나뉜다. Data Services 는 Cloudera 가 제공하는 자체 Kubernetes 인 ECS(Embedded Container Service) 나 OpenShift 위에 올린다.
아래 문서는 설치 준비 · Cloudera Manager 운영 · 컴포넌트 설정 · 보안 · 각 데이터 서비스 순으로 묶어 두었다.
- Cloudera 의 제품 계보와 Base · Data Services · AI 스택이 각각 무엇을 맡는지 정리한다.
- Trino 는 별도 파셀이 아니라 CDW 의 실행 엔진으로만 제공된다. Kudu 연동 가능 여부를 함께 다룬다.
- Data Services 프리뷰 원페이저가 요구하는 온프렘 노드 사양을 워크로드 예산과 대조해 검토한 의견이다.
- 2025년에 정리된 온프레미스 제품명 체계와, 제안 요건 영역별로 어느 제품을 대응시킬지 정리한다.
- 두 플랫폼이 어느 계층을 오픈소스로 채우고 어디를 자체 제품으로 메우는지 계층별로 대조한다.
- Cloudera Manager 와 Runtime 을 따로 보는 버전 체계, LTS·STS 구분, 지원 OS 와 저장소 인증을 정리한다.
- CDP 설치 전에 호스트에서 끝내 두어야 할 사전 작업 목록과 점검 도구를 모았다.
- SELinux · THP · sysctl · chrony · JDK · JDBC 등 사전 조건을 검사하고 자동으로 교정하는 도구의 사용법이다.
- THP 를 enabled·defrag 모두 never 로 두는 방법과 tuned · 방화벽 · IPv6 · inotify 한도 조정을 다룬다.
- yum · apt 에서 Cloudera 저장소와 GPG 키가 제대로 잡혔는지 확인하는 명령을 모았다.
- Kerberos · TLS · 관리용 DBMS · JDBC 드라이버 등 CM 설치 직전 단계를 묶은 색인이다.
- CM 이 지원하는 MariaDB 버전과 스키마·계정 생성, JDBC 드라이버 배치 절차다.
- CM 이 지원하는 PostgreSQL 버전과 서비스별 데이터베이스·롤 생성 절차다.
- Active Directory 를 KDC 로 쓸 때 sssd · realmd 로 노드를 가입시키고 krb5.conf 를 맞추는 준비 단계다.
- Cloudera Manager 와 에이전트에 TLS 를 수동으로 걸기 위한 키·인증서 준비 절차다.
- JDK 버전별 cacerts 경로와 keytool 로 사설 CA 인증서를 신뢰 목록에 넣는 방법이다.
- 저장소 등록부터 scm 서버 패키지 설치, 스키마 초기화, 최초 기동까지의 절차다.
- CM 서버 이중화에 필요한 공유 NFS 준비 단계를 다룬다.
- prein 스크립틀릿이 Java 를 못 찾거나 기동 직후 서버가 죽을 때 확인할 세 가지 원인이다.
- 호스트 추가 마법사가 실패할 때 에이전트 쪽 로그와 7182 포트를 어떻게 확인하는지 정리한다.
- 파셀의 실체와 배포·활성화 디렉터리, alternatives 링크가 걸리는 위치를 설명한다.
- 업그레이드 전 SCM PostgreSQL DB 를 덤프하고 복구를 검증하는 절차다.
- 7.11.x → 7.13.x 업그레이드 순서와 버전별로 달라지는 JDK · Python 요구사항이다.
- 업그레이드가 실제로 필요한지, Cloudera 의 릴리스·LTS 지원 정책은 어떤지 근거를 들어 검토한다.
- 새 파셀이 활성화됐는데 /etc/alternatives 링크가 갱신되지 않아 명령이 깨질 때의 복구다.
- FirstRun 이나 YARN 단계에서 프레임워크 JAR 업로드가 실패할 때의 알려진 결함과 우회다.
- 레이아웃 버전이 어긋나고 previous.tmp 가 남아 NameNode 가 기동하지 못할 때의 복구 순서다.
- 워커 노드를 붙이는 절차와, 새 노드에서만 Ozone DataNode 가 UnsatisfiedLinkError 로 죽는 원인이다.
- 같은 서버에 다시 설치하기 전에 남은 계정 · 데이터 디렉터리 · DB 내용을 어디까지 지울지 정리한다.
- 깨진 alternatives 링크, 삭제된 UID 소유 파일, 파셀 P2P 배포 정체를 실제 사례로 다룬다.
- Public Cloud 의 Data Hub · Data Lake · Environment 와 Private Cloud Base 의 삭제 절차를 나눠 적었다.
- 패키지만 구버전으로 내렸을 때 scm DB 스키마가 신버전으로 남아 기동하지 못하는 문제를 푼다.
- 화면을 열지 않고 REST API 로 클러스터·호스트 상태를 뽑아 외부 모니터링에 붙이는 방법이다.
- tsquery 로 원하는 차트 지표를 뽑고 서비스 설정 파일을 내려받는 방법이다.
- 이벤트 색인 저장소의 상한을 정하는 eventserver_max_index_size 의 의미와 조정 기준이다.
- /var/log 아래 컴포넌트 로그를 별도 디스크로 옮기고 링크로 이어 주는 절차다.
- 정기 점검으로 호스트가 재부팅될 때 무엇을 내리고 무엇을 확인할지 적은 런북이다.
- 임계점 트리거를 만들고 SMTP 로 메일이 나가게 하는 설정과 Send Test Alert 실패 진단이다.
- 이벤트는 쌓이는데 메일만 나가지 않을 때 Alert Publisher 구성과 로그를 보는 순서다.
- 사용자 정의 알림 스크립트가 돌지 않는 원인이 관리 서비스의 이벤트·메트릭 전달 체인이었던 사례다.
- CM 에이전트가 chronyc 로 무엇을 보는지와 폐쇄망 내부 NTP 서버 구성을 다룬다.
- cm_guid 불일치로 하트비트가 거부되고 이어 ECS 환경 생성이 리트라이를 도는 사례다.
- 와일드카드 DNS 를 잘못 등록한 탓에 서버가 기억한 호스트명이 어긋났을 때의 교정이다.
- Cloudera Manager 와 Runtime 의 포트 표를 모아 둔 색인이다.
- CM 서버 · 에이전트 · 관리 서비스가 쓰는 포트를 공식 7.3.1 표와 대조해 정리했다.
- HDFS · YARN · Hive · Impala 등 런타임 컴포넌트의 포트를 서비스별로 나열한다.
- 방화벽 요청서에 그대로 옮겨 적을 수 있게 ECS 포트를 노드 역할별로 갈라 놓았다.
- 이중화를 위해 L4 장비 뒤에 둘 때 필요한 VIP·포트·분산 방식·세션 유지 조건을 정리한다.
- AD 를 KDC 로 쓸 때 미리 받아 둘 계정·OU 와 에이전트 통신 방향을 정리한다.
- CM 내장 CA 로 Auto-TLS 를 켜는 절차와 인증서가 놓이는 위치, 그다음에 손댈 보안 항목이다.
- Use Case 2 와 3 의 차이를 정리하고 기존 클러스터에 Auto-TLS 를 켜는 절차를 다룬다.
- principal 을 OS 계정으로 매핑하는 규칙을 CM 에서 관리하는 방법과 Kudu 쪽 함정이다.
- Knox 기본 PAM 인증을 AD/LDAP 으로 바꾸는 절차와 바인드 DN · Alias 관련 오류를 다룬다.
- NameNode · ResourceManager 등 웹 UI 가 401 로 막힐 때 브라우저에 SPNEGO 를 거는 설정이다.
- CM 웹 UI 와 Management Console 의 인증 컴포넌트가 달라 로그 위치가 갈리는 점을 짚는다.
- 장시간 배치가 토큰 만료로 끊기지 않게 계정 수준 인증 정책을 바꾸는 방법이다.
- 사용자 단위 정책은 먹는데 그룹 정책만 안 먹을 때 노드별 SSSD 조인 상태를 확인한다.
- REST API 로 넣은 정책이 UI 나 특정 노드에 반영되지 않을 때의 확인 순서다.
- 특정 클러스터를 구성했을 때의 Cloudera Manager 설정값 기록을 모은 색인이다.
- CM 자체와 관리 서비스에서 바꾼 설정 항목과 값을 표로 남겼다.
- NameNode · DataNode 의 디렉터리 · 핸들러 · 인증 관련 설정값 기록이다.
- ResourceManager · NodeManager 의 자원 할당과 스케줄러 설정값 기록이다.
- Metastore 의 데이터베이스 연결과 인증 관련 설정값 기록이다.
- HiveServer2 와 Tez 실행 엔진의 설정값 기록이다.
- impalad · statestored · catalogd 의 메모리와 인증 관련 설정값 기록이다.
- 마스터 · 태블릿 서버의 디렉터리와 자원 관련 설정값 기록이다.
- Master · RegionServer 의 설정값 기록이다.
- Base 클러스터에 포함된 Kafka 브로커의 설정값 기록이다.
- Atlas · Ranger 감사에 쓰이는 Solr 의 설정값 기록이다.
- Atlas 서버와 Kafka · Solr 연동 관련 설정값 기록이다.
- Oozie 서버의 데이터베이스와 공유 라이브러리 관련 설정값 기록이다.
- Ranger Admin · usersync 의 AD 연동과 감사 저장소 설정값 기록이다.
- Hue 의 데이터베이스 · 인증 · 연동 앱 관련 설정값 기록이다.
- 행 단위 갱신·삭제가 필요할 때 세 저장 형식의 보장 범위를 비교해 고르는 기준이다.
- HDFS Balancer · Disk Balancer · Kudu Rebalancer 의 실행 방법과 권장 파라미터다.
- WAL 기반 비동기 복제의 동작 전제와 peer 등록·검증 절차다.
- impalad 앞에 LB 를 둘 때 클라이언트마다 SPN 과 truststore 를 어떻게 주는지 정리한다.
- Kerberos 를 끄지 않고 LDAP 인증을 더하는 설정과 NLB 구성 시 주의점이다.
- 세 종류 로그가 어디에 쌓이고 각각 얼마나 남는지, 보존 주기를 어떻게 바꾸는지 다룬다.
- 사라진 데이터의 원인을 찾을 때 볼 수 있는 세 경로와 각각의 보존 기간·정확도다.
- Atlas 를 2대로 늘리면 503 이 나는 원인인 atlas_jaas.conf 와 ZooKeeper znode ACL 을 다룬다.
- 동시 처리량을 결정하는 gunicorn 항목과 504 가 날 때의 조정 기준이다.
- 다른 서비스는 붙는데 Hue 만 PostgreSQL 연결을 실패할 때의 원인과 조치다.
- AD 오류 코드 52e 가 뜰 때 bind_dn 표기 형식과 비밀번호 설정을 점검한다.
- 파일 브라우저가 HDFS 대신 Ozone 으로 넘어갈 때 HttpFS proxyuser 를 어떻게 여는지 다룬다.
- 배포 형태별 Livy 설치 방식과 Hue 의 노트북 앱에 붙이는 설정이다.
- 파셀로 설치된 CSA Flink 가 제대로 동작하는지 YARN 위에서 확인하는 최소 절차다.
- 서버를 주문하기 전에 정해야 하는 디스크 장수와 RAID 적용 범위, 마운트 지점 배치다.
- prereq_check.sh 가 지적하는 커널 파라미터를 즉시 적용하고 재부팅 뒤에도 유지되게 한다.
- istiod helm 릴리스가 타임아웃으로 실패할 때 Harbor 인증서와 base path 를 확인한다.
- CM 이 설치한 RKE2 를 어떤 스크립트로 내리고 무엇을 지운 뒤 다시 설치하는지 정리한다.
- globalmount 가 걸려 kubelet 디렉터리를 못 지울 때와 재설치 중 x509 만료가 겹칠 때의 조치다.
- CM 에서 제거가 끝나지 않을 때 호스트에서 수동으로 ECS 를 걷어내는 절차다.
- 파드가 늘수록 /var 가 잠식되는 문제를 kubelet 디렉터리 분리로 푸는 절차다.
- CM 에 등록하기 전까지 끝내야 하는 BIOS · OS · 드라이버 · 컨테이너 툴킷 다섯 계층을 체크리스트로 정리한다.
- 서빙 이미지의 CUDA 버전이 노드 드라이버보다 높아 vLLM 이 GPU 초기화에 실패할 때의 업그레이드다.
- 받다 끊긴 이미지 tarball 때문에 Harbor 에 이미지 세트가 덜 올라간 상태를 어떻게 찾아내는지 다룬다.
- vault-0 이 ContainerCreating 에서 멈출 때의 원인과 재기동 절차에서 unseal 을 넣는 위치다.
- 특정 노드의 컨트롤러 파드만 죽거나 라우팅 설정이 노드마다 어긋날 때의 점검이다.
- 로그가 Ozone 으로 나가지 못해 버퍼가 쌓일 때의 원인과 알려진 결함의 설정 교정이다.
- 여러 증상이 한꺼번에 나타난 장애에서 무엇부터 끊어 볼지 순서를 세운 기록이다.
- OpenShift 위에 Data Services 를 올릴 때의 지원 버전과 Base 클러스터·외부 레지스트리 준비다.
- Management Console 에 root CA 와 Cloudera Manager 정보를 넣어 환경을 등록하는 절차다.
- health exporter 가 콘솔 인증서를 신뢰하지 못해 초기화 컨테이너에서 재시작을 반복할 때의 조치다.
- CDE 가 다루는 세 층의 구분과 그것이 배포 구조·장애 대응에 미치는 영향이다.
- 설치가 중간 단계에서 오래 머물 때 어느 Helm 릴리스와 파드를 보는지 정리한다.
- 표면에 보이는 ConfigMap 누락이 아니라 dex_admin 데이터베이스 쪽이 원인이었던 사례다.
- 일부 메뉴만 인증서 경고가 날 때, 인증서를 두 곳에 각각 넣어야 하는 이유와 절차다.
- 게이트웨이 노드의 cde 바이너리와 REST API 만으로 접근할 때의 인증 흐름이다.
- config.yaml 을 만들어도 무시될 때 환경 변수로 경로를 지정하는 방법이다.
- PAT 발급부터 Repository 등록까지의 절차와, Credential 을 CLI 로만 만들 수 있다는 함정이다.
- PyPI 미러만 받는 python-env 의 한계와, 커스텀 런타임 이미지로 넘어가는 기준이다.
- DB 비밀번호를 DAG 와 Spark Job 이 함께 쓰면서 평문으로 남기지 않는 구성이다.
- 외부 CLI 호출에서 DAG 을 거쳐 Spark Job 까지 값이 내려가는 경로와 디렉터리·명명 규칙이다.
- DAG 코드에서 JDBC 를 직접 부를 수 없는 이유와 XCom 으로 값을 넘기는 방법이다.
- unpause 하위 명령이 없을 때 스케줄을 다시 켜는 방법과 Airflow 직접 제어의 한계다.
- Airflow UI 에서 지운 DAG 가 되살아나는 이유와 컨테이너에서 NAS 에 파일을 쓰는 방법이다.
- DEX Storage 가 어디인지 확인하고 보관 기간을 넘겨 남길 audit 테이블을 만드는 방법이다.
- 지원되지 않는 Airflow metastore 직접 조회 대신 실행 이력을 Iceberg 로 적재하는 구성이다.
- 개발을 최소화하고 제품 기능만으로 실패 알림과 로그 패턴 알림을 만드는 방법이다.
- 실패 번들에서 원인을 가려내는 법, 동시 실행을 하나로 제한하는 법, 메일 트래픽 감사다.
- Virtual cluster quota reached 가 뜰 때 물리 자원이 아니라 YuniKorn 큐 설정을 확인하는 순서다.
- 호스트에서는 kinit 이 되는데 keytab 등록만 실패할 때 KCM 기본 캐시 설정을 본다.
- 드라이버가 GSS initiate failed 로 죽을 때 Pod 안 krb5.conf 에 realm 을 넣는 방법이다.
CFM 은 Apache NiFi 와 NiFi Registry 를 Cloudera 가 검증·패키징해 배포하는 묶음이다. 파셀로 Base 클러스터에 얹는 형태와, Kubernetes Operator 로 CR 을 선언해 배포하는 형태가 있다. NiFi 제품 자체는 NiFi 에 있고 여기에는 Cloudera 배포판에서만 달라지는 것을 둔다.
- CFM 버전과 그 안에 들어 있는 NiFi 버전이 별개의 번호라는 점과 1.x · 2.x 사이의 단절이다.
- 3노드 NiFi 클러스터 기준 노드 사양과 저장소를 PVC 로 나누는 배치, 선행 조건이다.
- cert-manager 와 CRD 를 준비해 오퍼레이터를 올리고 Nifi 리소스로 클러스터를 띄우는 절차다.
- 워크스페이스 생성 시 요구하는 NFS 서버·공유 경로의 준비와 입력 형식이다.
- 워크로드 엔드포인트가 무작위로 생기므로 와일드카드 SAN 이 함께 필요한 이유와 발급 절차다.
- 사설 CA 로 인증서를 발급해 적용하는 절차와 그 과정에서 세션이 뜨지 않았던 네 가지 원인이다.
- 상태가 Installing 에서 멈출 때 s2i-builder 파드 로그로 원인을 좁히는 진단이다.
- 정적 바인딩된 외부 NFS PVC 때문에 Helm 업그레이드가 멈출 때의 조치다.
- 워크스페이스 네임스페이스의 파드 역할과, UI 에 없는 지난 작업 로그를 어디서 찾는지 정리한다.
- 내장 PostgreSQL 파드로 들어가 프로젝트·사용자·작업 이력을 조회하는 방법과 손대지 말아야 할 범위다.
- 한 사용자가 자원을 독점하지 못하게 CPU·메모리·GPU 쿼터와 replica 상한을 거는 설정이다.
- 공개 애플리케이션 허용 스위치가 실제로 무엇을 여닫는지와, 껐을 때도 남는 통제 대상이다.
- 내장 템플릿을 고칠 수 없는 이유와 팀 표준 템플릿을 따로 추가하는 방법이다.
- AMP 가 무엇이고 한 번의 조작으로 배포되는 예제 프로젝트가 어떻게 구성되는지 설명한다.
- 현행 명칭과 .project-metadata.yaml 구조, 사내 Custom AMP 를 만드는 방법이다.
- 합성 데이터 생성과 파인튜닝을 맡는 두 스튜디오가 각각 무엇을 하고 어떻게 이어지는지 설명한다.
- 설치 중 GitHub 릴리스를 직접 받으므로 완전 폐쇄망이 안 되는 점과 허용할 도메인 목록이다.
- impyla 로 CDW 에 붙을 때 필요한 kerberos·gssapi 설치와 Tool 파라미터 설계 주의점이다.
- Tool 이 별도 프로세스로 실행되는 파이썬 스크립트라는 전제와 네 부분으로 이루어진 뼈대를 다룬다.
- 프롬프트가 아니라 워크플로 구조로 위험한 요청을 걸러 내는 선검증 에이전트의 입출력 계약과 배선이다.
- Tool 과 Agent 의 역할을 가르고 환각을 막는 제약 문구를 넣어 같은 형식의 보고서를 매번 뽑는 구성이다.
- 워크벤치 안에서 끝내는 방식과 Registered Model 로 AI Inference 에 넘기는 방식을 비교한다.
- 빌드 파드가 내부 레지스트리 이름을 풀지 못하거나 CA 를 신뢰하지 못할 때의 조치다.
- 경로 문제로 오해하기 쉬운 401 이 실제로는 매니페스트 조회 인증 문제인 사례다.
- 사용자 네임스페이스의 pull 시크릿에 내장 레지스트리 자격이 빠질 때의 원인과 보정이다.
- 커스텀 런타임 이미지를 카탈로그에 넣는 절차와 Spark · Hadoop CLI 애드온을 다시 등록하는 방법이다.
- 런타임 이미지가 바뀌지 않는 문제, OS 버전 불일치, 세션 화면 미개방 등 네 가지를 다룬다.
- core-site.xml 의 fs.defaultFS 를 바꿔 외부 HDFS 를 바라보게 하는 세 가지 방법이다.
- "Kerberos 가 안 된다" 로 보이는 증상에 겹쳐 있는 세 층을 아래에서 위로 걷어낸다.
- Management Console 의 Email Mapping Attribute 설정이 SAML 오류로 이어지는 경로다.
- NAT 환경의 외부 GPU 서버를 워커로 붙이는 것이 지원되지 않는 이유와 실행 가능한 대안이다.
- ML Runtime 베이스 이미지에 필요한 패키지를 얹어 커스텀 런타임을 굽는 Dockerfile 예다.
- AMP 예제의 모델 내려받기 스크립트가 폐쇄망에서 멈출 때 파일을 미리 반입해 넣는 방법이다.
- cmlapi 로 프로젝트·작업·모델을 코드로 다루기 위한 호스트·API 키 설정이다.
- bastion 호스트에 cmlutil 을 설치하고 export → import 로 프로젝트를 옮기는 절차다.
- 실제로 export/import 를 돌리면서 만난 오류를 원인과 조치 순으로 정리했다.
- cmlutils 가 옮기지 않는 collaborator 를 API v2 로 뽑았다가 다시 넣는 방법이다.
- ca.pem 크기가 0 이어서 Knox 가 죽는 원인과 도메인 라우팅 설정을 다룬다.
- 별도 Istio gateway 로 서비스되어 각각 필요한 FQDN 인증서 발급과 CA 갱신 전파다.
- import_to_airgap.py 로 다운로드 → Ozone 업로드 → 등록 → 엔드포인트 생성까지 이어간다.
- NGC CLI 와 nimcli, NGC API 키를 써서 NVIDIA NIM 모델을 폐쇄망으로 들여오는 절차다.
- kubectl 로는 GPU 가 보이는데 GPU Node Groups 가 비어 있을 때의 taint·MIG 제약이다.
- 파드를 지우면 모델을 다시 받는 문제와 세션이 엔드포인트의 GPU 를 가져가는 문제를 다룬다.
- 레플리카 하한이 0 인지와 헬스체크 임계값이 모델 로딩 시간보다 넉넉한지를 갈라 본다.
- 대형 모델이 주기적으로 재기동되던 원인이 헬스체크 워치독이었음을 추적한 기록이다.
- GPU 를 거의 쓰지 않는데 응답이 느릴 때 ONNX 프로파일 선택과 MIG 설정을 점검한다.
- 상세 화면이 CORS·403 으로 막힐 때 Istio Ambient 모드와 Knox 인가 연동의 충돌을 본다.
- 단순 질의는 되는데 멀티턴과 tool calling 만 실패할 때 Harmony 파서 버전을 판정하는 방법이다.
- 63자 제한은 FQDN 전체가 아니라 점 사이 레이블에 걸린다는 점을 확인한다.
- 커넥션 화면에 principal 필드가 없는 이유와 배포 형태별로 쓸 수 있는 인증 방식이다.
- Knox 가 발급한 JWT 를 Bearer 로 넘길 때 JWKS 조회가 인증에 막히는 지점과 Shiro URL 규칙이다.
- Public Cloud 환경에서 쓰는 CLI 와 자격 증명, 운영 문서를 모은 색인이다.
- Python venv 에 cdpcli 패키지를 설치하고 프로파일을 설정하는 절차다.
- AWS 환경에서 FreeIPA 업그레이드와 HA 업스케일이 시작 단계에서 실패할 때의 원인이다.