제안서나 RFI 회신을 쓸 때 가장 먼저 걸리는 것이 제품명이다. Cloudera 는 2025년 들어 온프레미스 제품 이름을 정리했고, 예전 이름(CDP Private Cloud, CML 등)으로 쓰면 최신 문서와 대조가 되지 않는다.
온프레미스 구성은 두 층이다.
| 층 | 제품 | 성격 |
|---|---|---|
| 기반 | Cloudera Base on premises | 베어메탈 · VM 위의 Hadoop 계열 클러스터. HDFS · Ozone · Hive · Impala · Spark · Kafka · Ranger · Atlas |
| 서비스 | Cloudera Data Services on premises | Base 위에 얹는 컨테이너 기반 서비스. Data Engineering · Data Warehouse · Cloudera AI |
Data Services 는 OpenShift 또는 Cloudera 가 제공하는 ECS(Embedded Container Service) 위에서 돈다. 예전 이름과의 대응은 다음과 같다.
| 예전 이름 | 현재 이름 |
|---|---|
| CDP Private Cloud Base | Cloudera Base on premises |
| CDP Private Cloud Data Services | Cloudera Data Services on premises |
| CML (Cloudera Machine Learning) | Cloudera AI |
| CDE (Cloudera Data Engineering) | Cloudera Data Engineering (유지) |
| CDW (Cloudera Data Warehouse) | Cloudera Data Warehouse (유지) |
제안서에 적을 구체적인 Data Services 버전은 그때그때 릴리스 노트에서 확인한다 (확인 필요).
데이터 플랫폼 RFI 는 대체로 수집 · 오케스트레이션 · 처리 · 저장 · 거버넌스 · 인프라 · 서비스 일곱 영역으로 나뉜다. Cloudera 온프레미스 기준 대응은 다음과 같다.
| 요건 영역 | 자주 나오는 요구 | 대응 |
|---|---|---|
| 수집 | Legacy DBMS 무관 수집, 반정형 · 비정형, 실시간 · 준실시간, 원천 영향 최소화 | Cloudera DataFlow(NiFi), Cloudera Stream Processing(Kafka · Flink), CDC 커넥터 |
| 오케스트레이션 | 재처리, 실패 알림, 모니터링, 스케줄링, 데이터셋 버전 관리 · 롤백 | Cloudera Data Engineering(Airflow), Cloudera Manager 모니터링, Iceberg 스냅샷과 타임트래블 |
| 처리 | 표준화 · 품질 검증, 파싱 · 청킹, 벡터 · 그래프, 대용량 동시 처리 | Cloudera Data Engineering(Spark), Cloudera AI, Cloudera AI Inference |
| 저장 | 외부 스토리지 연결, 오픈 테이블 포맷, 메달리온 계층, 격리 저장 | Apache Ozone(S3 호환 오브젝트 스토리지), Apache Iceberg, Bronze · Silver · Gold |
| 거버넌스 | 리니지 · 카탈로그, 암호화, RBAC · ABAC, 컬럼 마스킹 | Apache Atlas, Apache Ranger, Ranger KMS · HDFS TDE |
| 인프라 | 온프레미스 스토리지 유지, 하이브리드 버스트 | Base + Data Services, SDX 공통 거버넌스 |
| 서비스 제공 | BI 연계, 셀프서비스 분석, 데이터 포털 | Cloudera Data Visualization, Cloudera Data Warehouse, 외부 BI 도구 JDBC · ODBC 연계 |
중국 등 데이터 반출 규제가 있는 지역이 범위에 들어오면 "하나의 클러스터로 전 지역" 이라고 쓸 수 없다. 현지 데이터를 현지에 두고 거버넌스만 공통으로 가져가는 구조가 된다. 선택지를 비교표로 정리해 두면 회신이 깔끔해진다.
| 방식 | 내용 | 걸리는 점 |
|---|---|---|
| 현지 별도 클러스터 | 지역마다 클러스터를 두고 메타데이터 · 정책만 공통 관리 | 운영 이중화, 비용 증가 |
| 전용망 · CSP 백홀 | 현지에서 본사로 회선을 끌어 단일 클러스터 유지 | 규제 적합성 검토 필요, 회선 비용 |
| 현지 구축 후 집계만 전송 | 원본은 현지, 비식별 집계만 반출 | 분석 범위 제한 |
온프레미스는 라이선스와 하드웨어가 분리된다. 라이선스는 노드 또는 코어 기준이고 실제 단가는 벤더 정식 견적이 필요하다. 임의의 숫자를 넣는 대신 과금 구조와 산정 로직을 제시하고 단가는 확정 견적으로 연결하는 편이 안전하다.
데이터 플랫폼과 AI 플랫폼을 같이 묻는 RFI 가 많다. 두 개를 따로 짓는 그림이 아니라, Iceberg 단일 저장소에서 파싱 · 청킹 · 임베딩을 거쳐 벡터를 만들고 그것을 AI 서비스가 쓰는 단일 라이프사이클로 설명하는 편이 설득력이 있다. 저장소가 갈리면 거버넌스도 갈린다는 점이 핵심 논지다.
RFI 회신에서 회사 연혁 · 실적 · 재무 항목은 회신 주체(총판 · 파트너 · SI)가 채우는 부분이라 제품 매핑만으로는 완성되지 않는다. 회신 주체를 먼저 확정해야 한다.