Cloudera(온프렘 CDP, Hive/Iceberg 테이블을 HDFS·Ozone 에 저장, AD + Ranger 권한 체계) 와 Databricks 를 Iceberg REST Catalog 로 연결해 데이터 페더레이션을 하려 할 때, 어느 방향이 성립하고 어느 방향이 성립하지 않는지 정리한다.
Cloudera 데이터를 Databricks 에서 읽기. Cloudera Iceberg REST Catalog 는 Apache Iceberg REST Catalog Open API 의 서버 측 구현으로 HMS 와 같은 JVM 안에 내장 서비스로 동작하며, Knox 토큰 기반 OAuth 인증과 Ranger 정책으로 접근을 통제한다. Databricks 쪽 접속은 두 갈래다. 클러스터 Spark 설정에 Cloudera REST 엔드포인트를 Iceberg REST 카탈로그로 등록하는 방식(Unity Catalog 거버넌스를 우회하고 서버리스 컴퓨트 제약이 있다), 또는 Unity Catalog 의 Lakehouse Federation 으로 CDP 의 HMS 를 foreign catalog 로 등록하는 방식(foreign Iceberg 테이블은 읽기 전용) 이다.
Databricks 데이터를 Cloudera 에서 읽기/쓰기. Unity Catalog 의 모든 Iceberg 테이블은 Iceberg REST Catalog API(/api/2.1/unity-catalog/iceberg-rest) 로 접근할 수 있고, 외부 엔진의 읽기·쓰기를 모두 지원하며, credential vending 으로 스토리지 접근용 임시 자격증명을 발급한다. Cloudera 의 Spark 에 이 엔드포인트를 카탈로그로 등록하면 되고, Delta 테이블은 UniForm 을 켜면 같은 경로로 읽을 수 있다.
두 방향 모두 "메타데이터는 REST, 데이터 파일은 스토리지 직접 접근" 구조다. 따라서 양쪽 컴퓨트가 같은 오브젝트 스토리지에 네트워크·자격증명 측면에서 도달할 수 있어야 한다.
Cloudera → Databricks 방향은 현재 온프렘 구성에서 성립하지 않는다. Cloudera Iceberg REST Catalog 를 통한 외부 데이터 공유는 기술 프리뷰(entitlement 필요) 이며 Cloudera on cloud 의 AWS S3 스토리지에서만 지원된다. Databricks 는 클라우드 SaaS 라 온프렘 hdfs:// 를 읽을 수 없고 Unity Catalog 의 external location 은 클라우드 오브젝트 스토리지 버킷과 IAM 자격증명을 전제로 한다. Ozone S3 Gateway 로 S3 프로토콜 접근은 이론상 가능하나 온프렘 S3 호환 엔드포인트는 Databricks 공식 지원 범위가 아니다.
Databricks → Cloudera 방향은 지금 구성에서도 된다. 온프렘 Spark 가 아웃바운드로 Unity Catalog 의 REST 엔드포인트를 호출하고 credential vending 으로 받은 임시 자격증명으로 클라우드 오브젝트 스토리지를 직접 읽으므로, 온프렘 → 클라우드 아웃바운드만 열려 있으면 AD/Kerberos 와 무관하게 Databricks 서비스 프린시펄 OAuth 로 인증하면 된다.