Cloudera 는 Trino 를 독립 제품이나 별도 파셀로 내놓지 않는다. Cloudera Data Warehouse(CDW) 안의 실행 엔진 가운데 하나로 제공되며, 버전도 CDW 릴리스를 따라간다. 원본 대화에는 CDW 1.5.5 SP1 에서 기술 프리뷰, SP2 에서 정식 제공이 시작됐다는 내용이 있으나 릴리스 노트로 대조하지 못했다 — 확인 필요.
Base 클러스터에서 Trino 를 쓰려면 별도 구축이 필요하며, 이때는 Cloudera 지원 범위 밖의 구성이 된다.
포함된 Trino 의 오픈소스 버전은 CDW 릴리스마다 다르다. 정확한 버전은 해당 릴리스 노트에서 확인한다.
CDW 안에서 엔진은 용도가 갈린다.
| 엔진 | 주 용도 |
|---|---|
| Impala | 내부 데이터 웨어하우스에 대한 저지연 질의 |
| Hive | 대규모 배치 처리 |
| Trino | 여러 데이터 소스를 가로지르는 연합 질의 |
Trino 의 자리는 Impala 를 대체하는 것이 아니라, 웨어하우스 바깥의 소스까지 묶어 조회하는 쪽이다. Ranger 와 연동해 접근 제어를 공통으로 적용한다.
오픈소스 Trino 에는 Kudu 커넥터가 있다. 다만 Cloudera CDW 에서 그 커넥터가 제공·지원되는지는 별개 문제이며, 릴리스별 지원 커넥터 목록을 확인해야 한다 — 확인 필요. Cloudera 의 구성에서는 Kudu 를 Impala 로 다루고 Trino 는 Iceberg · Hive · 외부 데이터베이스를 향하도록 역할을 나누는 것이 기본 설계다.
Trino 에서 Kudu 데이터가 필요할 때 실무에서 쓰는 방법은 다음과 같다.
| 방법 | 평가 |
|---|---|
| Trino 의 Kudu 커넥터 | CDW 지원 여부 확인이 먼저다 |
| Trino → JDBC → Impala → Kudu | 조회는 되지만 조건 푸시다운이 제한되어 느리다 |
| Kudu 데이터를 Iceberg 로 옮기고 Trino 가 직접 읽기 | 성능이 가장 낫다. 데이터가 이중화된다 |
정리하면 실시간 갱신이 필요한 데이터는 Kudu 에 두고 Impala 로 다루며, 연합 질의 대상은 Iceberg 로 내보내 Trino 가 읽게 하는 구성이 Cloudera 환경의 표준 형태에 가깝다.