여러 데이터 소스에 SQL 로 질의하는 엔진을 모은다. 데이터를 직접 저장하지 않고 외부 스토리지나 다른 DBMS 를 대상으로 질의를 실행하는 것이 공통점이다. Hadoop 위의 SQL 은 Apache Hive 를 볼 것.
| 부류 |
특징 |
엔진 |
| 분산 질의 엔진 |
MPP 로 데이터레이크 · RDBMS 를 대화형으로 질의 |
Trino · Impala |
| 데이터 가상화 |
소스를 논리 뷰로 묶어 제공. 거버넌스 · 캐시 |
Denodo · Teiid |
- PrestoSQL 에서 이름을 바꾼 분산 SQL 엔진. 현행 483. 여러 소스를 한 번에 조인한다.
- C++ MPP 엔진. HDFS · Kudu 위에서 낮은 지연으로 질의한다. 현행 4.5.2.
- Red Hat/JBoss 의 오픈소스 데이터 가상화. 2020년 16.0.0 이 마지막 릴리스다.
- 엔진 10종의 특성 · 벤치마크 · 비용 · 선택 기준.
- 같은 Hive Metastore 를 보는 테이블인데 엔진에 따라 시각이 9시간 어긋난다. Trino 로 적재한 값을 Hive 와 Trino 에…
- 셋 다 저장소를 갖지 않고 외부 데이터를 읽어 분산 처리하는 MPP SQL 엔진 계열이다.
- Dremio 는 오브젝트 스토리지와 관계형 데이터베이스에 흩어진 데이터를 옮기지 않고 그 자리에서 SQL 로 질의하는 레이크하우스 쿼리 엔진이…
- DuckDB 는 분석 질의를 위한 인프로세스 데이터베이스다. 서버를 따로 띄우지 않고 애플리케이션 프로세스 안에서 라이브러리로 동작한다는 점에…
- Hive 와 Impala 는 같은 데이터, 같은 메타스토어를 보면서도 성격이 정반대인 엔진이다. 하나를 고르는 문제가 아니라 어느 작업을 어디…
- 분산 SQL 엔진을 고를 때 기능 비교표만 보면 왜 이 제품들이 서로 비슷한지, 왜 어떤 것은 정체돼 있는지가 보이지 않는다. 대부분은 누가…