대상 엔진: Trino · PrestoDB (Presto) · Apache Hive · Apache Impala · Teiid · Denodo · Amazon Athena · Apache Spark SQL · Apache Drill · Dremio
작성 기준: 2026년 3월 작성. 버전 정보는 2026-09-20 에 갱신
참고 출처: 공식 문서, Wikipedia, 학술 논문, 업계 분석 자료
SQL 쿼리 엔진은 대규모 분산 데이터에 대해 표준 SQL을 사용하여 분석 쿼리를 실행하는 소프트웨어 레이어다. 전통적인 RDBMS와 달리 데이터를 저장하지 않고 외부 스토리지(HDFS, S3, RDB 등)를 대상으로 쿼리를 실행하는 것이 핵심 특징이다. OLAP 워크로드를 처리하며, 현대 데이터 레이크·데이터 레이크하우스 아키텍처의 핵심 컴포넌트로 자리 잡았다.
| 분류 | 설명 | 해당 엔진 |
|---|---|---|
| MPP 인-메모리 쿼리 엔진 | 분산 병렬 처리, 인-메모리 실행, 저지연 대화형 쿼리 | Trino, PrestoDB, Impala, Drill |
| 배치 처리 / DAG 기반 | 내결함성 우선, 디스크 스필(spill) 지원, ETL 적합 | Hive, Spark SQL |
| 데이터 가상화 플랫폼 | 물리 데이터 이동 없이 논리 레이어로 연합 쿼리 | Denodo, Teiid |
| 서버리스 관리형 서비스 | 인프라 관리 불필요, 클라우드 네이티브 | Amazon Athena |
| 데이터 레이크 가속 엔진 | Apache Arrow 기반, Reflection(구체화 뷰) 자동화 | Dremio |
Facebook (2008)
└─ Apache Hive (SQL on Hadoop/MapReduce)
└─ 성능 한계 → Presto 개발 착수
Facebook (2012)
└─ PrestoDB / Presto (고속 MPP 쿼리)
├─ 2018: 창시자 이탈 (거버넌스 분쟁)
│ └─ 2019: PrestoSQL fork (Presto Software Foundation)
│ └─ 2020: → Trino (리브랜딩)
└─ PrestoDB: Linux Foundation 기증 (Meta 주도 유지)
Cloudera (2011)
└─ Apache Impala (C++ MPP, Hadoop 직접 접근)
MetaMatrix → Red Hat 인수 (2007)
└─ Teiid (JBoss 오픈소스, 데이터 가상화)
University of A Coruña, Spain (1999)
└─ Denodo (상용 데이터 가상화 플랫폼)
AWS (2016)
└─ Amazon Athena (Presto/Trino 기반 서버리스)
UC Berkeley AMPLab (2010)
└─ Apache Spark → Spark SQL (범용 분산 컴퓨팅)
MapR / Apache (2012)
└─ Apache Drill (Google Dremel 영감, 스키마-프리)
Dremio Corp. (2015)
└─ Dremio (Apache Arrow 기반, 데이터 레이크 엔진)
| 항목 | 내용 |
|---|---|
| 공식 사이트 | https://trino.io |
| 기원 | Facebook → PrestoSQL (2019) → Trino (2020) |
| 창시자 | Martin Traverso, Dain Sundstrom, David Phillips |
| 거버넌스 | Trino Software Foundation (비영리) |
| 라이선스 | Apache License 2.0 |
| 구현 언어 | Java |
| 최신 버전 | 483 (2026-07-17). 정수 번호 단일 트랙, 월 1~2회 릴리스 |
| 상용 배포 | Starburst Enterprise / Starburst Galaxy, Amazon EMR, Cloudera |
Trino는 MPP(Massively Parallel Processing) 분산 아키텍처를 채택한다. 클러스터는 하나의 Coordinator 노드와 다수의 Worker 노드로 구성된다.
Client → Coordinator (파싱 · 계획 · 스케줄링)
└─ Worker 1 (태스크 실행, 데이터 처리)
└─ Worker 2
└─ Worker N
데이터소스: HDFS · S3 · GCS · ADLS · MySQL · PostgreSQL · Kafka · MongoDB ...
커넥터: Hive · Iceberg · Delta Lake · Hudi · TPC-H · JMX ...
Netflix, Lyft, Stripe, Salesforce, LinkedIn, Bloomberg, Airbnb, Meta
| 항목 | 내용 |
|---|---|
| 공식 사이트 | https://prestodb.io |
| 기원 | Facebook 내부 프로젝트 (2012) |
| 창시자 | Martin Traverso, Dain Sundstrom, David Phillips, Eric Hwang |
| 거버넌스 | Linux Foundation (Presto Foundation, 2019) |
| 라이선스 | Apache License 2.0 |
| 구현 언어 | Java |
| 상용 배포 | (구) Ahana → IBM 인수(2023), Meta 내부 사용 |
Trino와 동일한 MPP 기반 아키텍처 (6년간 공동 개발 역사 공유). 이후 차별화 방향:
| 구분 | Trino | PrestoDB |
|---|---|---|
| 주도 기관 | Trino Software Foundation | Presto Foundation (Linux Foundation) |
| 개발 주체 | Starburst, AWS 등 다수 기업 | Meta(Facebook) 주도 |
| 개발 속도 | 빠름 (연간 30+ 릴리즈) | 느림 |
| 배포 방식 | Kubernetes/Docker 친화 | 전통적 클러스터 |
| ETL 지원 | 결함 허용 실행 모드 | Presto-on-Spark |
| C++ 통합 | 일부 | Velox 엔진 통합 |
| 항목 | 내용 |
|---|---|
| 공식 사이트 | https://hive.apache.org |
| 기원 | Facebook (2008) → Apache Software Foundation (2010) |
| 창시자 | Facebook Data Infrastructure Team |
| 거버넌스 | Apache Software Foundation (ASF) |
| 라이선스 | Apache License 2.0 |
| 구현 언어 | Java |
| 최신 버전 | Apache Hive 4.2.1 (2026년 기준, JDK 21 지원). 3.x 는 2024-10 EOL |
Facebook이 급격한 데이터 증가(2006년 수십 GB/일 → 수 TB/일)에 대응하기 위해 Hadoop 위에 SQL 인터페이스를 구축한 것이 기원. SQL 전문가들이 Java MapReduce 없이 대용량 데이터를 쿼리할 수 있도록 설계되었다.
UI (CLI, HiveServer2, Beeline)
│
Driver (컴파일러 · 옵티마이저 · 실행기)
│
Metastore (메타데이터 저장소: Derby/MySQL/PostgreSQL)
│
실행 엔진: MapReduce | Apache Tez | Apache Spark
│
HDFS / Amazon S3 / ADLS / GCS
핵심 컴포넌트:
Netflix, Amazon, Yahoo, IBM, FINRA, Facebook (초기)
| 항목 | 내용 |
|---|---|
| 공식 사이트 | https://impala.apache.org |
| 기원 | Cloudera 내부 (2011) → 공개 베타 (2012년 10월) |
| 창시자 | Cloudera 엔지니어링 팀 |
| 거버넌스 | Apache Software Foundation (TLP, 2017년 11월) |
| 라이선스 | Apache License 2.0 |
| 구현 언어 | C++ (코어), Java (일부) |
| 영감 | Google F1 데이터베이스 |
| 최신 버전 | 4.5.2 (2026-09-14) |
MapReduce를 우회하여 데이터 노드에서 직접 쿼리를 실행하는 데몬 기반 분산 아키텍처:
Client (JDBC/ODBC/Hue)
│
Impalad (각 데이터 노드에 설치된 Impala 데몬)
├─ 쿼리 접수 · 실행 조정 · 데이터 스캔
├─ 분산 실행 및 조인
└─ 결과 반환
Impala State Store → 각 Impalad 건강 상태 모니터링
Impala Catalog Service → 메타데이터 변경 전파 (Hive Metastore 공유)
핵심 특징:
Cloudera CDP 사용 기업, 금융·통신·유통 대기업
| 항목 | 내용 |
|---|---|
| 공식 사이트 | https://teiid.io |
| 기원 | MetaMatrix (2007 Red Hat 인수) → JBoss 오픈소스 출시 (2010) |
| 거버넌스 | Red Hat / JBoss 커뮤니티 |
| 라이선스 | Apache License 2.0 |
| 구현 언어 | Java |
| 최신 버전 | 16.0.0 (2020-12-28) — 마지막 릴리스. 저장소 마지막 커밋 2023-01 |
| 현재 상태 | 사실상 개발 중단 |
2007년 Red Hat이 MetaMatrix를 인수하면서 데이터 가상화 기술을 JBoss 생태계로 편입. 2010년 Teiid라는 이름으로 오픈소스 공개. Red Hat JBoss Data Virtualization Platform의 핵심 쿼리 엔진으로 사용되었다. 현재는 Red Hat OpenShift 환경의 데이터 가상화 솔루션으로 포지셔닝 중이나 커뮤니티 활동은 감소 추세.
클라이언트 (Java/JDBC/ODBC/웹서비스)
│
Teiid Query Engine (VDB 가상 데이터베이스)
├─ SQL 파서 · 옵티마이저
├─ 연합 쿼리 실행기 (Federation Engine)
└─ 커넥터 (Translators)
├─ RDBMS (Oracle, PostgreSQL, MySQL...)
├─ NoSQL (MongoDB, Cassandra...)
├─ 파일 (CSV, Excel...)
├─ 웹서비스 (REST, SOAP)
└─ 빅데이터 (Hadoop, Hive...)
VDB(Virtual DataBase): Teiid의 핵심 개념. 물리 데이터소스들을 하나의 가상 데이터베이스로 매핑한 설정 단위.
| 항목 | 내용 |
|---|---|
| 공식 사이트 | https://www.denodo.com |
| 기원 | 스페인 코루냐 대학교(University of A Coruña) 연구 프로젝트 (1999) |
| 창시자 | Ángel Viña (교수, CEO) |
| 본사 | Palo Alto, California, USA |
| 최신 버전 | Denodo Platform 9.5 (2026-09 문서 기준) |
| 라이선스 | 상용 (Commercial) · 무료 Denodo Express 는 60일 Developer Tier 로 대체 |
| 투자 규모 | $336M (TPG, HGGC 투자, 2023) |
| 매출 (2024) | $288.5M |
| 직원 수 | 약 764명 (2026년 기준) |
1999년 스페인 코루냐 대학교 연구 프로젝트로 시작, Ángel Viña 교수가 창업. 데이터 가상화(Data Virtualization)를 전문으로 하는 상용 엔터프라이즈 플랫폼. Gartner Magic Quadrant 데이터 통합 도구 부문 6년 연속 리더 선정 (2025년 기준). IDC MarketScape 리더 선정.
소비자 애플리케이션 (BI 도구 · SQL · REST API · GraphQL · OData)
│
Denodo Platform (논리 데이터 레이어)
├─ VQL(Virtual Query Language) 엔진
├─ 멀티소스 쿼리 옵티마이저 (Dynamic Query Optimizer)
├─ 캐싱 레이어 (선택적 물질화)
├─ 유니버설 시멘틱 레이어 (Universal Semantic Layer)
├─ 데이터 카탈로그
└─ 보안·거버넌스 레이어 (LDAP, AD, RBAC, 감사 로그)
│
소스 커넥터 (400개 이상)
├─ RDBMS (Oracle, SQL Server, PostgreSQL...)
├─ 클라우드 DW (Snowflake, Redshift, BigQuery...)
├─ 빅데이터 (Hive, Spark, Iceberg...)
├─ SaaS (Salesforce, SAP, ServiceNow...)
└─ 비정형 (Elasticsearch, MongoDB, REST API...)
핵심 특징:
| 항목 | 내용 |
|---|---|
| 공식 사이트 | https://aws.amazon.com/athena |
| 기원 | Amazon Web Services (2016년 11월 출시) |
| 기반 엔진 | Presto (엔진 v1·v2) → Trino 기반 (엔진 v3, 현행) + Apache Spark |
| 라이선스 | 상용 (Pay-per-query / Capacity 기반) |
| 과금 모델 | 스캔 데이터 TB당 $5 (기본) / 용량 예약 가능 |
2016년 AWS가 Presto 오픈소스를 기반으로 완전 관리형 서버리스 쿼리 서비스로 출시. 공식 문서에 따르면 현재 Trino와 Presto 모두를 기반으로 한다. S3 데이터에 대한 표준 SQL 분석을 서버 설정 없이 제공하는 것이 핵심 가치.
사용자 (SQL 콘솔 / API / JDBC / ODBC / SDK)
│
Athena 서비스 레이어 (완전 관리형, 서버리스)
├─ 쿼리 실행: Presto/Trino 기반 분산 실행
├─ 메타데이터: AWS Glue Data Catalog (Hive Metastore 호환)
├─ 결과 저장: Amazon S3 (지정 버킷)
└─ 연합 커넥터: AWS Lambda 기반 30개 이상 커넥터
(Redshift, DynamoDB, BigQuery, Snowflake, SAP HANA...)
스토리지: Amazon S3 (CSV, JSON, Parquet, ORC, Avro)
서버리스 특성:
| 모델 | 과금 기준 |
|---|---|
| Per-query (기본) | 스캔 데이터 TB당 $5.00 |
| Capacity Reservation | 시간당 DPU (Data Processing Unit) 요금 |
| Spark 워크로드 | 처리 시간당 DPU 요금 |
| 항목 | 내용 |
|---|---|
| 공식 사이트 | https://spark.apache.org |
| 기원 | UC Berkeley AMPLab (2010) → Apache (2013) |
| 창시자 | Matei Zaharia 외 AMPLab 연구진 |
| 거버넌스 | Apache Software Foundation |
| 라이선스 | Apache License 2.0 |
| 구현 언어 | Scala (주), Java, Python (PySpark) 지원 |
Spark SQL은 Apache Spark의 SQL 모듈로, Catalyst 옵티마이저와 Tungsten 실행 엔진을 핵심으로 한다.
SQL / DataFrame / Dataset API
│
Catalyst 옵티마이저 (AST → 논리적 계획 → 물리적 계획 → 최적화)
│
Tungsten 실행 엔진 (코드 생성, 메모리 관리 최적화)
│
DAG 스케줄러 (Job → Stage → Task)
│
실행 엔진: YARN / Kubernetes / Standalone / Mesos
│
스토리지: HDFS · S3 · GCS · ADLS · HBase · Cassandra · Kafka
핵심 특징:
Databricks(주요 후원), Netflix, Uber, Airbnb, LinkedIn, Apple
| 항목 | 내용 |
|---|---|
| 공식 사이트 | https://drill.apache.org |
| 기원 | MapR Technologies (2012) → Apache (2015 TLP) |
| 영감 | Google Dremel 논문 (2010) |
| 거버넌스 | Apache Software Foundation |
| 라이선스 | Apache License 2.0 |
| 구현 언어 | Java |
| 현재 상태 | 유지보수 모드 (MapR의 HPE 인수 후 활동 감소) |
| 항목 | 내용 |
|---|---|
| 공식 사이트 | https://www.dremio.com |
| 기원 | Dremio Corporation (2015) |
| 창시자 | Tomer Shiran, Jacques Nadeau, Billy Bosworth |
| 거버넌스 | Dremio Corp (상용) + Apache Arrow (오픈소스 기여) |
| 라이선스 | Apache 2.0 (OSS) + 상용 엔터프라이즈 |
| 구현 언어 | Java, C++ |
클라이언트 (SQL / BI 도구 / API)
│
Dremio Query Engine
├─ Apache Arrow Flight SQL (고속 데이터 전송)
├─ 비용 기반 옵티마이저
├─ Reflections (구체화 뷰 자동화 — 쿼리 가속)
├─ 컬럼형 인-메모리 캐시 (Apache Arrow 포맷)
└─ 멀티엔진 (Auto-Scaling, 워크로드 분리)
│
데이터소스 커넥터
├─ 데이터 레이크 (S3, ADLS, GCS + Iceberg/Delta/Parquet)
├─ RDBMS (PostgreSQL, MySQL, Oracle...)
└─ 데이터 웨어하우스 (Snowflake, Redshift...)
핵심 차별화 — Reflections:
쿼리 패턴을 분석하여 자동으로 구체화 뷰(materialized view)를 생성하고 관리. 원본 쿼리를 수정 없이 자동으로 Reflection으로 라우팅하여 쿼리 속도 향상.
| 엔진 | 유형 | 기원 | 라이선스 | 언어 | 쿼리 모델 | ANSI SQL |
|---|---|---|---|---|---|---|
| Trino | MPP 쿼리 엔진 | Facebook (2012/2019) | Apache 2.0 | Java | 대화형·연합 | ✅ 완전 |
| PrestoDB | MPP 쿼리 엔진 | Facebook (2012) | Apache 2.0 | Java | 대화형·연합 | ✅ 완전 |
| Apache Hive | 데이터 웨어하우스 | Facebook (2008) | Apache 2.0 | Java | 배치 | ⚠️ HiveQL |
| Apache Impala | MPP 쿼리 엔진 | Cloudera (2011) | Apache 2.0 | C++/Java | 대화형 | ⚠️ 부분 |
| Teiid | 데이터 가상화 | Red Hat (2010) | Apache 2.0 | Java | 연합·가상화 | ✅ 완전 |
| Denodo | 데이터 가상화 플랫폼 | Spain Univ. (1999) | 상용 | Java | 연합·가상화 | ✅ 완전 |
| Amazon Athena | 서버리스 쿼리 서비스 | AWS (2016) | 상용 | (Trino/Presto 기반) | 서버리스 ad-hoc | ✅ ANSI |
| Spark SQL | 범용 분산 컴퓨팅 | UC Berkeley (2010) | Apache 2.0 | Scala/Java | 배치·스트리밍·ML | ✅ 완전 |
| Apache Drill | MPP 쿼리 엔진 | MapR (2012) | Apache 2.0 | Java | 스키마-프리 | ✅ 완전 |
| Dremio | 데이터 레이크 엔진 | Dremio Corp (2015) | Apache 2.0 + 상용 | Java/C++ | 대화형·레이크 | ✅ 완전 |
| 엔진 | 처리 방식 | 내결함성 | 스토리지 | 메타데이터 | 컴퓨트-스토리지 분리 |
|---|---|---|---|---|---|
| Trino | MPP 인-메모리 | △ (FTE 모드) | 외부 (S3, HDFS...) | Hive Metastore / Iceberg | ✅ |
| PrestoDB | MPP 인-메모리 | △ (Presto-on-Spark) | 외부 | Hive Metastore | ✅ |
| Hive | MapReduce/Tez/Spark | ✅ 완전 | HDFS / 오브젝트 스토리지 | HMS (자체) | ✅ |
| Impala | MPP (데몬 기반) | △ (디스크 스필) | HDFS / S3 / HBase | HMS (공유) | ⚠️ Hadoop 의존 |
| Teiid | 연합 쿼리 위임 | △ | 없음 (데이터 소스 위임) | VDB 정의 파일 | ✅ |
| Denodo | 연합 + MPP + 캐시 | ✅ (HA 구성) | 없음 (소스 위임) | 내부 카탈로그 | ✅ |
| Athena | 서버리스 MPP | ✅ (AWS 관리) | S3 | AWS Glue | ✅ |
| Spark SQL | DAG 분산 (디스크 스필) | ✅ 완전 | HDFS / S3 / 다수 | Hive Metastore / Iceberg | ✅ |
| Drill | MPP (Drillbit) | △ | HDFS / S3 / MongoDB | 스키마-프리 | ✅ |
| Dremio | Arrow 벡터화 MPP | △ | S3 / ADLS / GCS | 내부 + Iceberg | ✅ |
| 엔진 | 연합 쿼리 | Iceberg 지원 | 스트리밍 | 트랜잭션 | DML | UDF |
|---|---|---|---|---|---|---|
| Trino | ✅ | ✅ 네이티브 | ❌ | ❌ | ⚠️ 제한적 | ✅ |
| PrestoDB | ✅ | ✅ | ❌ | ❌ | ⚠️ | ✅ |
| Hive | ⚠️ | ✅ v4+ | ❌ | ✅ ACID v3+ | ✅ | ✅ |
| Impala | ⚠️ | ✅ | ❌ | ❌ | ❌ (행 레벨) | ✅ |
| Teiid | ✅ | ❌ | ❌ | ⚠️ | ⚠️ | ✅ |
| Denodo | ✅ | ⚠️ 제한적 | ⚠️ | ❌ | ❌ | ✅ |
| Athena | ✅ (30+) | ✅ | ❌ | ❌ | ❌ (기본) | ✅ |
| Spark SQL | ✅ | ✅ | ✅ | ✅ (Delta) | ✅ 완전 | ✅ |
| Drill | ✅ | ❌ | ❌ | ❌ | ❌ | ✅ |
| Dremio | ✅ | ✅ 네이티브 | ❌ | ❌ | ⚠️ | ✅ |
주의: 벤치마크 결과는 클러스터 사이즈, 데이터 특성, 워크로드 유형에 따라 크게 달라진다. 아래 수치는 공개된 연구 및 벤치마크 자료를 종합한 상대적 참고치다.
MR3 연구소의 2025년 공개 벤치마크 기준:
| 엔진 | TPC-DS 전체 실행 시간 | Trino 대비 | 비고 |
|---|---|---|---|
| Trino 468 | 4,442초 | 1.0× (기준) | MPP 인-메모리, 최고 속도 |
| Hive on MR3 2.0 | 4,874초 | ~1.1× | Trino와 근접, 내결함성 완전 지원 |
| Hive on Tez | 12,707초 | ~2.9× | 전통적 MapReduce 기반 |
| Apache Spark 4.0 | 15,678초 | ~3.5× | 내결함성 우수, 배치에 강점 |
정확성 주의: Trino는 TPC-DS query 23에서 잘못된 결과를 반환하는 것이 확인되었다 (MR3 연구소, 2025). 성능이 빠르더라도 결과 정확성 검증이 필요하다.
| 워크로드 유형 | Trino 우위 | 비고 |
|---|---|---|
| 대화형 ad-hoc 쿼리 | 2~30배 빠름 | 인-메모리 MPP vs DAG 배치 |
| 소규모 집계 쿼리 | 5~10배 | Trino 압도 |
| 대형 셔플·조인 | 비슷~Spark 우위 | 메모리 압력 시 Trino OOM |
| 장기 ETL 배치 | Spark 우위 | 내결함성 필수 워크로드 |
| 스트리밍 | Spark 전용 | Trino 미지원 |
| 엔진 | p50 지연 시간 (일반 쿼리) | 특성 |
|---|---|---|
| Trino/Presto | 1~10초 | 인-메모리, 일관된 저지연 |
| Impala | 0.1~5초 | C++ 최적화, Hadoop 생태계 최저 지연 |
| Athena | 2~30초 | 콜드 스타트, 서버리스 오버헤드 |
| Dremio (Reflection 적중) | 0.1~3초 | 사전 계산된 Reflection 활용 |
| Spark SQL | 10~120초 | DAG 준비 오버헤드 |
| Hive on Tez | 30~300초 | Tez DAG 시작 시간 |
| Hive on MapReduce | 60~600초 | 레거시, 가장 느림 |
| Denodo (캐시 미스) | 소스 응답 시간에 종속 | 원격 소스 쿼리 위임 |
| 워크로드 | 최우선 추천 | 2순위 | 비고 |
|---|---|---|---|
| 대화형 ad-hoc 분석 | Trino | Impala, Dremio | 인-메모리 MPP |
| 대규모 배치 ETL | Spark SQL | Hive (Tez) | 내결함성 필수 |
| 데이터 가상화·연합 | Denodo | Teiid | 다소스 통합 |
| AWS 서버리스 분석 | Amazon Athena | - | AWS 전용 |
| Hadoop 생태계 SQL | Hive | Impala | 성숙도·호환성 |
| ML·스트리밍 통합 | Spark SQL | - | 통합 플랫폼 |
| 저비용 오픈소스 연합 | Trino | PrestoDB | Apache 라이선스 |
| 실시간 BI 가속 | Dremio | Impala | Reflection 활용 |
| 엔진 | 라이선스 유형 | 무료 사용 | 상용 지원 옵션 |
|---|---|---|---|
| Trino | 오픈소스 (Apache 2.0) | ✅ 완전 무료 | Starburst Enterprise/Galaxy |
| PrestoDB | 오픈소스 (Apache 2.0) | ✅ 완전 무료 | IBM (구 Ahana) |
| Apache Hive | 오픈소스 (Apache 2.0) | ✅ 완전 무료 | Cloudera CDP |
| Apache Impala | 오픈소스 (Apache 2.0) | ✅ 완전 무료 | Cloudera CDP |
| Teiid | 오픈소스 (Apache 2.0) | ✅ 완전 무료 | Red Hat (제한적) |
| Denodo | 상용 (Commercial) | ⚠️ Express 버전 (제한) | Denodo 직접 |
| Amazon Athena | 상용 (Pay-as-you-go) | ❌ (과금 발생) | AWS Support |
| Spark SQL | 오픈소스 (Apache 2.0) | ✅ 완전 무료 | Databricks, AWS EMR |
| Apache Drill | 오픈소스 (Apache 2.0) | ✅ 완전 무료 | 제한적 |
| Dremio | OSS + 상용 혼합 | ✅ Community Edition | Dremio Enterprise |
| 솔루션 | 비용 구조 | 참고 수준 |
|---|---|---|
| Starburst Galaxy (Trino) | 시간당 컴퓨팅 단위 기반 | 중~고 |
| Starburst Enterprise | 노드 기반 연간 라이선스 | 고 |
| Denodo Platform | 연간 라이선스 (코어 기반) | 매우 고 (중소기업 부담) |
| Denodo Express | 무료 (제한된 기능) | 무료 |
| Amazon Athena | TB당 $5 스캔 비용 | 사용량 비례 |
| Cloudera CDP (Hive/Impala) | 노드 기반 연간 구독 | 고 |
| Databricks (Spark SQL) | DBU(Databricks Unit) 시간당 | 중~고 |
| Dremio Enterprise | 노드·사용자 기반 | 중~고 |
| 요소 | Trino (자체 운영) | Athena (AWS) | Denodo |
|---|---|---|---|
| 초기 라이선스 | $0 | $0 | 수십만 $ |
| 인프라 | 직접 구축·관리 | AWS 자동 관리 | 직접 or Agora |
| 운영 인력 | 2~5명 엔지니어 | 거의 불필요 | 전문 운영 필요 |
| 스케일 비용 | 노드 추가 | 자동 (비용 증가) | 라이선스 협상 |
| 최적화 | 수동 튜닝 필요 | 자동 | 전문가 필요 |
데이터 통합이 주 목적인가?
└─ YES → 데이터를 이동하지 않고 가상화?
└─ YES, 엔터프라이즈 요구 → Denodo
└─ YES, 오픈소스 선호 → Teiid (단, 소규모/레거시)
└─ NO (ETL 이동 필요) → 다음 단계
특정 클라우드 잠금 허용?
└─ AWS 전용 OK + 서버리스 원함 → Amazon Athena
└─ 멀티클라우드 or 온프레미스 → 다음 단계
워크로드 유형은?
└─ 대화형 ad-hoc 분석 (빠른 응답) → Trino > Impala > Dremio
└─ 대규모 배치 ETL → Spark SQL > Hive
└─ 스트리밍 + 배치 통합 → Spark SQL
└─ ML + SQL 통합 → Spark SQL (Databricks)
└─ 데이터 레이크 BI 가속 → Dremio
Hadoop 의존성?
└─ YES, 기존 Hadoop 클러스터 → Hive or Impala
└─ NO, 클라우드 네이티브 → Trino > Dremio
추천: Trino
추천: Amazon Athena
추천: Denodo
추천: Hive + Impala (혼합 사용)
추천: Spark SQL (Databricks)
추천: Dremio
추천: Teiid → Trino (마이그레이션 고려)
| 포지션 | 엔진 | 근거 |
|---|---|---|
| 오픈소스 쿼리 엔진 1위 | Trino | 가장 빠른 개발 속도, 최대 커뮤니티 |
| Hadoop SQL 표준 | Apache Hive | 18년 성숙도, HMS 생태계 표준 |
| 데이터 가상화 상용 리더 | Denodo | Gartner MQ 리더 6년 연속 |
| AWS 서버리스 표준 | Amazon Athena | AWS 생태계 de-facto |
| 배치·ML 통합 표준 | Apache Spark SQL | Databricks 주도, 최대 생태계 |
| 유지보수 모드 OSS DV | Teiid | 활동 감소, 신규 투자 제한 |
| 오픈소스 | 상용 배포판 | 운영 주체 |
|---|---|---|
| Trino | Starburst Galaxy / Enterprise | Starburst |
| Trino | Amazon EMR, Amazon Athena | AWS |
| Trino | Cloudera Data Platform | Cloudera |
| PrestoDB | IBM Ahana (인수) | IBM |
| Hive | Cloudera CDP, HDInsight | Cloudera, Microsoft |
| Impala | Cloudera Data Platform | Cloudera |
| Spark SQL | Databricks, AWS EMR, Azure HDInsight | Databricks, AWS, Microsoft |
| 엔진 | GitHub Stars (참고) | 릴리즈 빈도 | 커뮤니티 활동 |
|---|---|---|---|
| Trino | ~11K+ | 월 1~2회 | 매우 활발 |
| PrestoDB | ~15K+ | 분기 2~3회 | 보통 |
| Hive | ~5K+ | 분기 1~2회 | 활발 (성숙) |
| Spark | ~40K+ | 분기 1회 | 매우 활발 |
| Impala | ~1K | 분기 1~2회 | 보통 |
| Drill | ~2K | 연 1~2회 | 낮음 |
| Teiid | ~400 | 불규칙 | 낮음 |
Thusoo, A. et al. (2009). "Hive: A Warehousing Solution over a Map-Reduce Framework." Proceedings of the VLDB Endowment (PVLDB), Vol. 2, No. 2, pp. 1626–1629. DOI: 10.14778/1687553.1687609
Bittorf, M. et al. (2015). "Impala: A Modern, Open-Source SQL Engine for Hadoop." Proceedings of the 7th Biennial Conference on Innovative Data Systems Research (CIDR).
Melnik, S. et al. (2010). "Dremel: Interactive Analysis of Web-Scale Datasets." Proceedings of the 36th International Conference on Very Large Data Bases (VLDB), pp. 330–339.
Zaharia, M. et al. (2012). "Resilient Distributed Datasets: A Fault-Tolerant Abstraction for In-Memory Cluster Computing." 9th USENIX Symposium on Networked Systems Design and Implementation (NSDI '12), pp. 15–28.
Armbrust, M. et al. (2015). "Spark SQL: Relational Data Processing in Spark." Proceedings of the 2015 ACM SIGMOD International Conference on Management of Data, pp. 1383–1394. DOI: 10.1145/2723372.2742797
Zukowski, M., Fuller, M., Traverso, M., Philippi, D. (2019). "Query Processing in the Age of Data Lakes." Proceedings of the VLDB Endowment (PVLDB), Vol. 12. DOI: 10.14778/3352063.3352079
MR3 Research Group (2025). "TPC-DS Benchmark: Trino 468, Spark 4.0.0, and Hive 4 on MR3 2.0." datamonad.com. (2025년 4월)
Starburst (2024). "Comparing Foundational Features of Trino, Hive & Spark."
Onehouse (2024). "ClickHouse vs StarRocks vs Presto vs Trino vs Apache Spark: Comparing Analytics Engines."
| 약어 | 영문 전체 | 한국어 설명 |
|---|---|---|
| ACID | Atomicity, Consistency, Isolation, Durability | 데이터베이스 트랜잭션의 4가지 특성 |
| ADLS | Azure Data Lake Storage | Microsoft Azure 데이터 레이크 스토리지 |
| AMPLab | Algorithms, Machines, and People Lab | UC Berkeley 연구소 (Spark 탄생지) |
| ANSI SQL | American National Standards Institute SQL | SQL 표준 규격 |
| API | Application Programming Interface | 응용 프로그램 인터페이스 |
| ASF | Apache Software Foundation | 아파치 소프트웨어 재단 |
| BI | Business Intelligence | 비즈니스 인텔리전스 (데이터 기반 의사결정) |
| CBO | Cost-Based Optimizer | 비용 기반 쿼리 최적화기 |
| CDP | Cloudera Data Platform | 클라우데라 통합 데이터 플랫폼 |
| CLI | Command-Line Interface | 명령줄 인터페이스 |
| DAG | Directed Acyclic Graph | 방향성 비순환 그래프 (실행 계획 표현) |
| DML | Data Manipulation Language | 데이터 조작 언어 (INSERT/UPDATE/DELETE) |
| DPU | Data Processing Unit | Athena 처리 단위 |
| DW | Data Warehouse | 데이터 웨어하우스 |
| EII | Enterprise Information Integration | 엔터프라이즈 정보 통합 |
| ELT | Extract-Load-Transform | 추출-적재-변환 (DW에서 변환) |
| EMR | Elastic MapReduce | AWS 관리형 빅데이터 플랫폼 |
| ETL | Extract-Transform-Load | 추출-변환-적재 (전통적 데이터 파이프라인) |
| FTE | Fault-Tolerant Execution | 결함 허용 실행 모드 |
| GCP | Google Cloud Platform | 구글 클라우드 플랫폼 |
| GCS | Google Cloud Storage | 구글 클라우드 스토리지 |
| GDPR | General Data Protection Regulation | 유럽 개인정보보호 규정 |
| HA | High Availability | 고가용성 |
| HDFS | Hadoop Distributed File System | 하둡 분산 파일 시스템 |
| HiveQL / HQL | Hive Query Language | Hive 전용 SQL 유사 쿼리 언어 |
| HMS | Hive Metastore | Hive 메타데이터 저장소 (업계 표준) |
| JDBC | Java Database Connectivity | Java 데이터베이스 연결 API |
| JVM | Java Virtual Machine | 자바 가상 머신 |
| LDAP | Lightweight Directory Access Protocol | 경량 디렉토리 접근 프로토콜 |
| ML | Machine Learning | 머신러닝 |
| MPP | Massively Parallel Processing | 대규모 병렬 처리 아키텍처 |
| ODBC | Open Database Connectivity | 개방형 데이터베이스 연결 표준 |
| OLAP | Online Analytical Processing | 온라인 분석 처리 |
| OLTP | Online Transaction Processing | 온라인 트랜잭션 처리 |
| OOM | Out of Memory | 메모리 부족 오류 |
| ORC | Optimized Row Columnar | 최적화된 컬럼형 파일 포맷 |
| OSS | Open Source Software | 오픈소스 소프트웨어 |
| PB | Petabyte | 페타바이트 (1PB = 1,000TB) |
| PVLDB | Proceedings of the VLDB Endowment | VLDB 학술 저널 |
| RAG | Retrieval-Augmented Generation | 검색 증강 생성 (AI) |
| RBAC | Role-Based Access Control | 역할 기반 접근 제어 |
| RBO | Rule-Based Optimizer | 규칙 기반 쿼리 최적화기 |
| RDBMS | Relational Database Management System | 관계형 데이터베이스 관리 시스템 |
| RDD | Resilient Distributed Dataset | 탄력적 분산 데이터셋 (Spark 핵심 추상화) |
| REST | Representational State Transfer | REST API 아키텍처 스타일 |
| S3 | Amazon Simple Storage Service | AWS 오브젝트 스토리지 |
| SIGMOD | Special Interest Group on Management of Data | ACM 데이터 관리 학회 |
| SOAP | Simple Object Access Protocol | 웹 서비스 통신 프로토콜 |
| SPOF | Single Point of Failure | 단일 장애점 |
| SPI | Service Provider Interface | 서비스 제공자 인터페이스 |
| SQL | Structured Query Language | 구조적 질의 언어 |
| TB | Terabyte | 테라바이트 |
| TCO | Total Cost of Ownership | 총소유비용 |
| TLP | Top-Level Project | Apache 최상위 프로젝트 |
| TPC-DS | TPC Decision Support Benchmark | 의사결정 지원 표준 벤치마크 |
| UDF | User-Defined Function | 사용자 정의 함수 |
| VDB | Virtual Database | 가상 데이터베이스 (Teiid 개념) |
| VLDB | Very Large Data Bases (Conference) | 초대형 데이터베이스 학술 대회 |
| VQL | Virtual Query Language | Denodo 가상 쿼리 언어 |
| YARN | Yet Another Resource Negotiator | Hadoop 자원 관리자 |
본 문서는 공식 문서 · 학술 논문 · 업계 분석 자료를 종합해 작성했다. 최신 정보는 각 엔진의 공식 사이트를 본다.