Cloudera 는 대규모 데이터를 저장·처리·분석하는 엔터프라이즈 데이터 플랫폼을 제공하는 기업이다. Apache Hadoop 을 상용 환경에서 안정적으로 쓸 수 있게 패키징하고 기술 지원을 제공하는 것으로 출발했다.
Hadoop, Spark, Impala, Hive, HBase, Kafka 등 여러 오픈소스 기술을 하나의 상용 배포판으로 묶어 지원하며, 현재의 핵심 제품은 CDP(Cloudera Data Platform)다. 온프레미스, 퍼블릭 클라우드, 하이브리드 환경에서 수집·저장·처리·머신러닝·분석을 아우르는 것을 목표로 한다.
2008년에 설립됐고 2018년에 경쟁사였던 Hortonworks 와 합병하면서 하둡 상용화 시장의 두 축이 하나로 통합됐다. 2021년에는 사모펀드에 인수되며 비상장 기업으로 전환됐다.
금융·통신·제조·공공 등 정형과 비정형 데이터를 대량으로 다루는 조직이 데이터 레이크 구축, 실시간 분석, AI·ML 파이프라인 운영에 활용한다.
데이터 플랫폼 위에서 데이터 준비부터 모델 개발·학습·배포·운영·거버넌스까지 다루는 엔터프라이즈 AI·ML 플랫폼이다. 전통적인 머신러닝뿐 아니라 생성형 AI 와 에이전트 워크플로까지 지원한다.
| 구성 요소 | 역할 |
|---|---|
| AI Workbench | 모델과 에이전트를 구축·학습·미세조정·관리하는 개발 환경 |
| AI Inference | 모델을 배포·서빙·모니터링하며 프라이빗 모델 엔드포인트를 제어하는 프로덕션 서비스 |
| AI Registry | 모델 메타데이터·계보·아티팩트·버전·배포 추적과 거버넌스의 중앙 허브 |
| AI Studios | 합성 데이터 생성, 미세조정, RAG, 멀티 에이전트 워크플로 도구 |
차별점은 하이브리드·멀티클라우드 환경과 데이터 거버넌스를 그대로 활용한다는 점이다. 데이터가 있는 위치로 컴퓨팅을 가져가는 구조라, 데이터를 외부로 내보내기 어려운 환경에서 선택지가 된다.
Databricks 에서 Cloudera AI 에 직접 대응하는 것은 Mosaic AI 다. 둘 다 데이터 플랫폼 위에 얹은 엔터프라이즈 AI 계층이라는 같은 포지셔닝이어서 구성 요소를 짝지어 비교하기 좋다.