spark.io.compression.codec을 변경했지만 최종 ORC 파일이 계속 기존 압축으로 생성된다.
원본에서 spark.sql.orc.compression.codec=zlib로 해결됐다. ORC의 codec 이름·지원 범위는 설치된 Spark/ORC 버전을 기준으로 한다.
Spark ORC writer의 compression 옵션 또는 spark.sql.orc.compression.codec을 설정한다.
확인 수준: 원본에서 해결 확인 · 실행 절차 보강
적용 조건: <...>와 예시 DB·테이블·경로·수치는 실제 확인값으로 바꾼다. 명령과 메뉴는 참고 문서를 바탕으로 보강한 예시이며 대상 시스템에서 실행하지 않았다. 버전·원인에 따른 분기와 남은 확인 사항은 아래에 명시한다.
spark.io.compression.codec은 최종 ORC 저장 codec 설정이 아니다.df를 새 검증 경로에 ZLIB로 쓰는 예시다.spark.conf.set('spark.sql.orc.compression.codec', 'zlib')
df.write.mode('errorifexists').option('compression', 'zlib').orc(
'<new-validation-output-path>'
)
.option('compression', ...)도 확인한다. 기존 ORC 파일은 설정 변경만으로 재압축되지 않는다.새 파일의 ORC footer codec이 ZLIB이고 읽은 결과가 원본과 일치하는지 확인한다.