하루 8만개, 누적 약 2500만개 규모의 파일이 있는 경로를 skipTrash 옵션 없이 삭제했다. 삭제된 파일은 모두 .Trash로 이동했고, fs.trash.checkpoint.interval(1시간) 주기가 돌면서 NameNode가 수천만 개 파일의 trash checkpoint 정리를 한 번에 처리하다 응답 불능 상태에 빠졌으며, 이 시점에 HA 페일오버도 정상 동작하지 않았다.
이 원인 설명은 고객이 스스로 타임라인을 재구성해 제시한 가설이며, Cloudera가 이를 최종적으로 확정했다는 코멘트는 원본에 없다. skipTrash로 밀린 항목을 비운 뒤 실제로 재발했는지 여부도 원본에 기록되지 않았다.
대량 삭제를 중단하고 NameNode 부하가 안정된 뒤 보존 요건을 확인해 대상 trash를 작은 범위로 나눠 정리한다. checkpoint 주기를 늘리면 처리량이 자동으로 분산된다는 설명은 적용하지 않는다.
확인 수준: 추가 조사 해법 · 해당 케이스 적용 결과 미확인
적용 조건: <...>와 예시 DB·테이블·경로·수치는 실제 확인값으로 바꾼다. 명령과 메뉴는 참고 문서를 바탕으로 보강한 예시이며 대상 시스템에서 실행하지 않았다. 버전·원인에 따른 분기와 남은 확인 사항은 아래에 명시한다.
hdfs dfs -ls /user/'<user>'/.Trash
hdfs dfs -rm -r -skipTrash '<verified-expired-trash-subdirectory>'
배치 정리 동안 RPC·GC·HA 상태가 안정적이고 보존 대상 데이터가 남아 있는지 확인한다.