YARN ResourceManager가 긴 GC 이후 종료되는 증상이 나타난다.
NodeManager 수, 동시 스케줄링 자원, application report가 RM Heap 사용량에 영향을 준다. 기록에서는 최소 6GB에서 시작하고 실측 부하에 맞추어 증설하도록 안내되었다.
RM Heap 사용량을 확인하고 피크 대비 약 30% 여유가 있도록 Heap을 늘린다. 완료된 application 보관 수를 줄이는 방법도 함께 검토한다.
명령 예시는 문서 작성 시 보강한 것이며 대상 시스템에서 실행 검증하지 않았다.
- CM에서 Clusters → 대상 클러스터 → YARN → Configuration으로 이동한다.
- Scope에서 ResourceManager 또는 해당 역할 그룹을 선택하고 Java Heap Size of ResourceManager in Bytes를 검색한다. 역할별 override가 있으면 실제 대상 역할의 값도 확인한다.
- 기존 값을 기록한 뒤 아래 내용을 반영한다. Safety Valve는 기존의 다른 설정을 지우지 않고 해당 키만 추가·수정한다.
Heap = 실측 최대 사용량 × 1.3 이상을 수용할 값
- Save Changes를 누르고 변경 사유를 기록한다. Instances → 대상 역할 선택 → Actions for Selected → Restart로 해당 역할을 재시작한다. 클라이언트 설정 변경 표시가 있으면 Actions → Deploy Client Configuration도 실행한다.
- 실패하거나 기존 기능에 영향이 있으면 같은 화면에서 이전 값을 복원하고 해당 역할을 재시작한다.
최소 6GB는 해당 사례의 출발점이다. 호스트 RAM 및 다른 역할의 예약량도 계산한다. HA이면 Standby부터 반영하고 failover 후 이전 Active에 적용한다.
GC pause, RM Heap, 애플리케이션 제출 성공률을 확인한다.