GPU 할당 수는 보이지만 실제 GPU 이용률과 메모리·온도를 확인해야 한다.
원본 환경에서는 GPU 전용 dashboard가 없었고 외부 DCGM 연동을 참고용으로 안내했다. 이 구성을 Cloudera가 제공하는 기본 지원 기능으로 간주하지 않는다.
즉시 확인은 nvidia-smi를 사용하고, 지속 관측은 기존 GPU 관리 방식과 충돌하지 않도록 DCGM Exporter와 Prometheus/Grafana를 연동한다.
확인 수준: 추가 조사 해법 · 해당 케이스 적용 결과 미확인
적용 조건: <...>와 예시 DB·테이블·경로·수치는 실제 확인값으로 바꾼다. 명령과 메뉴는 참고 문서를 바탕으로 보강한 예시이며 대상 시스템에서 실행하지 않았다. 버전·원인에 따른 분기와 남은 확인 사항은 아래에 명시한다.
nvidia-smi --query-gpu=uuid,name,utilization.gpu,memory.used,memory.total,temperature.gpu --format=csv -l 5
helm repo add gpu-helm-charts https://nvidia.github.io/dcgm-exporter/helm-charts
helm repo update
helm show values gpu-helm-charts/dcgm-exporter --version '<chart-version>' > dcgm-values.yaml
helm install dcgm-exporter gpu-helm-charts/dcgm-exporter \
--version '<chart-version>' --namespace gpu-monitoring --create-namespace \
-f dcgm-values.yaml --set serviceMonitor.enabled=false
kubectl -n gpu-monitoring port-forward service/dcgm-exporter 9400:9400 후 다른 터미널에서 curl --fail http://localhost:9400/metrics로 DCGM_ metric을 확인한다. Prometheus target이 UP이면 Grafana에서 DCGM_FI_DEV_GPU_UTIL, DCGM_FI_DEV_FB_USED 등의 실제 수집 metric으로 panel을 구성한다.작은 GPU 부하를 실행해 nvidia-smi 값과 Grafana 시계열이 대응하는지 확인한다. UUID·노드·Pod label 매핑과 수집 누락도 확인한다.