nvidia-device-plugin DaemonSet 파드가 CrashLoopBackOff 로 반복 재시작하고, 노드의 nvidia.com/gpu 가 allocatable 에 잡히지 않는다.
kubectl -n kube-system logs <pod>
kubectl -n kube-system logs <pod> --previous
kubectl -n kube-system describe pod <pod> | grep -A 20 Events
ssh <node> "lspci | grep -i nvidia; nvidia-smi; ls -l /dev/nvidia*"
| 로그 | 원인 |
|---|---|
could not load NVML library / Failed to initialize NVML |
드라이버 미설치 |
no devices found |
그 노드에 GPU 하드웨어가 없음 |
nvidia-container-cli: initialization error |
Container Toolkit · 런타임 미설정 |
permission denied |
디바이스 권한 · 마운트 문제 |
GPU 가 없는 노드에 DaemonSet 이 배포돼 크래시하는 것이라면 nodeSelector 나 taint 로 GPU 노드에만 배포되게 한다.
드라이버나 Container Toolkit 이 빠진 것이면 노드 쪽을 먼저 채운다. 노드를 직접 관리하지 않고 싶으면 GPU Operator 로 전제 조건 설치까지 맡길 수 있다.