Node allocatable GPU와 nvidia-smi는 정상인데 serving container의 CUDA 초기화가 실패하고 CrashLoopBackOff를 반복한다.
원본에서 nvidia-smi 성공과 CUDA 실패는 확인됐지만 근본 원인은 미확정이다. device plugin의 allocatable 광고와 컨테이너 CUDA 실행 가능성은 별도로 검증한다.
같은 serving container의 GPU request·장치 접근·CUDA 초기화를 확인하고 ECS driver/toolkit/runtime 조합을 맞춘다.
확인 수준: 추가 조사 해법 · 해당 케이스 적용 결과 미확인
적용 조건: <...>와 예시 DB·테이블·경로·수치는 실제 확인값으로 바꾼다. 명령과 메뉴는 참고 문서를 바탕으로 보강한 예시이며 대상 시스템에서 실행하지 않았다. 버전·원인에 따른 분기와 남은 확인 사항은 아래에 명시한다.
kubectl -n '<namespace>' get pod '<pod>' -o wide
kubectl -n '<namespace>' get pod '<pod>' -o jsonpath='{range .spec.containers[*]}{.name}{"\t"}{.resources}{"\n"}{end}'
kubectl -n '<namespace>' logs '<pod>' -c kserve-container --previous
python -c "import torch; print(torch.__version__, torch.version.cuda); print(torch.cuda.is_available(), torch.cuda.device_count()); torch.cuda.init()"
torch.cuda.init()의 실제 오류로 driver 호환성, device 노출, CUDA library, runtime 설정을 구분한다./dev/nvidia* 노출과 runtime handler가 실제 serving Pod에 적용되는지 대조한다. CPU profile로 배포됐다면 올바른 GPU profile로 재배포한다.동일 모델 image에서 CUDA 초기화·간단한 tensor 연산·모델 로딩이 성공하고 serving container가 Ready를 유지해야 한다.