호스트 nvidia-smi는 성공해도 toolkit·ECS 역할·device plugin 또는 Workbench accelerator 설정이 준비되지 않아 GPU가 선택되지 않는다.
관련 원본 중 worker 오류를 해결한 뒤 GPU provisioning이 복구된 기록이 있다. 다만 구체적인 worker 오류 수정 내용은 없으므로 패키지 설치만으로 모든 사례가 해결됐다고 표시하지 않는다.
지원되는 OS/driver/toolkit 조합을 준비해 모든 GPU worker에 설치하고 ECS GPU node 설정과 Kubernetes allocatable을 검증한다.
확인 수준: 추가 조사 해법 · 해당 케이스 적용 결과 미확인
적용 조건: <...>와 예시 DB·테이블·경로·수치는 실제 확인값으로 바꾼다. 명령과 메뉴는 참고 문서를 바탕으로 보강한 예시이며 대상 시스템에서 실행하지 않았다. 버전·원인에 따른 분기와 남은 확인 사항은 아래에 명시한다.
sudo dnf install dnf-plugins-core
mkdir -p gpu-rpms
dnf download --resolve --alldeps --destdir ./gpu-rpms \
'nvidia-container-toolkit-<supported-version-release>'
rpm --checksig ./gpu-rpms/*.rpm
sha256sum ./gpu-rpms/*.rpm > gpu-rpms.sha256
sha256sum -c gpu-rpms.sha256
sudo dnf --disablerepo='*' install ./gpu-rpms/*.rpm
nvidia-smi
nvidia-container-cli --version
systemctl restart docker를 그대로 적용하지 않는다.kubectl describe node '<gpu-node>'
kubectl get pods -A -o wide
nvidia.com/gpu allocatable, taint/toleration과 workload accelerator를 확인한다. CAI 1.5.5는 Site Administration → Runtime → Workload Accelerators에서 기본 accelerator를 설정할 수 있다. 실제 세션 생성 화면에서 GPU profile로 실행하고 CUDA 초기화 검사를 수행한다.노드 Ready·GPU allocatable·device plugin 정상 상태와 실제 GPU 세션의 CUDA 연산을 확인한다. workspace 생성 화면에 GPU 선택란이 없다는 사실만으로 GPU 미지원으로 판단하지 않는다.