새 GPU worker에서는 NAT 주소만 접근 가능하고 ECS에 등록된 기존 노드 내부 IP로는 연결되지 않는다.
문제는 GPU 드라이버 이전의 노드 주소 도달성이다. 원본에는 네트워크 구조 변경 후 최종 성공 기록이 없어 조건부 해법으로 정리했다.
등록된 노드 주소 사이의 양방향 라우팅과 해당 ECS 버전의 포트를 확보한 뒤 worker를 추가한다. NAT 주소 하나만 개방하는 것으로 overlay·스토리지 통신까지 해결되지는 않는다.
확인 수준: 추가 조사 해법 · 해당 케이스 적용 결과 미확인
적용 조건: <...>와 예시 DB·테이블·경로·수치는 실제 확인값으로 바꾼다. 명령과 메뉴는 참고 문서를 바탕으로 보강한 예시이며 대상 시스템에서 실행하지 않았다. 버전·원인에 따른 분기와 남은 확인 사항은 아래에 명시한다.
kubectl get nodes -o wide
kubectl -n kube-system get pods -o wide
peer_ip='<registered-node-ip>'
peer_fqdn='<registered-node-fqdn>'
ip route get "$peer_ip"
getent ahostsv4 "$peer_fqdn"
dig -x "$peer_ip"
tracepath "$peer_ip"
# 새 worker에서 실제 control-plane 주소로 검사
nc -vz '<control-plane-ip>' 6443
nc -vz '<control-plane-ip>' 9345
# 기존 관리 노드에서 worker의 kubelet 경로 검사
nc -vz '<worker-registered-ip>' 10250
노드 Ready, GPU allocatable, 다른 노드와의 Pod 통신, PVC mount, image pull, 실제 GPU 작업을 모두 확인한다.