EngineDeadError 또는 CUDA illegal memory access 이후 PID 1과 metrics는 살아 있지만 실제 추론은 실패한다.
관련 원본들은 모두 근본 수정 확인이 없다. 수동 endpoint 복구와 감지 개선은 운영 우회이며, 정확한 제품 probe 노출 경로·수정 버전은 남은 확인 사항이다.
실패한 endpoint를 재생성해 서비스를 복구하고 엔진 상태를 반영하는 probe를 제품 지원 경로로 구성한다. 동시성 제한은 재발 완화이며 결함 수정과 구분한다.
확인 수준: 추가 조사 해법 · 해당 케이스 적용 결과 미확인
적용 조건: <...>와 예시 DB·테이블·경로·수치는 실제 확인값으로 바꾼다. 명령과 메뉴는 참고 문서를 바탕으로 보강한 예시이며 대상 시스템에서 실행하지 않았다. 버전·원인에 따른 분기와 남은 확인 사항은 아래에 명시한다.
kubectl -n '<namespace>' logs '<model-pod>' -c '<model-container>' --since=30m
kubectl -n '<namespace>' get pod '<model-pod>' -o jsonpath='{.spec.containers[*].livenessProbe}'
kubectl -n '<namespace>' get pod '<model-pod>' -o jsonpath='{.spec.containers[*].readinessProbe}'
/health 경로를 임의 지정하지 않는다.--max-num-seqs와 최대 context 길이를 줄여 부하를 재시험한다. 원본의 8 sequences·16384 tokens는 제안값이며 보편적 해결값이 아니다. GPU memory utilization을 올리면 별도 OOM 위험이 있어 자동 적용하지 않는다.종료 후 nvidia-smi에서 GPU 사용량이 낮다는 사실로 종료 전 OOM을 배제하거나 확정할 수 없다. EngineDeadError는 엔진 종료를 전달하는 상위 오류이므로 첫 CUDA/메모리 오류와 종료 직전 사용량을 확인한다. 부하가 없을 때도 재발하면 GPU 증설만을 확정 해법으로 삼지 않는다.
실제 추론 성공과 엔진 실패 시 트래픽 제외·자동 재생성이 함께 동작하는지 비운영 환경에서 확인한다.