같은 모델이 A100에서는 되지만 H100에서 GDN prefill kernel warmup failed가 반복된다.
A100 정상 동작은 원본에 명시돼 있다. 특정 모델·runtime의 우회이며 모든 GDN 모델이 모든 H100에서 미지원이라는 일반 결론은 아니다. 원본 시점 제품 제한을 현재 전체 제품의 지원 계획으로 확대하지 않는다.
원본에서 정상 동작한 A100·runtime 조합으로 배포를 우회한다. H100 사용은 제품이 backend 인자 또는 필요한 kernel 패키지를 지원할 때 재검증한다.
확인 수준: 원본에서 해결 확인 · 실행 절차 보강
적용 조건: <...>와 예시 DB·테이블·경로·수치는 실제 확인값으로 바꾼다. 명령과 메뉴는 참고 문서를 바탕으로 보강한 예시이며 대상 시스템에서 실행하지 않았다. 버전·원인에 따른 분기와 남은 확인 사항은 아래에 명시한다.
nvidia-smi --query-gpu=name,driver_version,memory.total --format=csv
python -m pip show vllm flashinfer-python flashinfer-jit-cache
--gdn-prefill-backend가 있어도 CAI가 그 인자를 전달하도록 지원해야 한다. 원본 on-premises 버전에서는 UI/API로 설정할 수 없었다. 임의 환경 변수로 전달된다고 가정하지 않는다.새 endpoint의 warmup, 실제 추론·tool call·부하 시험이 정상이며 선택한 GPU에서 동작하는지 확인한다.