H100에서 NIM 임베딩 모델의 응답이 지연되는 증상이 나타난다.
범용 ONNX 프로파일로 구동되던 환경에서 아래 배포 구성으로 변경한 뒤 해결되었다. 모델과 GPU 구성을 함께 변경한 사례이므로 엔진 변경만의 효과로 단정하지 않는다.
모델을 FP16으로 단일 전체 H100 GPU에 배포하고 런타임 엔진을 TensorRT LLM으로 전환한다.
명령 예시는 문서 작성 시 보강한 것이며 대상 시스템에서 실행 검증하지 않았다.
nvidia-smi -L로 전체 H100인지 MIG 분할인지 확인한다.IMG_NAME='<현재 사용 중인 NIM 이미지:태그>'
docker run --rm --runtime=nvidia --gpus=all "$IMG_NAME" list-model-profiles
NIM_MODEL_PROFILE=<확인한 ID>로 지정해 재배포한다. CAII가 관리하는 endpoint는 Model Endpoints → 해당 모델의 배포 설정에서 지원되는 모델 프로파일·GPU 구성을 선택해 새 배포를 만든다.tensorrt와 tensorrt_llm 프로파일 이름을 임의로 같게 간주하지 않고 이미지가 제공하는 목록을 기준으로 선택한다.endpoint Ready 상태, 실제 로딩된 backend/profile, 동일 배치 크기의 지연·GPU 사용률을 비교한다.