VRAM 과 파일 크기 제약 아래에서 한국어를 지원하는 가드레일 모델을 고르는 기준과, NVIDIA 의 Nemotron 리랭커를 Cloudera AI Inference 에 올릴 때 부딪히는 제약을 정리한다.
VRAM 10GB 이내, 모델 파일 2GB 미만이라는 조건에서 실질적 병목은 파일 크기 쪽이다. 전용 가드레일 모델 중 BF16 원본 그대로 2GB 미만이면서 한국어를 지원하는 것은 사실상 Qwen3Guard 0.6B 계열뿐이다.
| 항목 | 값 |
|---|---|
| 파일 | BF16 model.safetensors 약 1.5GB |
| VRAM | FP16 기준 약 1.6~2GB (4K 컨텍스트, batch 1) |
| 한국어 | 119개 언어 지원, 학습 데이터의 약 9.9% 가 한국어 |
| 분류 | Safe · Controversial · Unsafe 3단계와 9개 카테고리 |
| 서빙 | vLLM 0.9 이상 또는 SGLang 으로 OpenAI 호환 엔드포인트 구성 |
| 라이선스 | Apache-2.0 |
한국어 성능도 크기 대비 나쁘지 않아, 다국어 벤치마크의 한국어 응답 분류 점수가 10배 이상 큰 모델들을 앞선다. 생성 도중 즉시 판정이 필요하면 같은 크기의 스트리밍 변형을 쓴다. 최종 트랜스포머 레이어에 토큰 단위 분류 헤드를 붙인 구조다.
한국 문화·법률 맥락 탐지가 더 중요하면 국내 모델을 고려할 수 있으나 원본 가중치가 2GB 를 넘어 GGUF 양자화가 전제된다. 카카오의 Kanana Safeguard-Prompt 2.1B 는 프롬프트 인젝션과 리킹 탐지 전용으로 단일 토큰을 출력해 지연이 매우 낮고, 삼성SDS 의 SGuard-ContentFilter-2B 는 다섯 개 카테고리를 임계값 조정이 가능한 형태로 제공한다.
카카오 계열은 유해 콘텐츠, 법적 리스크, 프롬프트 공격이 각각 다른 모델로 나뉘어 있어 프롬프트 방어용 모델 하나만으로는 유해 콘텐츠 필터링이 되지 않는다. 용도를 먼저 정하고 모델을 고른다.
Nemotron 리랭커는 vLLM 에 정식 반영돼 있고 공식 서빙 예시도 있다. 다만 채팅 템플릿을 명시하지 않으면 프롬프트 포맷이 적용되지 않아 리랭킹 점수가 잘못 나온다.
vllm serve nvidia/llama-nemotron-rerank-1b-v2 \
--runner pooling --trust-remote-code \
--chat-template examples/pooling/score/template/nemotron-rerank.jinja
템플릿 파일은 vLLM 저장소의 examples/pooling/score/template 아래에 있으므로, 폐쇄망이라면 모델과 함께 이 파일도 반입해 배치해야 한다.
문제는 Cloudera AI Inference 의 표준 배포 경로로는 --chat-template 을 넘길 수 없다는 점이다. CAII 는 허용하는 vLLM 인자를 화이트리스트로 관리하며, 목록에 없는 인자는 지원하지 않는다고 문서에 명시돼 있다. 따라서 이 모델을 CAII 표준 경로로 올리면 템플릿이 적용되지 않아 점수가 틀어진다.