로컬에서 언어 모델을 돌리는 구성을 다룬다. 서비스·모델 전반은 AI System 을 볼 것.
- 단일 장비에서 Ollama 와 Open WebUI 로 모델을 올려 쓴다.
- 인터넷이 없는 서버에 vLLM 을 올려 서비스로 띄운다.
- 여러 추론 엔드포인트를 OpenAI 호환 API 하나로 모은다.
- 쿠버네티스에 올린 LLM 스택의 연동 · 네트워크 정책 문제.
- VRAM 과 파일 크기 제약 아래에서 한국어를 지원하는 가드레일 모델을 고르는 기준과, NVIDIA 의 Nemotron 리랭커를 Clouder…
- 여러 모델과 제공자를 한곳에서 골라 쓰고 싶을 때 앞에 두는 계층을 LLM 게이트웨이 또는 라우터라고 부른다. 애플리케이션은 게이트웨이 하나만…
- 다른 회사의 모델을 쓰는데 왜 Claude Code 를 설치하라고 안내하는지, 그리고 그 구성이 실제로 무엇을 바꾸는지 정리한다.
- 대시보드의 사용량이 절반도 안 되는데 Claude Code 가 사용량 제한에 걸리는 상황을 추적한 기록이다. 구독(Pro · Max)과 API…
- "기업용 Pro" 라는 이름의 플랜은 없다. 조직용은 Team 과 Enterprise 두 가지이고, Pro 와 Max 는 개인용이다. 구조가…
- 둘 다 터미널에서 도는 에이전틱 코딩 도구다. 코드베이스와 대화하고, 파일을 직접 고치고, 셸 명령을 실행하고, 테스트를 돌린다. MCP 연결…
- 같은 모델이라도 답을 만들어 내는 절차를 어떻게 짜느냐에 따라 정확도와 비용이 크게 달라진다. 아래는 논문으로 정리되어 널리 쓰이는 전략들이다…
- "AI 를 로컬에서 돌린다" 고 할 때 실제로는 성격이 다른 두 가지가 섞여 있다.
- 파이썬 클라이언트로 Milvus 에 붙으면 다음 메시지가 반복된다.
- RAG(Retrieval-Augmented Generation)는 질문에 답하기 전에 외부 문서를 찾아 근거로 붙이는 구조다. 파이프라인은 크…
- 셋 다 "데이터를 숫자로 바꾼다" 는 설명을 달고 다닌다. 그러나 목적과 적용 시점이 다르다.
- Gated DeltaNet(GDN) 계층을 쓰는 모델을 vLLM 으로 서빙할 때, 기동은 되는데 첫 API 호출에서 실패한다. 게이트웨이(Li…