온프레미스 LLM 구축, 폐쇄망에서 생성형 AI 쓰는 법
온프레미스 LLM 구축을 검토하는 보안·인프라 담당자를 위해 망분리 환경의 선택지, 모델 크기 고르는 법, GPU 메모리 계산식, 설치 뒤 운영에서 놓치기 쉬운 것을 정리했습니다.

이 글의 목차
직원들이 개인 휴대폰으로 외부 AI 서비스에 업무 문서를 붙여 넣고 있다는 이야기가 들려옵니다. 막자니 업무 현장의 불만이 크고, 허용하자니 데이터가 회사 밖으로 나갑니다. 금융, 공공, 제조처럼 데이터를 외부로 보낼 수 없는 조직의 보안 담당자라면 한 번은 겪는 상황입니다. 이 글은 회사 안에 언어 모델을 직접 설치하는 온프레미스 LLM이 언제 맞는 선택인지, 장비를 얼마나 잡아야 하는지를 계산식과 함께 정리했습니다.
망분리 환경에서도 생성형 AI를 쓸 수 있나
선택지는 두 갈래입니다. 규제가 허용하는 범위에서 외부 서비스를 쓰거나, 모델을 내부에 설치하는 것입니다.
외부 서비스 쪽 문은 조금씩 열리고 있습니다. 금융위원회와 금융감독원은 2024년 8월 금융분야 망분리 개선 로드맵을 내고, 규제 샌드박스로 생성형 AI 같은 신기술 활용 범위를 넓히겠다고 밝혔습니다(법무법인 세종 정리). 공공 분야에서는 국가정보원이 업무 정보를 기밀, 민감, 공개로 나눠 등급별로 다른 보안 통제를 적용하는 국가 망 보안체계(N2SF) 가이드라인을 2025년 9월 정식 버전으로 공개했습니다(바이라인네트워크).
다만 이런 변화가 "모든 업무 데이터를 외부 AI에 보내도 된다"는 뜻은 아닙니다. 개인신용정보, 설계 도면, 수사나 감사 자료처럼 등급이 높은 정보는 여전히 내부에서 처리해야 하는 경우가 많고, 해석은 기관과 감독 기준마다 다릅니다. 그래서 실제로는 민감한 업무만 사내 설치 모델로 처리하고 나머지는 허용된 외부 서비스를 쓰는 혼합 구성이 흔합니다.
사내 설치가 맞는 경우와 아닌 경우
| 비교 | 외부 API 서비스 | 온프레미스 LLM |
|---|---|---|
| 데이터 이동 | 질문과 문서가 서비스 회사 서버로 감 | 회사 안에서만 처리 |
| 초기 비용 | 거의 없음 | 서버, GPU, 설치 인력 |
| 쓸수록 드는 비용 | 사용량에 비례해 계속 | 전기료와 운영 인력 중심 |
| 최신 모델 | 바로 쓸 수 있음 | 검증 뒤 직접 반입하고 교체 |
| 운영 부담 | 공급사가 대부분 맡음 | 업데이트, 장애, 로그를 직접 챙김 |
사내 설치가 맞는 경우는 분명합니다. 법령이나 내부 규정상 데이터를 밖으로 보낼 수 없을 때, 업무망이 인터넷과 분리되어 외부 서비스에 접속할 수 없을 때, 사용량이 많고 꾸준해서 장비를 갖추는 편이 길게 보면 나을 때입니다. 반대로 다루는 정보의 민감도가 낮고 사용량이 들쭉날쭉하다면 외부 서비스가 더 경제적입니다.
모델은 '업무에 충분한 가장 작은 것'을 고릅니다
큰 모델일수록 답이 좋아지는 경향이 있지만, 필요한 장비와 응답 속도도 함께 커집니다. 수십억 개 수준의 매개변수를 가진 작은 언어 모델(흔히 sLLM이라고 부릅니다)로도 충분한 일이 생각보다 많습니다.
- 규정 질의응답, 문서 요약, 분류처럼 범위가 정해진 일: 작은 모델에 검색(RAG)을 붙이는 구성으로 출발해 볼 만합니다
- 여러 단계를 따져야 하는 분석, 긴 보고서 초안: 더 큰 모델이 필요할 수 있습니다
고를 때는 두 가지를 따로 확인합니다. 하나는 한국어 업무 문서를 얼마나 잘 다루는지입니다. 영어 평가 점수가 높아도 한국어 공문서 요약은 어색한 모델이 있습니다. 후보 두세 개를 실제 업무 문서 수십 건으로 직접 시험해 보는 것이 가장 확실합니다. 다른 하나는 라이선스입니다. 가중치가 공개된 모델이라도 상업적 이용 조건이 모델마다 다릅니다.
GPU는 얼마나 필요한가: 계산식으로 가늠하기
GPU 메모리는 크게 두 덩어리로 나눠 계산합니다. 모델 자체(가중치)를 올리는 메모리와, 대화가 길어지고 사용자가 많아질수록 늘어나는 메모리(KV 캐시)입니다.
가중치 메모리 = 매개변수 수 × 숫자 하나를 저장하는 바이트 수
16비트로 저장하면 매개변수 하나에 2바이트, 8비트면 1바이트, 4비트면 0.5바이트입니다. 비트 수를 줄이는 것(양자화)은 메모리를 크게 아끼지만 답의 품질이 떨어질 수 있어 반드시 다시 시험해야 합니다.
| 모델 크기(매개변수) | 16비트 | 8비트 | 4비트 |
|---|---|---|---|
| 80억 개(8B) | 16GB | 8GB | 4GB |
| 320억 개(32B) | 64GB | 32GB | 16GB |
| 700억 개(70B) | 140GB | 70GB | 35GB |
KV 캐시 메모리 = 2 × 층 수 × KV 헤드 수 × 헤드 차원 × 바이트 수 × (동시에 처리하는 글자 조각 수)
모델 구조마다 값이 다르니, 가정 하나를 놓고 계산하면 이렇습니다. 층이 80개, KV 헤드가 8개, 헤드 차원이 128인 70B급 모델을 16비트로 돌린다고 가정하면 글자 조각(토큰) 하나에 약 0.33MB가 듭니다(2 × 80 × 8 × 128 × 2바이트). 한 사람이 8천 토큰짜리 문서를 넣고 묻는다면 약 2.6GB, 동시에 10명이 그렇게 쓰면 약 26GB가 가중치와 별도로 더 필요합니다. 같은 가정에서 층이 32개인 8B급 모델이라면 토큰 하나에 약 0.13MB입니다.
이 숫자를 GPU 한 장의 메모리와 견줘 보면 규모가 잡힙니다. 데이터센터용 GPU는 한 장에 48GB(예: NVIDIA L40S), 80GB(예: A100 80GB, H100) 같은 제품이 많이 쓰입니다. 70B급 모델을 16비트로 온전히 올리려면 80GB 카드 두 장으로도 빠듯하고, 4비트로 줄이면 한 장에서도 돌릴 수 있지만 품질 확인이 필요합니다.
설치 뒤에 놓치기 쉬운 것
외부 서비스라면 공급사가 대신 해 주던 일을 이제 직접 챙겨야 합니다.
온프레미스 LLM 운영 점검표
- 인터넷이 끊긴 환경에서 새 모델과 보안 패치를 검증하고 반입하는 절차가 있다
- 누가 어떤 질문을 했고 어떤 문서가 근거로 쓰였는지 기록이 남는다
- 사용자별, 부서별로 쓸 수 있는 기능과 문서 범위가 나뉘어 있다
- 모델이나 문서를 바꿀 때마다 같은 평가 질문으로 품질을 다시 잰다
- GPU 서버 장애 때 업무를 어떻게 이어 갈지 정해 두었다
특히 기록은 보안 감사와 품질 개선 모두에 쓰입니다. 다만 질문 내용 자체에 민감 정보가 들어갈 수 있으므로, 기록을 누가 얼마나 오래 볼 수 있는지도 함께 정해야 합니다. 직원이 지켜야 할 사용 규칙은 사내 생성형 AI 사용 가이드라인 글에 정리했습니다.
자주 묻는 질문
sLLM이 무엇인가요?
매개변수 수가 비교적 적은 언어 모델을 흔히 부르는 말입니다. 정해진 기준은 없지만 수십억 개 수준의 모델을 가리키는 경우가 많고, 적은 장비로 사내에 설치하기 쉬운 것이 장점입니다.
사내 설치 모델은 외부 최신 모델보다 성능이 떨어지나요?
범용 능력은 대체로 최신 대형 모델이 앞섭니다. 하지만 사내 문서 검색처럼 범위가 정해진 일은 검색 품질과 문서 정리가 결과를 더 크게 좌우해서, 작은 모델로도 충분한 경우가 많습니다.
GPU 한 장으로도 시작할 수 있나요?
8B급 모델이라면 48GB 카드 한 장으로도 시범 운영이 가능합니다. 동시 사용자가 늘면 KV 캐시 메모리가 커지므로 사용자 수를 가정해 다시 계산해야 합니다.
온프레미스 LLM 구축에는 얼마나 걸리나요?
장비가 준비되어 있고 업무가 정해져 있다면 시범 구성은 몇 주 안에 가능합니다. 장비 도입, 보안 심의, 내부 시스템 연동 일정에 따라 더 길어집니다.
사내 설치는 통제를 얻는 대신 운영을 직접 맡는 선택입니다. 먼저 RAG 구축 글로 어떤 문서를 다룰지 정리하고, 구성이 궁금하다면 AI 솔루션 소개를 참고해 주세요.


