On-Premise AI · 온프레미스 LLM 서빙
클라우드 API 없이,
우리 서버에서
AI를 돌립니다
데이터가 밖으로 나가지 않는 AI, 온프레미스.
오픈소스 LLM을 직접 실행하고 API로 서빙해, 백엔드·프론트엔드·ComfyUI까지 연결합니다. 프롬프트 활용법이 아니라, 온프레미스 AI 서비스를 직접 구축하는 SW 개발자 실습 과정입니다.
- 오프라인 2일 집중 · 총 12시간
- GPU(Runpod) 제공 - 수강료에 포함
- 온라인 보조 영상 제공
- 프로세스 결과물
$ curl http://localhost:11434/v1/chat/completions \
-d '{ "model": "llama-ko",
"messages": [{"role":"user",
"content":"내부 문서 요약해줘"}]}'
{ "choices": [{
"message": {
"role": "assistant",
"content": "외부 전송 없이, 내 서버에서 응답합니다."
} }] }
›
집중 오프라인 과정
하루 6시간 × 2일
프로세스 결과물
강력한 클라우드 AI,
그런데 왜 직접 서빙해야 할까요?
ChatGPT·Claude·Gemini는 분명 강력합니다. 하지만 모든 기업이 외부 API에만 의존할 수는 없습니다. 현장에서는 이런 제약이 반복됩니다.
내부 데이터를 외부로 보낼 수 없다
고객 정보·내부 문서·코드를 외부 API로 전송하는 순간 보안과 컴플라이언스 리스크가 생깁니다.
호출량이 늘수록 비용이 커진다
토큰 단위 과금은 서비스가 성장할수록 부담이 됩니다. 비용 예측이 어렵습니다.
외부 모델 정책에 흔들린다
가격 인상·모델 단종·정책 변경이 우리 서비스의 핵심 기능을 직접 흔들 수 있습니다.
그래서 기업들은 질문하기 시작했습니다. “우리 서버에서 직접 LLM을 실행할 수 있을까?”
오픈소스 모델을 API 서버처럼 쓰고, 외부 API 없이 AI 도구를 만들고, GPU 서버 한 대로 실제 서비스를 운영하는 방법 — 이 과정은 바로 그 질문에 답합니다.
이틀 후,
설명할 수 있는 아키텍처가 남습니다
단순 실습이 아니라 하나의 구조를 직접 만듭니다. 로컬 LLM 실행부터 사용자 인터페이스까지, 전체 흐름을 손으로 연결합니다.
end-to-end pipeline
프로덕션급 LLM 서빙 환경
vLLM을 GPU에 올려 OpenAI 호환 API로 서빙하는 실행 환경
GPU 용량 산정 근거
KV 캐시 계산으로 “GPU 1대에 동시 몇 명”을 도출한 산정표
성능 벤치마크 리포트
TTFT·처리량·동시성 한계·양자화 트레이드오프 측정 데이터
스트리밍 AI 백엔드
타임아웃·에러·동시 요청 제어까지 반영한 스트리밍 중계 서버
실시간 채팅 + ComfyUI
SSE로 토큰이 흐르는 채팅 화면과 노드 기반 로컬 AI 워크플로우
사내 도입 제안 문서
벤치마크 근거가 붙은 온프레미스 아키텍처 — 제안·포트폴리오용
수료 후 한 문장으로 설명할 수 있습니다 — “외부 API 없이 오픈소스 LLM을 로컬에서 실행해 API로 서빙하고, 웹 프론트엔드와 ComfyUI 워크플로우로 연결한 온프레미스 AI 서비스를 구현했습니다.”
직원 한 명, 이틀.
팀에는 역량이 남습니다.
이 과정은 개인의 학습으로 끝나지 않습니다. 조직이 외부 API에 의존하지 않고 AI를 다룰 수 있는 실질적 역량을 팀 안에 만듭니다.
내부 데이터를 밖으로 보내지 않습니다
고객 정보·내부 문서를 외부 API로 전송하지 않고, 우리 서버 안에서 추론을 끝냅니다. 보안·컴플라이언스 부담이 줄어듭니다.
호출량에 비례하던 비용을 통제합니다
토큰 단위 과금 대신 자체 인프라로 전환하는 구조를 이해합니다. 사용량이 늘수록 비용 예측 가능성이 커집니다.
외부 모델 정책 변경에 흔들리지 않습니다
가격 인상·모델 단종·정책 변경 같은 외부 종속성 리스크를 자체 모델 운영 역량으로 완화합니다.
역량이 팀 안에 남습니다
외주가 아니라 우리 개발자가 직접 설계·서빙·운영할 수 있게 됩니다. 이틀의 교육이 팀의 자산이 됩니다.
보고용 한 줄
“이틀이면 우리 팀이 외부 API 없이 사내 서버에서 LLM을 서빙할 수 있는 기본 역량을 갖춥니다. 보안·비용·종속성 문제를 동시에 줄이는 투자입니다.”
기업 단체 신청 · 세금계산서 발행 · 견적서 지원 — 신청 시 함께 안내드립니다.
2일 · 12교시, 군더더기 없이 설계했습니다
오프라인 2일 집중 · 총 12시간 · 1일 6시간 (오전 10시–오후 5시, 점심 1시간). 개념 설명, 강사 시연, 단계별 실습, 결과물 리뷰가 한 흐름으로 이어집니다.
1일차 — GPU 위에 LLM을 올리고, 성능을 숫자로 증명한다
온프레미스 도입 판단과 아키텍처 설계
감이 아니라 숫자로 판단합니다. API 토큰 비용과 GPU 서버 비용의 손익분기를 직접 계산하고, 2일간 만들 전체 구조를 확정합니다.
모델 선택과 GPU 용량 산정
“GPU 1대로 몇 명까지 받을 수 있나?” — 실무에서 가장 먼저 막히는 질문에 답합니다. 파라미터·컨텍스트·KV 캐시가 VRAM을 어떻게 쓰는지 직접 계산합니다.
런타임 선택과 vLLM 서버 기동
실습Ollama·llama.cpp·vLLM은 목적이 다릅니다. PoC와 프로덕션의 갈림길을 이해하고, 제공되는 GPU에 vLLM을 직접 올립니다.
OpenAI 호환 API와 스트리밍 서빙
기존 OpenAI 코드를 그대로 우리 서버로 돌리는 원리를 뜯어봅니다. 스트리밍(SSE) 응답의 실제 형식까지 확인합니다.
성능 측정과 동시성 한계 찾기
실습“빠르다/느리다”를 지표로 바꿉니다. TTFT·처리량을 측정하고, 동시 요청을 늘려가며 우리 GPU의 한계선을 직접 찾습니다.
모델·양자화 선택과 1일차 리포트
측정 데이터를 의사결정 문서로 만듭니다. 양자화·모델을 비교해 “왜 이 조합인가”와 “GPU 1대로 몇 명”에 답합니다.
각 교시에서 정확히 무엇을 배우고, 끝나면 무엇을 할 수 있는지 상세히 정리했습니다.
전체 커리큘럼 상세 보기오프라인 강의의 장점, 바로 전문가에게 묻습니다
녹화 영상(VOD)은 한 방향입니다. 이 과정은 오프라인 실시간으로 진행되어, 내 환경과 실무 상황에 딱 맞는 질문을 그 자리에서 묻고 바로 답을 들을 수 있습니다.
VOD는 되묻지 못합니다.
사람은 답합니다.
설치가 안 되고, 내 GPU에선 안 돌고, 우리 회사 환경엔 어떻게 적용할지 — 영상은 멈춰 서서 기다려주지 않습니다. 현장에서는 손만 들면 됩니다.
라이브로 배우고, 복습용 온라인 보조 영상으로 다시 봅니다. 양방향 수업과 반복 학습을 모두 가져갑니다.
실시간 질의응답
막히는 순간 바로 질문하고 즉시 답을 듣습니다. 설치 에러·모델 선택·VRAM 같은 실무 변수를 그 자리에서 해결합니다.
내 상황에 맞춘 답변
“우리 회사 환경에선 어떻게 적용하죠?” 같은 맥락 질문에 전문가가 직접, 구체적으로 대응합니다.
현장 코드 디버깅
실습 중 발생하는 에러를 강사가 옆에서 함께 잡아줍니다. 혼자 헤매며 시간을 버리지 않습니다.
실전 경험을 바탕으로, 직접 가르칩니다
글로벌 상위권 언어모델을 직접 만들고, 실무 현장에서 AI 프로젝트를 리드한 기술회사 대표가 직접 강의합니다.
이강훈
강사 · Lead
연구와 현업, 그리고 교육을 동시에 해 온 강사입니다. 모델을 만들어 본 사람만 아는 실전 감각을, 가르쳐 본 사람만 아는 전달력으로 풀어냅니다.
글로벌 언어모델 랭킹 7위
오픈 LLM 평가에서 글로벌 7위에 오른 모델을 직접 개발했습니다.
한국어 파운데이션 오픈소스 LLM 공개
한국어 파운데이션 모델을 오픈소스로 공개해 생태계에 기여했습니다.
다수의 RAG · 온프레미스 프로젝트 수행
기업 환경에서 검색증강생성·사내 LLM 서빙 프로젝트를 다수 진행했습니다.
마이스터고등학교 언어모델 전문강사
AI·LLM·RAG·에이전트를 현장에서 가르쳐 온, 검증된 교수 역량을 갖췄습니다.
이런 개발자에게 정확히 맞습니다
일반 사용자 대상의 AI 활용 교육이 아니라, SW 개발자를 위한 실습형 과정입니다.
- Ollama로 띄워는 봤지만, 동시 요청·성능·운영까지는 가본 적 없는 개발자
- 사내 LLM 도입 검토를 맡아 GPU 사양·비용 근거가 필요한 엔지니어
- OpenAI API를 쓰다 비용·보안 문제로 자체 서빙을 검토 중인 백엔드 개발자
- 온프레미스·사내망·폐쇄망 AI 서비스를 설계해야 하는 분
- AI 인프라·플랫폼 엔지니어로 역할을 확장하려는 분
- 설명 가능한 온프레미스 아키텍처 포트폴리오가 필요한 분
알고 있으면 좋은 것
딥러닝 모델을 직접 학습해 본 경험은 필요하지 않습니다.
이번 과정에서 다루지 않는 것
- —LLM 파인튜닝
- —대규모 모델 학습
- —RAG 문서 챗봇 심화
- —벡터DB 심화
- —딥러닝 수학 이론
2일 집중 과정으로 서빙·연결 구조에 집중합니다. 위 주제는 후속 심화 과정에서 다룹니다.
소수 정예, 선착순 마감입니다
정가 490,000원. 각 기수는 소수 정예 정원으로 운영되며, 정원이 마감되면 해당 기수 신청이 조기 종료됩니다.
각 기수는 소수 정예 정원으로 운영됩니다. 정원이 마감되면 해당 기수 신청이 조기 종료되니, 원하는 기수를 먼저 확보하세요.
카드 결제는 즉시 신청 완료 · 계좌이체는 폼 작성 후 안내드립니다
수강료에 포함된 것
- 오프라인 2일 집중 실습 (총 12시간)
- 실습용 GPU(Runpod) 제공 — 학습비 포함
- 복습용 온라인 강의 보조 영상 제공
- 실습 코드 · 예제 · 설정 가이드
- 온프레미스 LLM 서빙 아키텍처 자료
- 수료 후 후속 학습 로드맵 안내
기업 단체 신청 및 세금계산서·견적서 발행이 가능합니다. 신청 폼에 사업자 정보와 인원을 함께 적어주세요.
신청은 폼 작성, 결제는 계좌이체
복잡한 절차 없이 세 단계로 신청이 끝납니다. 결제 계좌 정보는 신청 폼 안에서 안내됩니다.
- 01
수강 신청 폼 작성
아래 버튼을 누르면 수강 신청 폼이 열립니다. 성함·연락처·희망 차수 등 안내에 따라 입력해 주세요.
- 02
계좌이체로 결제
신청 폼 안내에 적힌 계좌로 수강료를 입금합니다. 입금자명은 신청자 성함과 동일하게 적어주세요.
- 03
신청 확정
입금이 확인되면 수강이 확정되고, 준비 안내(설치 목록 등)를 메일로 보내드립니다.
- 수강 신청 폼 열기
입금 계좌
입금자명은 신청자 성함과 동일하게 기재해 주세요.
수강 유의사항
- 본 과정은 오프라인 실습 중심으로 진행되며, 복습을 위한 온라인 강의 보조 영상이 별도로 제공됩니다.
- 강의 현장의 녹화·녹음 및 화면 촬영은 정중히 제한됩니다.
- 제공되는 강의 자료·예제 코드·보조 영상의 외부 공유 및 재배포를 금합니다.
- 보조 영상은 수강생 본인에 한해 열람할 수 있으며, 계정·링크 공유는 허용되지 않습니다.
자주 묻는 질문
네. 이 과정은 “띄우기”가 아니라 “서빙”에 집중합니다. 동시 요청을 받으면 처리량이 어떻게 변하는지(Continuous Batching), KV 캐시로 GPU 1대에 몇 명을 받을 수 있는지, TTFT·처리량을 어떻게 측정하고 방어하는지, 사내에 올릴 때 인증·레이트리밋·관측성은 무엇이 필요한지 — 데모와 서비스 사이의 간격을 메우는 내용입니다.
2교시에서 직접 계산합니다. 파라미터 수와 정밀도로 가중치 VRAM을, 컨텍스트 길이와 동시 요청 수로 KV 캐시를 계산해 “목표 동시 사용자 수 → 필요 VRAM/GPU 사양”을 도출합니다. 1교시의 TCO 손익분기 계산과 묶으면 사내 도입 제안에 바로 쓸 수 있습니다.
네. 수업에서는 실습용 GPU(Runpod)를 제공하며 비용은 학습비에 포함됩니다. 따라서 GPU가 없는 노트북이어도 vLLM·중형 모델을 포함한 GPU 실습을 동일하게 진행할 수 있습니다. 별도의 GPU 구매나 클라우드 결제는 필요하지 않습니다.
네, 실습형 과정이라 개인 노트북 지참을 권장합니다. 사전 준비 안내는 신청 확정 후 메일로 보내드립니다.
AI 바이브코딩, 터미널·REST API에 대한 기본 이해가 있으면 충분합니다. 딥러닝 모델을 직접 학습해 본 경험은 필요하지 않습니다.
가능합니다. 2인 이상 단체 신청과 세금계산서·견적서 발행을 지원합니다. 신청 메일에 사업자 정보와 인원을 함께 적어 보내주시면 안내해 드립니다.
이메일로 신청해 주시면 안내 메일과 함께 계좌 정보를 보내드리고, 계좌이체로 결제가 완료되면 수강이 확정됩니다.
과정 시작 3일 전까지는 전액 환불됩니다. 이후 일정에 따라 부분 환불이 적용되며, 자세한 규정은 신청 안내 메일에서 확인하실 수 있습니다.
AI를 쓰는 개발자에서, AI를 만드는 개발자로
이틀이면, 내 서버 위에서 작동하는 AI를 만들 수 있습니다
오프라인 2일 집중 · 총 12시간 · 소수 정예로 진행됩니다. 정원이 차면 마감되니, 원하는 차수를 먼저 확보하세요.