/온프렘 스쿨
CURRICULUM IN DETAIL

12교시, 무엇을 배우고
무엇을 만들어 나가는가

목차만 보고는 감이 오지 않으실 겁니다. 각 교시가 어떤 실무 문제를 푸는지, 구체적으로 무엇을 배우고, 끝나면 무엇을 할 수 있게 되는지 모두 적었습니다.

오프라인 2일 집중 · 총 12시간5개 교시 실습실습 GPU(Runpod) 제공온라인 보조 영상 제공
request flow · on-premise요청토큰 스트리밍
온프레미스 경계 · 사내 인프라데이터가 이 경계를 벗어나지 않습니다 — 외부 클라우드 API 호출 없음요청OpenAI 호환 APISSE 스트리밍토큰 단위 생성브라우저 · 채팅 UISSE 수신·렌더링백엔드 API인증·타임아웃·중계vLLM · GPU배칭·KV 캐시·추론
1일차

GPU 위에 LLM을 올리고, 성능을 숫자로 증명한다

1교시

온프레미스 도입 판단과 아키텍처 설계

감이 아니라 숫자로 판단합니다. API 토큰 비용과 GPU 서버 비용의 손익분기를 직접 계산하고, 2일간 만들 전체 구조를 확정합니다.

배우는 것

  • 클라우드 API의 실제 한계: 데이터 반출·비용 곡선·모델 단종 리스크
  • API 토큰 비용 vs GPU 서버 TCO — 손익분기점 계산법
  • 온프레미스가 답이 아닌 경우 (도입 판단 체크리스트)
  • 모델 서버·앱 서버·클라이언트 경계와 2일간 만들 전체 아키텍처 확정

이 교시가 끝나면

우리 서비스에 온프레미스가 맞는지 비용 근거로 설명할 수 있습니다.

TCO손익분기아키텍처 경계
2교시

모델 선택과 GPU 용량 산정

“GPU 1대로 몇 명까지 받을 수 있나?” — 실무에서 가장 먼저 막히는 질문에 답합니다. 파라미터·컨텍스트·KV 캐시가 VRAM을 어떻게 쓰는지 직접 계산합니다.

배우는 것

  • 가중치 VRAM 계산: 파라미터 수 × 정밀도(FP16/INT8/INT4)
  • KV 캐시 계산 → 컨텍스트 길이·동시 요청 수가 메모리에 미치는 영향
  • 모델 규모별(7B·8B·14B·32B) GPU 사양 매핑
  • 한국어 성능과 라이선스(상업적 이용) 확인 포인트

이 교시가 끝나면

목표 동시 사용자 수에 필요한 GPU 사양을 산정할 수 있습니다.

VRAMKV CacheQuantizationContext Length
3교시

런타임 선택과 vLLM 서버 기동

실습

Ollama·llama.cpp·vLLM은 목적이 다릅니다. PoC와 프로덕션의 갈림길을 이해하고, 제공되는 GPU에 vLLM을 직접 올립니다.

배우는 것

  • Ollama·llama.cpp·vLLM의 설계 철학과 최적화 지점 차이
  • 언제 Ollama(PoC·단일 사용자), 언제 vLLM(다중 동시 요청)인가
  • Runpod GPU에 vLLM 기동 + 모델 로딩
  • GPU·드라이버·CUDA·OS별 함정과 모델 캐시·기동 시간 관리

이 교시가 끝나면

GPU 서버에 프로덕션 런타임을 직접 띄울 수 있습니다.

vLLMOllamallama.cppRunpodCUDA
4교시

OpenAI 호환 API와 스트리밍 서빙

기존 OpenAI 코드를 그대로 우리 서버로 돌리는 원리를 뜯어봅니다. 스트리밍(SSE) 응답의 실제 형식까지 확인합니다.

배우는 것

  • /v1/chat/completions 호환의 의미 — 코드 한 줄로 전환
  • SSE 스트리밍 응답의 실제 형식과 파싱 방법
  • temperature·max_tokens·stop 등 파라미터 실무 튜닝
  • 요청→추론→스트리밍 내부 흐름과 클라이언트·서버·런타임 책임 경계

이 교시가 끝나면

기존 API 코드를 로컬 LLM으로 전환하고 스트리밍을 처리할 수 있습니다.

OpenAI-CompatibleSSEStreaming
5교시

성능 측정과 동시성 한계 찾기

실습

“빠르다/느리다”를 지표로 바꿉니다. TTFT·처리량을 측정하고, 동시 요청을 늘려가며 우리 GPU의 한계선을 직접 찾습니다.

배우는 것

  • 핵심 지표: TTFT(첫 토큰) · TPOT(토큰당) · 처리량(tok/s)
  • Continuous Batching이 동시 처리량을 바꾸는 원리
  • 동시 요청을 늘려가며 한계선 찾기 — 부하 테스트

이 교시가 끝나면

우리 GPU가 감당하는 동시 요청 수를 측정으로 확인할 수 있습니다.

TTFTTPOTContinuous BatchingLoad Test
6교시

모델·양자화 선택과 1일차 리포트

측정 데이터를 의사결정 문서로 만듭니다. 양자화·모델을 비교해 “왜 이 조합인가”와 “GPU 1대로 몇 명”에 답합니다.

배우는 것

  • 양자화(AWQ·GPTQ·GGUF) 품질–속도 트레이드오프 비교
  • 소형·중형 모델의 한국어 응답 품질 비교
  • 측정 결과 → 모델·런타임 선택 근거화 + 필요 GPU 산정
  • 사내망 배치 구조와 2일차 서비스 설계 확정

이 교시가 끝나면

서빙 성능 리포트와 2일차 설계도를 손에 쥡니다.

AWQ/GPTQCapacity Planning사내망 배치
2일차

서비스로 붙이고, 운영 가능한 상태로 만든다

1교시

모델 서버와 앱 서버 분리 설계

모델 서버를 그대로 노출하면 안 됩니다. 장애 격리와 경계를 설계하고, 1일차 성능 수치를 서비스 설정에 반영합니다.

배우는 것

  • 왜 앱 서버를 앞에 두는가 — 인증·정책·장애 격리
  • 타임아웃 · 재시도 · 백프레셔 설계
  • 긴 응답과 커넥션 관리 전략
  • 1일차 측정치를 반영한 동시성 설정

이 교시가 끝나면

모델 서버를 안전하게 감싸는 서비스 구조를 설계할 수 있습니다.

TimeoutRetryBackpressure
2교시

AI 백엔드 연동 실전

실습

사용자 입력을 받아 LLM에 넘기고, 토큰을 실시간으로 되돌려주는 백엔드를 직접 만듭니다.

배우는 것

  • 로컬 LLM API 호출 + 스트리밍 중계 구현
  • 에러 처리 · 타임아웃 · 동시 요청 제어
  • 프롬프트/컨텍스트 관리와 토큰 예산 설계
  • 실무에서 자주 터지는 연결 이슈 디버깅

이 교시가 끝나면

스트리밍을 중계하는 AI 백엔드를 완성합니다.

Streaming ProxyToken Budget
3교시

스트리밍 채팅 프론트엔드

실습

첫 토큰이 빨리 보이면 체감 속도가 달라집니다. SSE를 실시간 렌더링하고 중단·에러까지 처리합니다.

배우는 것

  • SSE 수신과 실시간 렌더링 구현
  • 생성 중단·취소, 로딩·에러 상태 처리
  • 첫 토큰 체감 속도(TTFT)와 UX의 관계
  • 채팅형 UI 기본 구조 완성

이 교시가 끝나면

로컬 LLM과 실시간으로 대화하는 화면을 완성합니다.

SSETTFTUX
4교시

운영과 보안 — 사내망 AI 서비스

데모와 운영의 차이를 메웁니다. 인증·레이트리밋·관측성·모델 교체까지, 사내에 올리기 전 점검할 것들.

배우는 것

  • 인증 · 레이트리밋 · 프록시로 모델 서버 보호
  • 관측성: 토큰 사용량 · 큐 대기 · 에러율 로깅
  • 모델 업데이트와 롤백 전략
  • 폐쇄망 · 에어갭 환경 고려사항

이 교시가 끝나면

사내에 올려도 되는 수준의 운영 요건을 점검할 수 있습니다.

Rate LimitObservabilityAir-gap
5교시

ComfyUI 로컬 AI 워크플로우

실습

노드 기반 파이프라인을 개발자 관점에서 이해하고, 로컬 AI 도구를 사내 워크플로우로 확장하는 감을 잡습니다.

배우는 것

  • 노드 기반 AI 워크플로우의 구조 (입력·처리·출력)
  • LLM 서빙과 연결되는 지점
  • 기본 워크플로우 직접 구성
  • 사내 AI 도구로의 확장 가능성

이 교시가 끝나면

로컬 AI 파이프라인을 노드로 구성해 볼 수 있습니다.

ComfyUINode Pipeline
6교시

최종 정리 — 문서화와 실무 적용

만든 것을 설명 가능한 자산으로 만듭니다. 사내 도입 제안과 포트폴리오 양쪽에 쓸 수 있게 정리합니다.

배우는 것

  • 아키텍처 다이어그램 + 벤치마크 리포트 정리
  • 사내 도입 제안 설득 포인트 (보안·비용·성능)
  • GitHub · README 구성 방향
  • 후속 로드맵: RAG · 파인튜닝 · 멀티 GPU 확장

이 교시가 끝나면

온프레미스 LLM 서빙을 문서와 수치로 설명할 수 있습니다.

DocumentationRoadmap
WHAT YOU TAKE HOME

이틀 뒤 손에 남는 것

개념 노트가 아니라, 수치와 문서로 설명 가능한 결과물입니다.

01

프로덕션급 LLM 서빙 환경

vLLM을 GPU에 올려 OpenAI 호환 API로 서빙하는 실행 환경

02

GPU 용량 산정 근거

KV 캐시 계산으로 “GPU 1대에 동시 몇 명”을 도출한 산정표

03

성능 벤치마크 리포트

TTFT·처리량·동시성 한계·양자화 트레이드오프 측정 데이터

04

스트리밍 AI 백엔드

타임아웃·에러·동시 요청 제어까지 반영한 스트리밍 중계 서버

05

실시간 채팅 + ComfyUI

SSE로 토큰이 흐르는 채팅 화면과 노드 기반 로컬 AI 워크플로우

06

사내 도입 제안 문서

벤치마크 근거가 붙은 온프레미스 아키텍처 — 제안·포트폴리오용

커리큘럼이 맞다면, 자리부터 확보하세요

소수 정예 · 선착순 마감 — 1기 2026년 7월 16일(목) – 17일(금) · 2기 2026년 7월 30일(목) – 31일(금)