AI INFRASTRUCTURE · 12 CONNECTED COURSES
AI 인프라를
직접 운영하는 신입사원 과정
서버 한 대의 기준선부터 데이터센터·GPU·Kubernetes·모델 서빙·장애 대응과 인수인계까지, 설계와 구축을 운영 증거로 연결합니다.
LEARNING ROADMAP
이해·설계·구축·운영·복구가 한 흐름으로 이어집니다
12개 공개 과정 모두 완결된 본문, 직접 해보는 판단 활동, 선택지별 해설과 공식 출처를 제공합니다.
- 01본문·실습 공개
AI 데이터센터의 큰 그림
랙·전력·냉각·서버·network·storage·GPU와 AI service가 하나의 failure domain으로 연결되는 구조를 배웁니다.
- 02본문·실습 공개
Ubuntu 24.04 서버 운영
설치 첫 화면부터 파일·사용자·권한·패키지·systemd·네트워크·저장장치를 이어서 배우고 변경 전후의 증거로 서버 상태를 판정합니다.
- 03본문·실습 공개
인터커넥트와 AI 패브릭
server 내부 bus부터 Ethernet·InfiniBand·RDMA와 scale-out fabric까지 연결하고 링크 상태를 증거로 인수합니다.
- 04본문·실습 공개
GPU 하드웨어와 호스트 준비
GPU 서버를 입고 검수하고 firmware·driver·CUDA 관계를 확인한 뒤 안전한 기준선과 rollback 절차를 만듭니다.
- 05본문·실습 공개
AI 스토리지
dataset·checkpoint·model artifact의 throughput·IOPS·latency·metadata 요구를 storage 계층과 복구 시험으로 연결합니다.
- 06본문·실습 공개
컨테이너와 레지스트리
OCI image와 container runtime을 이해하고 재현 가능한 build·SBOM·서명·registry·폐쇄망 반입을 운영합니다.
- 07본문·실습 공개
Kubernetes와 K3s
container workload를 declarative state로 배포하고 단일·다중 node cluster의 network·storage·failure를 진단합니다.
- 08본문·실습 공개
GPU 플랫폼
Kubernetes가 GPU를 발견·할당하는 구조와 GPU sharing·MIG·distributed workload의 검증 경계를 배웁니다.
- 09본문·실습 공개
운영과 보안
RBAC·secret·backup·restore·upgrade·patch·policy를 변경 관리와 recovery evidence로 연결합니다.
- 10본문·실습 공개
관측성과 장애 대응
사용자 SLO를 metric·log·trace·event와 연결하고 evidence-first incident response와 postmortem을 수행합니다.
- 11본문·실습 공개
AI 모델 서빙
model artifact와 runtime에서 GPU 배치·API·보안·성능·capacity·안전한 rollout까지 production serving 경로를 완성합니다.
- 12본문·실습 공개
AI 인프라 종합 프로젝트
요구사항을 설계로 바꾸고 구축·인수·장애 주입·복구·운영·인수인계를 하나의 evidence package로 완성합니다.