<aside> 🚧

진행 중 프로젝트

Kubernetes 기반에서 LLM 서빙을 운영하고, 장애·부하·GPU 상태를 관측하는 AI 인프라 포트폴리오입니다.

</aside>

30초 요약

단순히 LLM API를 실행하는 데서 끝내지 않고, 배포 → 상태 확인 → 장애 재현 → 모니터링 → 복구 확인까지 직접 검증하는 프로젝트입니다. 현재 Mock Backend 기반 운영 검증과 Kubernetes 자동복구, Docker GPU 접근까지 완료했고 실제 vLLM 서빙은 진행 중입니다.

아키텍처 한눈에 보기

실선은 실제 실행으로 검증한 경로이고, 점선은 아직 검증하지 않은 경로입니다.

flowchart LR
    C["Client<br>/v1/chat/completions"] --> G["FastAPI Gateway<br>Docker · kind 2 replicas"]
    G --> MB["Mock Backend<br>VERIFIED"]
    G -.-> V["vLLM<br>Qwen2.5-0.5B-Instruct<br>진행 중"]
    G -->|"/metrics"| P["Prometheus"]
    P --> GF["Grafana<br>Request Rate · P95 · Error Rate"]
    GPU["RTX 4060"] -.->|"DCGM Exporter<br>NOT VERIFIED"| P
    V -.-> GPU

STAR 요약

S · Situation

LLM API를 단순 실행하는 것만으로는 실제 AI 인프라 운영 역량을 보여주기 어려웠습니다. 배포 이후의 상태 확인, 장애 재현, 모니터링과 복구까지 직접 검증할 수 있는 환경이 필요했습니다.

T · Task

FastAPI Gateway와 LLM Backend를 컨테이너·Kubernetes 환경에서 운영하고, 정상/장애 상황을 재현해 관측 가능한 지표와 복구 근거를 남기는 것을 과제로 정했습니다. GPU/vLLM 영역은 실제 실행이 확인된 범위만 완료로 표시하기로 했습니다.

A · Action ⭐

R · Result