Inference Optimization on EKS
개요
프로덕션 LLM 서비스에서 Inference 비용은 전체 AI 운영 비용의 80-90% 를 차지합니다 (AWS 공식 문구 "up to 90% of overall operational costs for machine learning initiatives"). 학습은 1회성이지만 추론은 서비스가 살아있는 한 24/7 지속되기 때문입니다. GPU 시간이 곧 비용이며, p5.48xlarge(H100×8) 한 대의 On-Demand 가격은 2025년 6월 가격 인하 후 시간당 $55.04입니다. 월 2대 운영 시 약 $79,258에 달합니다.
이 문서는 통신사 Agentic AI 플랫폼 구축 과정에서 축적된 교훈과 GLM-5(744B), Kimi K2.5(1T) 등 대형 MoE 모델 배포 사례를 기반으로, EKS 위에서 LLM Inference 성능을 극대화하는 아키텍처 패턴을 정리합니다.
다루는 내용
본 카테고리는 추론 최적화 심화 문서와 게이트웨이 라우팅 문서로 구성됩니다. 전체 구조와 계층별 튜닝 레버의 지도는 추론 인프라 개요를 먼저 참조하세요.
📄️ KV Cache 최적화 (vLLM Deep Dive + Cache-Aware Routing)
vLLM PagedAttention·Continuous Batching·FP8 KV Cache 등 핵심 기술과 llm-d/Dynamo의 KV Cache-Aware Routing 비교
📄️ Disaggregated Serving + LWS 멀티노드
Prefill/Decode 분리 아키텍처, NIXL KV 전송, LeaderWorkerSet 기반 700B+ 대형 모델 멀티노드 배포
📄️ LMCache: KV 캐시 오프로딩과 공유
GPU 메모리 너머 CPU·디스크로 KV 캐시를 오프로딩하고 인스턴스 간 공유하는 KV 캐시 계층, vLLM·NIXL·kvaware 라우팅과의 관계
📄️ 캐시 히트 전략
KV/Prefix·Prompt·Semantic 3계층 캐시를 하나의 의사결정 프레임으로 통합, 계층별 히트율 목표와 측정 지점
📄️ Semantic Caching 전략
LLM Gateway 레벨 의미 기반 캐싱 설계 원칙 — 유사도 임계값, 캐시 키 설계, 멀티테넌시, 관측성
📄️ 티어드 게이트웨이 아키텍처
Tier 1 Ingress, Tier 2 추론 라우팅·LLM API 게이트웨이, Agent Data Plane의 역할 구분과 채움 전략
📄️ 라우팅 전략 (Cascade·Semantic·Inference Extension)
kgateway·Bifrost·LiteLLM 비교, Request Cascading 지능형 모델 라우팅, Gateway API Inference Extension(EPP)
📄️ GPU 오토스케일링과 대형 모델 배포 운영
2-Tier 오토스케일링(KEDA·Karpenter), DRA 호환성, 대형 MoE(GLM-5·Kimi K2.5) 배포 실전 교훈
문서별 핵심 주제
- EKS GPU 인프라 전략 — Auto Mode vs Karpenter vs MNG 선택 기준 (본 문서)
- 모델 서빙 엔진 — vLLM 핵심 기술과 GPU 메모리 설계 (KV Cache 최적화)
- KV Cache-Aware Routing — llm-d와 NVIDIA Dynamo 비교 (KV Cache 최적화)
- Disaggregated Serving — Prefill/Decode 분리 아키텍처 (Disaggregated Serving)
- LWS 멀티노드 서빙 — LeaderWorkerSet 기반 700B+ 모델 배포 (Disaggregated Serving)
- GPU 오토스케일링 — 2-Tier 스케일링(KEDA·Karpenter)과 DRA 호환성 (오토스케일링 & 배포 운영)
- 대형 모델 배포 실전 교훈 — 모델 다운로드 실패 대응, MoE 배포 함정 (오토스케일링 & 배포 운영)
핵심 성능 지표
| 지표 | 설명 | 최적화 목표 |
|---|---|---|
| TTFT (Time to First Token) | 첫 토큰 생성까지의 시간 | < 2초 (대화형), < 5초 (배치) |
| TPS (Tokens per Second) | 초당 토큰 생성 속도 | 모델별 상이 |
| GPU Utilization | GPU 연산 활용률 | > 70% |
| KV Cache Hit Rate | KV 캐시 재사용 비율 | > 60% (공유 프롬프트) |
| P99 Latency | 99 퍼센타일 응답 시간 | SLO 기준 준수 |