가속 컴퓨팅 인프라
2026-04-17 작성2026-07-19 수정4분 읽기
Kubernetes 위에서 어떤 가속 인스턴스를 · 어떻게 스케줄링하고 · 어떤 드라이버·파티셔닝 스택으로 관리할지 를 다루는 계층입니다. NVIDIA GPU 뿐 아니라 AWS 커스텀 가속기(Trainium/Inferentia)까지 포괄합니다. 이 계층이 확립되어야 상위의 추론 프레임워크(vLLM·llm-d 등)가 안정적으로 돌아갑니다.
선택 가이드
NVIDIA 중심이면 노드 전략 → 리소스 관리 → NVIDIA 스택, AWS 실리콘(Trainium/Inferentia) 을 고려한다면 노드 전략 → Neuron 스택 으로 이어 읽으세요.
관련 문서
- EKS 디버깅 — GPU·AI 워크로드 — GPU 노드·드라이버·DCGM 트러블슈팅 플레이북
- vLLM 모델 서빙 — 상위 추론 엔진 계층
- llm-d EKS Auto Mode — Disaggregated Serving·Auto Mode 사례