NVIDIA GPU 스택
2026-03-20 작성2026-07-19 수정21분 읽기
NVIDIA GPU 소프트웨어 스택은 Kubernetes 환경에서 GPU를 운영하기 위한 계층 구조로 구성됩니다.
| 계층 | 역할 | 핵심 컴포넌트 |
|---|---|---|
| 인프라 자동화 | GPU 드라이버, 런타임, 플러그인을 선언적으로 관리 | GPU Operator (ClusterPolicy CRD) |
| 모니터링 | GPU 상태 수집 및 Prometheus 메트릭 노출 | DCGM, DCGM Exporter |
| 파티셔닝 | 단일 GPU를 여러 워크로드가 공유 | MIG, Time-Slicing |
| 추론 최적화 | 데이터센터 규모 LLM 서빙 | Dynamo, KAI Scheduler |
이 문서는 각 컴포넌트의 아키텍처와 설계 판단 기준을 다룹니다. GPU 노드 프로비저닝(Karpenter), 스케일링(KEDA), 비용 최적화는 GPU 리소스 관리를 참조하세요.