---
title: "가속 컴퓨팅 인프라"
description: "EKS GPU 노드 전략, Karpenter·KEDA·DRA 리소스 관리, NVIDIA GPU 스택, AWS Neuron 스택 — GPU·AWS 커스텀 가속기를 포괄하는 가속 컴퓨팅 계층"
domain: agentic-ai-platform
tags: [gpu, eks, karpenter, gpu-operator, neuron]
created: 2026-04-17
updated: 2026-07-19
source_url: https://devfloor9.github.io/engineering-playbook/docs/agentic-ai-platform/model-serving/gpu-infrastructure
---

Kubernetes 위에서 **어떤 가속 인스턴스를 · 어떻게 스케줄링하고 · 어떤 드라이버·파티셔닝 스택으로 관리할지** 를 다루는 계층입니다. NVIDIA GPU 뿐 아니라 AWS 커스텀 가속기(Trainium/Inferentia)까지 포괄합니다. 이 계층이 확립되어야 상위의 추론 프레임워크(vLLM·llm-d 등)가 안정적으로 돌아갑니다.

:::tip 선택 가이드
NVIDIA 중심이면 **노드 전략 → 리소스 관리 → NVIDIA 스택**, AWS 실리콘(Trainium/Inferentia) 을 고려한다면 **노드 전략 → Neuron 스택** 으로 이어 읽으세요.
:::

## 관련 문서

- [EKS 디버깅 — GPU·AI 워크로드](https://devfloor9.github.io/engineering-playbook/docs/eks-best-practices/operations-reliability/eks-debugging/gpu-ai-workload) — GPU 노드·드라이버·DCGM 트러블슈팅 플레이북
- [vLLM 모델 서빙](../inference-frameworks/vllm-model-serving.md) — 상위 추론 엔진 계층
- [llm-d EKS Auto Mode](../inference-frameworks/llm-d-eks-automode.md) — Disaggregated Serving·Auto Mode 사례
