문서
카테고리
단어
분 읽기
관련 카테고리: "genai-aiml", "performance-networking", "hybrid-multicloud"
EKS GPU 노드 전략, Karpenter·KEDA·DRA 리소스 관리, NVIDIA GPU 스택, AWS Neuron 스택 — GPU·AWS 커스텀 가속기를 포괄하는 가속 컴퓨팅 계층
llm-d 아키텍처 개념, KV Cache-aware 라우팅, Disaggregated Serving, EKS Auto Mode 통합 전략
LLM 서빙을 위한 2-Tier GPU 오토스케일링(KEDA·Karpenter)·DRA 호환성과 대형 MoE 모델(GLM-5·Kimi K2.5) 배포에서 축적된 실전 운영 교훈
HuggingFace 리더보드 스캔부터 벤치마크 재현, 인스턴스별 성능 프로파일링, 멀티 타깃 배포 가이드 생성, 글로벌 스팟 캐파 확보까지 — 오픈 웨이트 모델 온보딩을 7단계 파이프라인으로 자동화하고 사람은 승인 게이트에만 개입하는 아키텍처를 제시합니다
EKS에서 Pod IP가 서브넷·NAU·branch ENI 한도를 어떻게 소비하는지 계산하고, Karpenter의 인스턴스 크기 fallback이 IP 고갈로 이어지는 조건을 NodePool과 VPC CNI 설정으로 미리 막는 방법을 정리합니다.
Amazon EKS의 비용 할당과 최적화를 위한 FinOps 가이드. SCAD·CUR 2.0, Karpenter v1.13, 태깅, 컨테이너별 Rightsizing과 ROI 검증을 설명합니다.
Karpenter v1.13과 EKS Auto Mode의 노드 공급, 확장 신호, 준비 상태 및 비용 검증 가이드
EKS Hybrid Nodes GPU 노드의 자원 격리(taint) 설계, 하이브리드 전용 NVIDIA Device Plugin 배포, Karpenter 기반 클라우드 GPU 폴백 NodePool 구성으로 고가용성 GenAI 추론 계층을 설계합니다.