본문으로 건너뛰기

#gpu

23

문서

3

카테고리

42k

단어

208

분 읽기

관련 카테고리: "genai-aiml", "benchmark", "hybrid-multicloud"

문서 목록

Agentic AI 워크로드 운영 시 직면하는 5가지 핵심 도전과제

Amazon EKS와 오픈소스 생태계를 활용한 Agentic AI 플랫폼 구축 가이드

Agentic AI Platform

Agentic AI Platform

Agentic AI 플랫폼의 아키텍처, 구축, 운영에 대한 심화 기술 문서

GPU checkpoint/restore의 버전별 제약과 EKS graceful drain·warm-start 운영 증거 절차 (Experimental)

EKS Auto Mode, Karpenter, MNG, Hybrid Node의 GPU 워크로드별 최적 노드 전략

EKS에서 Karpenter, KEDA, DRA를 활용한 GPU 리소스 관리 및 비용 최적화

EKS GPU 노드 전략, Karpenter·KEDA·DRA 리소스 관리, NVIDIA GPU 스택, AWS Neuron 스택 — GPU·AWS 커스텀 가속기를 포괄하는 가속 컴퓨팅 계층

GPU Operator, DCGM, MIG, Time-Slicing, Dynamo의 아키텍처와 EKS 통합

GPU 인프라·추론 프레임워크·추론 최적화 계층 안내와, LLM 추론 요청 경로 전체의 계층별 튜닝 레버(인퍼런스 게이트웨이·prefill/decode 분리·KV cache-aware 라우팅·LMCache·캐시 히트 전략)를 한 장의 지도로 정리

llm-d 아키텍처 개념, KV Cache-aware 라우팅, Disaggregated Serving, EKS Auto Mode 통합 전략

Mixture of Experts 모델의 아키텍처 개념, 분산 배포 전략, 성능 최적화 원리

vLLM의 PagedAttention, 병렬화 전략, Multi-LoRA, 하드웨어 지원 아키텍처

LLM 서빙을 위한 2-Tier GPU 오토스케일링(KEDA·Karpenter)·DRA 호환성과 대형 MoE 모델(GLM-5·Kimi K2.5) 배포에서 축적된 실전 운영 교훈

LLM inference 성능을 극대화하는 EKS 아키텍처 개요 — vLLM, KV Cache-Aware Routing, Disaggregated Serving, LWS 멀티노드, GPU 오토스케일링의 시작점

Agentic AI Platform 실전 배포 및 구성 레퍼런스 아키텍처

GLM-5.1 사례 기반 — 대형 오픈소스 모델의 EKS 배포 실전 가이드

GPU·Trainium2·Inferentia2의 공식 사양과 Llama 4 모델 조건, 성능·비용 비교에 필요한 측정 계획

EKS에서 NVIDIA Dynamo의 통합·분리 서빙을 비교하기 위한 하드웨어 조건, 네 가지 워크로드와 측정 계획

EKS에서 GPU/AI 워크로드 디버깅 가이드

Kubernetes DRA의 핵심 모델(DeviceClass·ResourceClaim·ResourceSlice), GPU를 넘어선 리소스 유형(NIC·인터커넥트·FPGA), 도입 판단 기준을 정리한 프레임워크 가이드

EKS Hybrid Nodes GPU 노드의 자원 격리(taint) 설계, 하이브리드 전용 NVIDIA Device Plugin 배포, Karpenter 기반 클라우드 GPU 폴백 NodePool 구성으로 고가용성 GenAI 추론 계층을 설계합니다.

EKS Hybrid Nodes에서 온프렘 GPU 노드를 1차 추론 계층으로 활용하고, DGX H200 SR-IOV VF 이름 불일치 문제를 드라이버 호환성·영구 명명·systemd 오케스트레이션으로 해결하는 실전 가이드

컴퓨트 & GPU

Hybrid Infrastructure

EKS Hybrid Nodes의 GPU 워크로드 아키텍처와 DGX H200 SR-IOV·InfiniBand 고성능 네트워킹 구성을 다룹니다.