본문으로 건너뛰기

103개 문서가 "eks" 태그에 분류되었습니다

모든 태그 보기

AgentCore 하이브리드 전략

Bedrock AgentCore 매니지드 서비스와 EKS 기반 self-hosted 에이전트를 결합한 하이브리드 전략 의사결정·패턴 카탈로그

Agentic AI Platform

Agentic AI 플랫폼의 아키텍처, 구축, 운영에 대한 심화 기술 문서

AI Agent 모니터링 및 운영

Langfuse 기반 Agent 모니터링 운영 전용 문서 — 모니터링 아키텍처·핵심 메트릭·PromQL·알림·비용 추적 (도구 비교는 LLMOps Observability 문서 참조)

AWS Nitro 아키텍처와 성능 튜닝

AWS Nitro System의 구성 요소와 v2~v6 세대별 네트워크 변경 사항, 그리고 EKS 노드에서 요구되는 ENA 드라이버·커널 버전과 PPS/CPS 중심 성능 튜닝 전략을 다룹니다.

CIDR 설계와 대역 최소화

EKS Hybrid Nodes의 IP 대역 설계 베스트 프랙티스 — 라우팅 요건 판정 절차, VPC 최소 사이징 산정 근거, 컨트롤 플레인 ENI 전용 서브넷 전략, Pod CIDR 선제 확보, 멀티 환경 주소 계획을 다룹니다.

CNI 구성과 Pod CIDR 라우팅

EKS Hybrid Nodes의 CNI 선택 기준과 Cilium 핵심 구성 — 하이브리드 노드 전용 affinity, cluster-pool IPAM, Pod CIDR 라우팅 방식(BGP·정적·Gateway) 선택과 Cilium BGP Control Plane 구성 절차를 다룹니다.

Control Plane & 확장

EKS Control Plane 동작 원리, CRD 스케일링 전략, 멀티 클러스터 고가용성 아키텍처

East-West 트래픽 최적화: 성능과 비용의 균형

EKS에서 서비스 간 통신(East-West)의 지연시간을 최소화하고 크로스-AZ 비용을 절감하는 심층 최적화 전략. Topology Aware Routing, InternalTrafficPolicy부터 Cilium ClusterMesh, AWS VPC Lattice, Istio 멀티클러스터까지

EKS Best Practices

Amazon EKS 프로덕션 운영을 위한 네트워크, Control Plane, 보안, 비용 최적화 종합 가이드

EKS GPU 노드 전략

EKS Auto Mode, Karpenter, MNG, Hybrid Node의 GPU 워크로드별 최적 노드 전략

EKS Hybrid Nodes Best Practices

Amazon EKS Hybrid Nodes 도입·운영을 위한 베스트 프랙티스 레퍼런스 가이드. 개념·아키텍처부터 네트워킹, 보안·인증, 스토리지·레지스트리, GPU, 운영·비용까지 6개 영역을 다룹니다.

EKS Hybrid Nodes 개념과 동작 원리

Amazon EKS Hybrid Nodes의 정의·사용 사례·요금 모델부터 nodeadm 등록 흐름, RemoteNodeNetwork/RemotePodNetwork 네트워킹 구조, 트래픽 흐름, 주요 기술 특징까지 다룹니다.

EKS Hybrid Nodes 공유 파일 스토리지 솔루션

EKS Hybrid Nodes 환경에서 공유 파일 스토리지 구현을 위한 포괄적 가이드로, AWS 관리형 서비스, 엔터프라이즈 스토리지 통합 및 Amazon Linux 2023 대체 접근법을 다룹니다.

EKS Node Monitoring Agent

AWS EKS 클러스터의 노드 상태를 자동으로 감지하고 보고하는 Node Monitoring Agent의 아키텍처, 배포 전략, 제한사항, 모범 사례를 다룹니다.

EKS 디버깅 가이드

Amazon EKS 환경에서 애플리케이션 및 인프라 문제를 체계적으로 진단하고 해결하기 위한 종합 트러블슈팅 가이드

EKS 멀티클러스터 East-West 통신 — Istio는 여전히 유효한가

EKS 멀티클러스터 환경의 East-West(서비스 간) 통신을 위해 Istio 멀티클러스터, Cilium ClusterMesh, Amazon VPC Lattice 아키텍처를 기능·안정성·운영편의성·비용 4개 축으로 비교하고, 각 아키텍처가 적합한 환경과 Istio 마이그레이션 경로를 제시합니다

GitOps 기반 EKS 클러스터 운영

대규모 EKS 클러스터의 안정적인 운영을 위한 GitOps 아키텍처, KRO/ACK 활용 방법, 멀티클러스터 관리 전략 및 자동화 기법을 다룹니다.

GPU 리소스 관리

EKS에서 Karpenter, KEDA, DRA를 활용한 GPU 리소스 관리 및 비용 최적화

GPU 스케줄링과 클라우드 폴백

EKS Hybrid Nodes GPU 노드의 자원 격리(taint) 설계, 하이브리드 전용 NVIDIA Device Plugin 배포, Karpenter 기반 클라우드 GPU 폴백 NodePool 구성으로 고가용성 GenAI 추론 계층을 설계합니다.

Harbor 2.15와 EKS Hybrid Nodes 통합 가이드

Harbor 2.15 프라이빗 컨테이너 레지스트리를 Amazon EKS Hybrid Nodes (Kubernetes 1.33)와 통합하기 위한 완전한 단계별 가이드로, 설치, SSL/TLS 구성, 인증 및 문제 해결을 다룹니다.

Hybrid Nodes Gateway 구축과 운영

Amazon EKS Hybrid Nodes Gateway의 동작 메커니즘부터 Cilium VTEP 재구성, Helm 설치, 인스턴스 사이징, failover·모니터링·제거까지 구축과 운영 전 과정을 다룹니다.

Inference Optimization on EKS

LLM Inference 성능을 극대화하는 EKS 아키텍처 개요 — vLLM, KV Cache-Aware Routing, Disaggregated Serving, LWS 멀티노드, GPU 오토스케일링의 시작점

LLMOps Observability 비교 가이드

LLMOps Observability 도구 비교 전용 문서 — Langfuse·LangSmith·Helicone·CloudWatch 선택 기준과 하이브리드 아키텍처 (Langfuse 운영은 Agent 모니터링 문서 참조)

가속 컴퓨팅 인프라

EKS GPU 노드 전략, Karpenter·KEDA·DRA 리소스 관리, NVIDIA GPU 스택, AWS Neuron 스택 — GPU·AWS 커스텀 가속기를 포괄하는 가속 컴퓨팅 계층

개요 & 아키텍처

EKS Hybrid Nodes의 개념·동작 원리·주요 기술 특징과 연결·토폴로지·Pod CIDR 노출·CNI·인증·워크로드 노출 6가지 설계 결정 가이드를 다룹니다.

관측성 통합 — 자가진단·Container Insights·eBPF

EKS Hybrid Nodes 관측성 구현 가이드 — Cluster Insights 구성 자가진단, CloudWatch Container Insights 하이브리드 구성(RUN_WITH_IRSA), NVIDIA GPU 메트릭 통합, Cilium Hubble 기반 eBPF 대시보드, Network Flow Monitor 적용성 분석을 다룹니다.

기능별 구현 쿡북: 6개 Gateway API 구현체

인증·Rate Limiting·IP 제어·URL Rewrite·헤더 조작·세션 어피니티·본문 크기 제한·커스텀 에러 페이지를 AWS LBC·Cilium·NGINX GF·Envoy Gateway·kGateway별 YAML로 구현하는 레퍼런스

네트워크 & 성능 최적화

EKS 환경에서의 DNS 최적화, East-West 트래픽, Gateway API 도입 등 네트워크 및 성능 관련 베스트 프랙티스

네트워킹

EKS Hybrid Nodes 네트워킹 베스트 프랙티스 — CIDR 설계와 대역 최소화, CNI 구성과 Pod CIDR 라우팅, Hybrid Nodes Gateway 구축·운영, 로드밸런싱과 서비스 노출, 방화벽 사전 등록과 TGW 토폴로지를 다룹니다.

네트워킹 디버깅

EKS 네트워킹 문제 진단 및 해결 가이드 - VPC CNI, DNS, Service, NetworkPolicy

노드 인증 방식 — SSM vs IAM Roles Anywhere

EKS Hybrid Nodes의 IAM 자격 증명 공급자 선택 가이드 — SSM hybrid activation과 IAM Roles Anywhere 비교, Vault PKI 연동 패턴, Hybrid Nodes IAM role 최소 권한, 자격 증명 수명주기 관리를 다룹니다.

로드밸런싱과 서비스 노출

EKS Hybrid Nodes 워크로드의 외부 노출 설계 — 트래픽 발원지 기준 NLB vs Cilium 내장 LB 결정 원칙, AWS Load Balancer Controller 구성 요건, Cilium LB IPAM·BGP 광고, MetalLB 등 커뮤니티 옵션을 다룹니다.

모델 서빙 & 추론 인프라

GPU 인프라·추론 프레임워크·추론 최적화 계층 안내와, LLM 추론 요청 경로 전체의 계층별 튜닝 레버(인퍼런스 게이트웨이·prefill/decode 분리·KV cache-aware 라우팅·LMCache·캐시 히트 전략)를 한 장의 지도로 정리

방화벽·DNS 사전 등록과 TGW 토폴로지

EKS Hybrid Nodes 도입 시 방화벽·네트워크 조직에 제출할 5존 사전 등록 룰 표, FQDN 와일드카드 미지원 환경 대응, Transit Gateway 토폴로지와 온프레미스 LB 경로 설계를 다룹니다.

보안 & 거버넌스

EKS API Server 인증/인가, Identity-First 보안, 정책 관리, 공급망 보안, 위협 탐지, 컴플라이언스까지 EKS 보안 거버넌스 베스트 프랙티스

보안 & 인증

EKS Hybrid Nodes의 노드 인증 방식(SSM hybrid activation vs IAM Roles Anywhere)과 자격 증명 수명주기 관리를 다룹니다.

사설 폐쇄망 VPC 엔드포인트 설계

인터넷이 차단된 사설 폐쇄망에서 EKS Hybrid Nodes를 운영하기 위한 VPC 엔드포인트 설계 — Private API 엔드포인트 모드, 용도별 인터페이스 엔드포인트 매핑, S3 Gateway, 온프레미스 DNS 해석 경로를 다룹니다.

설계 & 아키텍처

Agentic AI 플랫폼의 아키텍처 설계, 기술적 도전과제, AWS Native 및 EKS 기반 구현 접근

스토리지 & 레지스트리

EKS Hybrid Nodes 환경의 공유 파일 스토리지(EFS·FSx·NFS) 솔루션과 Harbor 프라이빗 컨테이너 레지스트리 통합을 다룹니다.

스토리지 디버깅

EKS 스토리지 문제 진단 및 해결 가이드 - EBS/EFS CSI Driver, PVC 마운트 실패

아키텍처 결정 가이드

EKS Hybrid Nodes 도입 시 확정해야 하는 6가지 설계 결정 — 하이브리드 연결, 클러스터 토폴로지, Pod CIDR 노출, CNI·라우팅, 노드 인증, 워크로드 노출 — 의 판단 기준과 결정 간 의존 관계를 다룹니다.

업그레이드와 수명주기 관리

EKS Hybrid Nodes의 Kubernetes 버전 업그레이드 전략 — nodeadm upgrade 동작 원리, 수동 cordon·drain 의무, SSM 서명 키 만료 대응(nodeadm 1.0.19+), 폐쇄망 사설 미러 구성, 업그레이드 런북을 다룹니다.

오픈 웨이트 모델 자동 배포·관리 파이프라인 아키텍처

HuggingFace 리더보드 스캔부터 벤치마크 재현, 인스턴스별 성능 프로파일링, 멀티 타깃 배포 가이드 생성, 글로벌 스팟 캐파 확보까지 — 오픈 웨이트 모델 온보딩을 7단계 파이프라인으로 자동화하고 사람은 승인 게이트에만 개입하는 아키텍처를 제시합니다

오픈웨이트 모델 배포 가이드

토큰 이코노믹스와 데이터 주권 관점에서 오픈웨이트 LLM 자체 배포를 평가하고 결정하기 위한 고객용 의사결정 가이드

운영 & 비용

EKS Hybrid Nodes의 Mixed Mode 운영 패턴, Cluster Insights 구성 검증, 모니터링, vCPU-시간 과금 기반 비용 최적화를 다룹니다.

운영 & 안정성

EKS 클러스터의 안정적인 운영을 위한 GitOps, 장애 진단, 고가용성, Pod 라이프사이클 관리 베스트 프랙티스

운영과 비용 최적화

EKS Hybrid Nodes의 운영 베스트 프랙티스 — Mixed Mode 워크로드 배치, Cluster Insights·nodeadm debug 구성 검증, 모니터링 체계, vCPU-시간 티어드 과금 기반 비용 최적화를 다룹니다.

워크로드 디버깅

EKS 워크로드 문제 진단 및 해결 가이드 - Pod 상태별 디버깅, 배포 실패 패턴, Probe 설정

컴퓨트 & GPU

EKS Hybrid Nodes의 GPU 워크로드 아키텍처와 DGX H200 SR-IOV·InfiniBand 고성능 네트워킹 구성을 다룹니다.

하이브리드 GPU 워크로드와 SR-IOV 네트워킹

EKS Hybrid Nodes에서 온프렘 GPU 노드를 1차 추론 계층으로 활용하고, DGX H200 SR-IOV VF 이름 불일치 문제를 드라이버 호환성·영구 명명·systemd 오케스트레이션으로 해결하는 실전 가이드