본문으로 건너뛰기

13개 문서가 "operations" 태그에 분류되었습니다

모든 태그 보기

AI Agent 모니터링 및 운영

Langfuse 기반 Agent 모니터링 운영 전용 문서 — 모니터링 아키텍처·핵심 메트릭·PromQL·알림·비용 추적 (도구 비교는 LLMOps Observability 문서 참조)

관측성 & 모니터링

Agent 실행 추적·LLM 호출 모니터링·에이전트 수명주기 관측성을 다루는 문서 모음

데이터 인프라

Agentic AI 플랫폼의 벡터 데이터베이스·임베딩 스토어 등 데이터 계층 운영

업그레이드와 수명주기 관리

EKS Hybrid Nodes의 Kubernetes 버전 업그레이드 전략 — nodeadm upgrade 동작 원리, 수동 cordon·drain 의무, SSM 서명 키 만료 대응(nodeadm 1.0.19+), 폐쇄망 사설 미러 구성, 업그레이드 런북을 다룹니다.

예측 운영

ML 기반 예측 스케일링과 이상 감지 — Karpenter+AI, CloudWatch Anomaly Detection, AI Right-Sizing

운영 & 거버넌스

AI 플랫폼 모니터링, Observability, 평가, 컴플라이언스, 도메인 특화 운영 가이드

운영 & 비용

EKS Hybrid Nodes의 Mixed Mode 운영 패턴, Cluster Insights 구성 검증, 모니터링, vCPU-시간 과금 기반 비용 최적화를 다룹니다.

운영 & 안정성

EKS 클러스터의 안정적인 운영을 위한 GitOps, 장애 진단, 고가용성, Pod 라이프사이클 관리 베스트 프랙티스

운영과 비용 최적화

EKS Hybrid Nodes의 운영 베스트 프랙티스 — Mixed Mode 워크로드 배치, Cluster Insights·nodeadm debug 구성 검증, 모니터링 체계, vCPU-시간 티어드 과금 기반 비용 최적화를 다룹니다.

자율 대응

AI Agent 기반 자율 인시던트 대응 — Strands/Kagent 통합, Chaos Engineering + AI, 온톨로지 피드백 루프