Skip to main content

10 docs tagged with "operations"

View all tags

AI Agent Monitoring and Operations

Langfuse-based agent monitoring operations — monitoring architecture, key metrics, PromQL, alerting, and cost tracking (for tool comparison, see LLMOps Observability)

Data Infrastructure

Operating vector databases, embedding stores, and data layer infrastructure for Agentic AI platforms

Operations & Cost

Covers EKS Hybrid Nodes Mixed Mode operational patterns, Cluster Insights configuration validation, monitoring, and cost optimization based on vCPU-hour billing.

Operations & Governance

AI platform monitoring, observability, evaluation, compliance, and domain-specific operations guide

Operations & Reliability

Best practices for stable EKS cluster operations including GitOps, troubleshooting, high availability, and Pod lifecycle management

Operations and Cost Optimization

Operational best practices for EKS Hybrid Nodes — mixed mode workload placement, configuration validation with Cluster Insights and nodeadm debug, monitoring architecture, and cost optimization based on tiered vCPU-hour billing.

Upgrades and Lifecycle Management

Kubernetes version upgrade strategy for EKS Hybrid Nodes — covers how nodeadm upgrade works, the mandatory manual cordon/drain, handling SSM signing key expiration (nodeadm 1.0.19+), private mirror configuration for air-gapped networks, and the upgrade runbook.