Skip to main content

22 docs tagged with "scope:ops"

View all tags

Agentic Playbook

Guide for declaratively defining agent workflows like IaC and automating compliance

AI Agent Monitoring and Operations

Langfuse-based agent monitoring operations — monitoring architecture, key metrics, PromQL, alerting, and cost tracking (for tool comparison, see LLMOps Observability)

AI Gateway Guardrails

LLM Gateway-level Guardrails — PII redaction, prompt injection defense, content filtering, tool comparison, and Korean financial compliance mapping

AI Gateway Multi-Tenancy Strategy

LLM Gateway-level multi-tenancy strategy — LiteLLM virtual key hierarchical model vs Kong Consumer policy comparison, budget enforcement, 3-tier tenant isolation (gateway, data, observability)

Audit & Governance Logging

AIDLC Checkpoint Approval gates and ISO 8601-based audit logs — Implementation guide for AIDLC audit trails in regulated industries

Cascade Routing Production Tuning

Guide to tuning Inference Gateway Cascade Routing classification thresholds, Canary rollout, Fallback, and cost drift alerts based on production traces

Domain Specialization (LoRA + RAG)

Guide to improving technical domain coding quality with LoRA Fine-tuning, VectorRAG, and GraphRAG — including FSI SI production scenarios

Enterprise Compliance Framework

Compliance guide mapping SOC2, ISO27001, Electronic Financial Supervisory Regulation (전자금융감독규정), and ISMS-P to AI operations

LLMOps Observability Comparison Guide

LLMOps observability tool comparison — Langfuse·LangSmith·Helicone·CloudWatch selection criteria and hybrid architecture (for Langfuse operations, see Agent Monitoring)

Observability Integration — Self-Diagnosis, Container Insights, eBPF

Observability implementation guide for EKS Hybrid Nodes — covers Cluster Insights configuration self-diagnosis, CloudWatch Container Insights hybrid configuration (RUN_WITH_IRSA), NVIDIA GPU metric integration, a Cilium Hubble-based eBPF dashboard, and Network Flow Monitor applicability analysis.

Operations & Governance

AI platform monitoring, observability, evaluation, compliance, and domain-specific operations guide

Operations and Cost Optimization

Operational best practices for EKS Hybrid Nodes — mixed mode workload placement, configuration validation with Cluster Insights and nodeadm debug, monitoring architecture, and cost optimization based on tiered vCPU-hour billing.

Upgrades and Lifecycle Management

Kubernetes version upgrade strategy for EKS Hybrid Nodes — covers how nodeadm upgrade works, the mandatory manual cordon/drain, handling SSM signing key expiration (nodeadm 1.0.19+), private mirror configuration for air-gapped networks, and the upgrade runbook.