Skip to main content

#evaluation

6

문서

1

카테고리

20k

단어

101

분 읽기

관련 카테고리: "genai-aiml"

문서 목록

Comprehensive governance documentation covering quality evaluation, operational playbooks, AI Gateway guardrails, compliance, and domain customization

RAG pipeline quality evaluation and continuous improvement using Ragas

Connect cache efficiency, KV capacity, latency, and routing across seven observability layers, with explicit delivery, evaluation coverage, and quality gates.

Define cached-token, turn-gap, and preemption data contracts, correlation limits, and non-inferiority quality gates for prefix cache tuning.

Export approved, redacted Langfuse generations as Parquet candidates and score them using explicit evaluator contracts. Conversion to GRPO/DPO inputs is a separate stage.

Evaluation-driven Loop in Agent/LLM Development Process — Comparison of SWE-bench Verified, METR, Ragas, DeepEval, LangSmith, Braintrust, AWS Labs aidlc-evaluator