문서
카테고리
단어
분 읽기
관련 카테고리: "genai-aiml"
캐시 효율·KV 용량·지연·라우팅 지표를 7개 관측 계층으로 연결하고, 스트림 완료·평가 커버리지·품질 점수를 구분하여 서빙 최적화의 효과와 회귀를 검증하는 운영 전략입니다.
Prefix 캐시 튜닝의 효율 개선과 품질 회귀를 구분하기 위해 cached 토큰·턴 간격·preemption의 데이터 계약, 상관 분석의 한계, 비열등성 기반 품질 게이트를 정의하는 운영 가이드입니다.
승인·비식별화한 Langfuse generation을 Parquet 후보 데이터로 내보내고 명시적 evaluator 계약으로 점수를 부여합니다. GRPO/DPO 입력 변환은 별도 단계입니다.
Agent/LLM 개발 프로세스의 Evaluation-driven Loop — SWE-bench Verified, METR, Ragas, DeepEval, LangSmith, Braintrust, AWS Labs aidlc-evaluator 비교