AIDLC Evaluation Framework
2026-04-18 작성2026-06-30 수정28분 읽기
AIDLC (AI Development Life Cycle) 는 기존 SDLC 와 달리 확률적(stochastic) 산출물 을 다룹니다. 같은 입력에도 LLM/Agent 의 응답이 달라지고, 한 번의 단위 테스트 통과가 "항상 맞다"를 보장하지 않습니다. 본 문서는 AIDLC 의 세 루프(Inner/Middle/Outer) 에 평가(Evaluation) 를 어떻게 심어야 하는지, 2026-04 기준 실전에서 사용되는 벤치마크·도구·아키텍처를 정리합니다.
1. 왜 Evaluation-driven Loop 인가
1.1 SDLC TDD vs AIDLC Evaluation-driven
| 구분 | 기존 SDLC (TDD) | AIDLC (Evaluation-driven) |
|---|---|---|
| 산출물 성격 | Deterministic (동일 입력 → 동일 출력) | Stochastic (동일 입력 → 분포) |
| 정답 정의 | 단일 expected value | 허용 구간 + 품질 지표 분포 |
| 실패 신호 | Assertion 실패 = 버그 | 지표 하락 = drift · regression · 품질 저하 후보 |
| 재현성 | 100% 재현 | seed/temperature 고정 시 근사 재현 |
| 게이트 조건 | 모든 테스트 green | 평가 지표 임계값 충족 (예: Faithfulness ≥ 0.90) |
| 반복 주기 | 커밋 단위 | 커밋 + 데이터셋 교체 + 프로덕션 샘플링 |
TDD 가 "실패하는 테스트 → 구현 → 리팩터" 루프였다면, AIDLC 의 Evaluation-driven Loop 는 "평가 데이터셋 → 에이전트/프롬프트/모델 변경 → 지표 비교 → 게이트 통과" 의 루프입니다. 한 번의 기능 추가가 10개 지표 중 2개를 떨어뜨릴 수 있으므로, 단순 pass/fail 이 아닌 다차원 지표 대시보드 가 기본이 됩니다.
1.2 학습 → 배포 흐름의 CI 역할
전통 SDLC 에서 CI 는 "빌드 + 단위 테스트" 였습니다. AIDLC 에서는 CI 가 수행해야 할 일이 확장됩니다.
- 프롬프트/에이전트/모델 변경이 커밋되면, 평가 데이터셋 기준선과 비교
- 핵심 지표(faithfulness, task success rate, tool-use accuracy 등) 가 허용 범위인지 확인
- 비용 지표(토큰·레이턴시) 역시 회귀가 없는지 측정
- 프로덕션 샘플 대비 drift 여부 판정
- 게이트 통과 시에만 배포 파이프라인 진행
즉, CI 는 "코드가 컴파일되는가" 에서 "에이전트가 여전히 제 품질을 내는가" 로 의미가 바뀝니다.