LLM FinOps — Chargeback 및 비용 배부
2026-08-11 작성21분 읽기
엔터프라이즈 LLM 플랫폼에서 FinOps(Financial Operations)는 비용 가시성(Visibility), 최적화(Optimization), 배부(Chargeback) 3요소로 구성됩니다. 이 문서는 토큰 메터링 파이프라인, 비용 단위 모델링, showback/chargeback 방법론, 예산 정책 설계를 다룹니다.
관련 문서
- 본 문서: FinOps chargeback 방법론 (비용 배부 전략, 메터링 아키텍처)
- Agent 모니터링: 비용 추적 PromQL 쿼리 (관측 구현 canonical)
- Request Cascading: 비용 절감 라우팅 전략
- AI Gateway Guardrails: 예산 초과 시 차단/폴백 정책
1. 개요
1.1 FinOps가 필요한 이유
LLM 운영 비용은 전통적인 클라우드 인프라와 다른 특성을 가집니다:
| 특성 | 전통 인프라 | LLM 플랫폼 |
|---|---|---|
| 비용 단위 | CPU·메모리·스토리지 시간당 | 입력/출력 토큰 개수 |
| 가변성 | 상대적으로 예측 가능 | 프롬프트 길이·턴 수에 따라 급변 |
| 비용 주체 | 인스턴스·서비스 | 모델·테넌트·세션·에이전트 |
| 누적 패턴 | 선형 증가 | 멀티턴 대화 시 지수적 증가 가능 |
| 최적화 여지 | 인스턴스 크기 조정 | 모델 선택, 프롬프트 압축, 캐싱 |
에이전틱 AI 애플리케이션은 툴 호출 루프와 컨텍스트 누적으로 인해 단일 요청당 토큰 소비가 10배 이상 증가할 수 있으며, 비용 예측이 어렵습니다.
1.2 FinOps 3요소
2. 비용 단위 모델링
2.1 토큰 플로우 모델
LLM 비용의 기본 단위는 session-level cost 입니다. 단일 세션(요청-응답 쌍 N개)의 총 비용은 다음 요소로 결정됩니다:
C_session = Σ (C_input * T_in + C_output * T_out) * (1 - R_cache)
여기서:
C_input = 입력 토큰 단가 ($/1M tokens)
C_output = 출력 토큰 단가 ($/1M tokens, 일반적으로 입력 대비 2~5배)
T_in = 턴당 입력 토큰 수
T_out = 턴당 출력 토큰 수
R_cache = 캐시 히트율 (0~1, 프롬프트 캐싱·semantic 캐싱)
Σ = 세션 내 모든 LLM 호출 합계 (사용자 턴 + 에이전트 내부 루프)
2.2 에이전틱 고유 위험: 컨텍스트 복리 효과
일반 채팅 (단일 턴):
- 턴 1: 사용자 프롬프트 500 토큰 → 모델 응답 200 토큰
- 총 비용: (500 * C_in + 200 * C_out) × 1회
에이전틱 루프 (도구 호출 3회):
- 턴 1: 프롬프트 500 + 이전 컨텍스트 0 = 500 → 응답 200 (도구 호출 요청)
- 턴 2: 프롬프트 500 + 턴 1 컨텍스트 700 = 1,200 → 응답 300 (도구 호출 요청)
- 턴 3: 프롬프트 500 + 턴 1~2 컨텍스트 2,000 = 2,500 → 응답 300 (도구 호출 요청)
- 턴 4: 프롬프트 500 + 턴 1~3 컨텍스트 4,800 = 5,300 → 최종 응답 400
- 총 입력 토큰: 9,500 (단일 턴 대비 19배)
비용 폭주 리스크
멀티턴 에이전트 루프에서 컨텍스트는 매 턴마다 누적되어 토큰 소비가 **초선형(super-linear)**으로 증가합니다. 루프 깊이가 10회를 넘으면 단일 세션 비용이 $1 이상으로 증가할 수 있습니다 (Claude Opus 4.8 기준, 가정).
2.3 비용 완화 전략
| 전략 | 효과 | 구현 위치 |
|---|---|---|
| Max iterations 제한 | 루프 횟수 상한 (예: 10회) | Agent 프레임워크 설정 |
| 중간 요약 | 긴 컨텍스트를 짧은 요약으로 대체 | Agent 루프 내 summarization 단계 |
| 컨텍스트 윈도우 예산 | 입력 토큰이 N 이상이면 가장 오래된 턴 제거 | Gateway 정책 또는 Agent 프레임워크 |
| Prompt Caching | 시스템 프롬프트·공통 컨텍스트 재사용 | 모델 API 레벨 (Claude, GPT-4.1, Gemini 지원) |
| Semantic Caching | 유사 쿼리 응답 재사용 | Gateway 레이어 |