본문으로 건너뛰기

8개 문서가 "optimization" 태그에 분류되었습니다

모든 태그 보기

Inference Optimization on EKS

LLM Inference 성능을 극대화하는 EKS 아키텍처 개요 — vLLM, KV Cache-Aware Routing, Disaggregated Serving, LWS 멀티노드, GPU 오토스케일링의 시작점

MCP 툴 토큰 최적화 패턴

MCP 기반 에이전트의 토큰 사용 최적화 패턴. 업프론트 로딩 문제 정량화와 4가지 기법(Progressive Discovery, 툴 압축 프록시, Code Execution, 프롬프트 캐시 정합성)으로 토큰 오버헤드를 70-98% 절감한다.

vLLM 모델 서빙

vLLM의 PagedAttention, 병렬화 전략, Multi-LoRA, 하드웨어 지원 아키텍처