AI/ML 온디바이스 2026.07.23 ⭐ 8/10
FlexGen
**LLM KV cache offloading + INT4/INT8 quantization** — KV cache를 GPU·CPU·NVMe로 계층적 오프로딩, OPT-175B 단일 A100에서 1 token/ms. INT4 weight + INT8 KV cache 동시 양자화로 175B 모델을 24GB GPU로 추론 가능. TensorRT-LLM보다 2-3배 적은 VRAM. Samsung Ventures 모바일 LLM 추론 협력.
KV cache 오프로딩 + INT4/8 양자화. 175B 모델 단일 A100. 24GB VRAM 추론.