모두의 AI
최적화 중급 ✓ 8섹션 상세 리뷰 2022.08.15

LLM.int8() — 스케일 트랜스포머의 8-bit 행렬곱

원제: LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale

Dettmers 등이 제안한 LLM.int8()은 175B OPT 트랜스포머를 int8 행렬곱으로 추론하면서 perplexity 손실 0을 달성. 핵심 통찰은 모든 가중치를 8-bit로 압축하면 안 된다 — outlier feature(0.1%)만 fp16으로 분리하고 나머지는 int8로. HuggingFace BitsAndBytes 라이브러리로 즉시 사용 가능.

출처: NeurIPS 2022 · arXiv:2208.07339 원문 ↗

1. 한줄 요약

175B 파라미터 트랜스포머의 추론을 int8 행렬곱으로 수행하면서 perplexity 손실 0을 달성. 단, 모든 가중치를 8-bit로 압축하면 안 되고, 극히 일부(<0.1%)의 outlier feature만 fp16으로 분리하는 mixed-precision decomposition.

2. 왜 등장했는가 (Background)

2022년 기준 LLM은 100B+ 파라미터 시대로 진입했지만, GPU 메모리는 선형으로 증가.

  • 175B 모델 fp16 추론: 350GB VRAM 필요 → A100 80GB 5장
  • int4까지 줄이면 정확도 붕괴 (perplexity 폭증)
  • 단순 post-training quantization(PTQ)은 LLM에서 작동하지 않음 — vision 모델과 본질적 차이

핵심 발견: LLM의 hidden state에는 극단적으로 큰 값을 가진 outlier dimension이 항상 존재하며(보통 6-7개), 이들이 attention을 지배. 이 outlier만 fp16으로 남기면 나머지는 8-bit로 안전하게 양자화 가능.

3. 핵심 아이디어 — Mixed-Precision Decomposition

행렬곱을 두 부분으로 분해:

X_int8 · W_int8 = (X_int8 · W_int8)
+ (X_fp16_outliers · W_fp16_outliers)

X_int8: 99.9% 차원 (8-bit)
X_fp16: 0.1% outlier 차원 (fp16)

비유: 수천 권의 책을 요약본으로 압축하지만, 단 한 권의 책에 등장하는 핵심 명대사만 원문 보존하는 것. 효율은 압축본만큼, 핵심 정보는 보존.

4. 구현 (Vector-wise Quantization)

  • Column-wise outlier 분리: hidden state의 특정 column이 fp16으로 유지
  • 8-bit NormalFloat: 절대 최대값으로 정규화 후 256 bin으로 round
  • Matrix mult kernel: cuBLAS int8 GEMM + outlier 부분 fp16 GEMM, GPU에서 두 부분 결과 합산
  • Backward pass: 입력/출력 gradient는 outlier-aware로 계산

5. Training & Data

  • 평가 모델: OPT-175B, BLOOM-176B, PyTorch/HuggingFace 구현
  • 벤치마크: WikiText, C4, LAMBADA perplexity
  • 속도 측정: A100 80GB, fp16 baseline 대비 1.05x slowdown(overhead 작음)

6. Result

3가지 핵심 결과:

  • Perplexity: fp16 8.34 vs int8 8.34 — 정확도 손실 0
  • 메모리: 175B 모델 -49% (350GB → 180GB)
  • 속도: fp16 대비 5% 느림, 하지만 GPU 1장으로 가능

7. 한국 독자 적용 사례

  • 스타트업: 70B 모델을 A100 1~2장으로 fine-tuning 가능 (비용 1/3)
  • 온디바이스: Snapdragon NPU에서 int8 추론 가속
  • BitsAndBytes: HF Transformers 한 줄 옵션으로 즉시 사용

8. 한계 + 후속 영향

한계:

  • outlier detection overhead (5%)
  • int4 단독은 정확도 보장 어려움 → QLoRA로 해결

후속 영향:

  • HF BitsAndBytes 라이브러리, 모든 오픈소스 LLM 표준
  • GPTQ, AWQ, SmoothQuant의 토대
  • 100B 모델을 1 GPU에서 가능하게 한 민주화 이정표
Related Startups

🚀 이 기술领域의 스타트업

이 논문의 주제(최적화)와 같은 R&D 영역의 미국 스타트업

AI/ML 온디바이스

Anthropic

San Francisco, CA · 2021

**Constitutional AI** — 인간 라벨 대신 '헌장(Constitution)'으로 안전성 자기비판 후 RLHF/RLAIF 학습. Sleeper Agents / Sycophancy 등 안전 연구로 유명. Claude 3.5 Sonnet은 SWE-bench Verified 최고 성능 기록. Claude 4 Opus는 코딩·분석·장문 처리에 강점. AI 안전·해석 가능성(Interpretability) 분야를 최우선으로 투자.

AI/ML 온디바이스

PrismML

Pasadena, California, USA (Caltech 인근 · Caltech 스핀오프) · 2025

**1-bit / Ternary 가중치 압축의 선구주자**. 목적 함수는 모델 크기·복잡도 증가 없이 'intelligence density'(단위 추론당 intelligence)를 질적으로 끌어올리는 것 — 이들이 말하는 'Concentrating intelligence'. 기존 PTQ(Post-Training Quantization) 방식과 달리, 학습 단계부터 1-bit을 first-class로 가정하고 학습하는 full-stack 접근. 1-bit 가중치 세팅에서도 LLM-quality 텍스트 생성을 달성한 최초의 상용 솔루션. Bonsai 시리즈는 27B 같은 대형 모델도 6GB 미만 메모리 footprint로 단일 스마트폰에서 실시간 추론이 가능. 셀룰러 폰에서 27B 추론은 본질적으로 모델 크기와 정확도 trade-off의 종결을 의미.

AI/ML 온디바이스

Cartesia

San Francisco, CA · 2023

State Space Models (S4/Mamba) — **sequence 길이에 linear scaling**, transformer의 quadratic attention 대비 memory·power 효율 압도. Hardware-aware algorithm (kernel fusion, parallel scan, recomputation) 적용. 모듈 SSM + MLP 블록을 통합한 homogeneous architecture. Sonic (TTS) + Ink (STT) + Line (agent platform) + H-Nets (hierarchical 토크나이저 프리) 풀스택. Cloud + On-premise + On-device 동시 배포 (in-region mandatory). 실시간 voice AI 시장을 latency-first로 설계.

스타트업 전체 보기 →