SmoothQuant — LLM용 W8A8 PTQ의 표준
원제: SmoothQuant: Accurate and Efficient Post-Training Quantization for LLM
Xiao 등이 제안한 SmoothQuant는 LLM activation의 outlier를 가중치에 분산시키는 수학적 변환으로 W8A8 양자화 정확도를 회복. ONNX Runtime + TensorRT-LLM 통합, NVIDIA GPU에서 fp16 대비 1.5x 속도 향상.
1. 한줄 요약
LLM의 activation outlier를 가중치로 등가 변환(smoothing)해, 가중치(8-bit)와 activation(8-bit)을 모두 양자화하는 W8A8 PTQ 기법. 100B+ 모델을 단일 GPU에서 fp16 대비 1.5x 빠른 추론.
2. 왜 등장했는가 (Background)
LLM.int8()은 outlier를 fp16으로 남기는 mixed-precision이라 메모리 -50%, 속도 -5%. activation을 통째로 8-bit로 만들면(W8A8) 이론상 -75% 메모리 + 1.5x 속도. 하지만 activation outlier가 워낙 극단적(100x 이상)이라 단순 round하면 정확도 붕괴.
3. 핵심 아이디어 — Per-Channel Smoothing
Activation vector를 channel 단위로 scaling하고, 가중치를 그 inverse로 보정:
Y = X · W
= (X / s) · (s · W)
s = max(|X|)^alpha, alpha ∈ [0, 1]
alpha=0: 변환 없음
alpha=1: 모든 차원 max 동일하게 normalize비유: 국어 시험에서 한 문제만 100점, 나머지 30점이라면 채점 기준을 조절해 모두 70점대로 만드는 것. 분포 균일해지면 8-bit로 표현 쉬워짐.
4. 구현
- Calibration: 512개 샘플로 channel-wise max(|X|) 측정 (수 초)
- Smoothing factor: alpha 채널별 동적 결정
- W8A8: int8 symmetric quantization
- Kernel: TensorRT, FasterTransformer, ONNX Runtime 통합
5. Training & Data
- 평가 모델: OPT-175B, BLOOM-176B, GLM-130B, MT-NLG 530B
- 벤치마크: WikiText, C4 perplexity + Zero-shot 7개
6. Result
- Perplexity: fp16 8.34 vs SmoothQuant 8.42 — 0.1% 손실
- Zero-shot: 평균 -0.3% (baseline INT8 -8.5%)
- 속도: 1.51x faster, 메모리 175B 모델 -64% (350GB → 125GB)
7. 한국 독자 적용 사례
- 대형 서비스: 70B 모델을 A100 1장으로 운영 (TCO -75%)
- 모바일/엣지: Snapdragon NPU + SmoothQuant 7B 실시간
- TensorRT-LLM: NVIDIA GPU 추론 서버 표준
8. 한계 + 후속 영향
한계: Calibration 데이터 의존, int4로 확장 어려움.
후속 영향: TensorRT-LLM 표준 옵션, AWQ의 직접 전신.
🚀 이 기술领域의 스타트업
이 논문의 주제(최적화)와 같은 R&D 영역의 미국 스타트업
Anthropic
San Francisco, CA · 2021
**Constitutional AI** — 인간 라벨 대신 '헌장(Constitution)'으로 안전성 자기비판 후 RLHF/RLAIF 학습. Sleeper Agents / Sycophancy 등 안전 연구로 유명. Claude 3.5 Sonnet은 SWE-bench Verified 최고 성능 기록. Claude 4 Opus는 코딩·분석·장문 처리에 강점. AI 안전·해석 가능성(Interpretability) 분야를 최우선으로 투자.
PrismML
Pasadena, California, USA (Caltech 인근 · Caltech 스핀오프) · 2025
**1-bit / Ternary 가중치 압축의 선구주자**. 목적 함수는 모델 크기·복잡도 증가 없이 'intelligence density'(단위 추론당 intelligence)를 질적으로 끌어올리는 것 — 이들이 말하는 'Concentrating intelligence'. 기존 PTQ(Post-Training Quantization) 방식과 달리, 학습 단계부터 1-bit을 first-class로 가정하고 학습하는 full-stack 접근. 1-bit 가중치 세팅에서도 LLM-quality 텍스트 생성을 달성한 최초의 상용 솔루션. Bonsai 시리즈는 27B 같은 대형 모델도 6GB 미만 메모리 footprint로 단일 스마트폰에서 실시간 추론이 가능. 셀룰러 폰에서 27B 추론은 본질적으로 모델 크기와 정확도 trade-off의 종결을 의미.
Cartesia
San Francisco, CA · 2023
State Space Models (S4/Mamba) — **sequence 길이에 linear scaling**, transformer의 quadratic attention 대비 memory·power 효율 압도. Hardware-aware algorithm (kernel fusion, parallel scan, recomputation) 적용. 모듈 SSM + MLP 블록을 통합한 homogeneous architecture. Sonic (TTS) + Ink (STT) + Line (agent platform) + H-Nets (hierarchical 토크나이저 프리) 풀스택. Cloud + On-premise + On-device 동시 배포 (in-region mandatory). 실시간 voice AI 시장을 latency-first로 설계.