모두의 AI
최적화 중급 ✓ 8섹션 상세 리뷰 2023.05.23

QLoRA — 65B 모델을 단일 GPU에서 fine-tuning

원제: QLoRA: Efficient Finetuning of Quantized LLMs

Dettmers 등이 제안한 QLoRA는 4-bit NormalFloat(NF4) 양자화 + Low-Rank Adapter + paged optimizer를 결합해, 65B 모델을 단일 48GB GPU에서 fine-tuning. full fine-tuning 대비 메모리 1/4, 성능은 동등. HuggingFace PEFT 통합으로 즉시 사용 가능.

출처: NeurIPS 2023 · arXiv:2305.14314 원문 ↗

1. 한줄 요약

65B 파라미터 LLM을 단일 48GB GPU에서 fine-tuning 가능하게 한 4-bit NF4 + LoRA + paged optimizer 결합 기법. 메모리는 full FT 대비 1/4, 성능은 동등.

2. 왜 등장했는가 (Background)

2023년 기준 LLM fine-tuning은 비싸기 그지없음.

  • 65B 모델 full FT: 780GB VRAM → 16+ A100 필요
  • LoRA (2021): 어댑터만 학습 → 메모리 ↓, 성능도 거의 동등, 하지만 baseline 가중치 fp16 → 여전히 큰 메모리

LoRA를 더 줄일 수 있을까? 가만, 가만 — baseline 가중치 자체를 4-bit로 압축하면 메모리가 1/4 더 줄어든다. 정확도는?

3. 핵심 아이디어 — 4-bit NormalFloat + LoRA + Paged Optimizer

3가지 트릭의 합:

1. NF4 (4-bit NormalFloat):
가중치를 정규분포 [-1, 1]로 가정, 16 bin 균등 배치
→ 양자화 정확도 +30% (vs naive int4)

2. Double Quantization:
양자화 상수(per-block scale)까지 다시 양자화
→ 메모리 추가 -0.4 bit/parameter

3. Paged Optimizer:
optimizer state를 page 단위로 CPU↔GPU swap
→ gradient spike 시 OOM 방지

비유: 원본 백과사전(800MB)을 4-bit 압축본(200MB)으로 두고, 학습할 때는 색인 카드(LoRA)만 업데이트. 메모리 부족하면 카드를 책상 위에서 서랍으로 잠깐 치움.

4. Architecture

  • 4-bit NF4 baseline: 모든 가중치를 4-bit NF4로 동결
  • LoRA 어댑터: 모든 linear layer에 16-rank adapter 추가, fp16으로 학습
  • De-quantization on-the-fly: forward/backward 시에만 4-bit → fp16 변환, 메모리에는 4-bit 그대로
  • Paged optimizer: Adam state를 NVIDIA Unified Memory + paging으로 관리

5. Training

  • 평가 모델: LLaMA-65B, 33B, 13B (모두 4-bit NF4)
  • LoRA rank: 64 (보통 8-16의 4배, 더 큰 표현력)
  • 데이터: Guanaco (다국어 chat), OASST, OpenAssistant
  • 하드웨어: 단일 A100 48GB

6. Result

메모리 효율 + 성능 동시:

  • 메모리: 65B full FT 780GB → QLoRA 48GB (-94%)
  • 성능: MMLU 63.4% (full FT 63.9%), HumanEval 비슷
  • Throughput: full FT 대비 1.5x 느림 (de-quant overhead) — 하지만 GPU 1장으로 가능
  • Chat 품질: Guanaco 99.3% vs ChatGPT 96.7% (GPT-4 평가)

7. 한국 독자 적용 사례

  • 스타트업: 70B 모델 LoRA fine-tuning을 A100 1장으로 (비용 1/10)
  • 학술 연구: GPU 부족 환경에서 모델 적응 가능
  • 한국어 특화 모델: KoLLaMA, KoSOLAR 등을 QLoRA로 빠르게 튜닝
  • HuggingFace PEFT: 한 줄 옵션으로 즉시 사용 가능

8. 한계 + 후속 영향

한계:

  • LoRA rank 64는 rank 16보다 느리고 메모리 큼
  • 긴 시퀀스(8K+)에서 어댑터가 모든 위치 정보를 담지 못함
  • Multi-task 학습 시 task 간 interference

후속 영향:

  • HuggingFace PEFT 라이브러리의 사실상 표준
  • Llama 3, Mistral 등 모든 오픈소스 LLM의 fine-tuning 기본
  • 개인용 GPU에서도 모델 적응 시대 개막
Related Startups

🚀 이 기술领域의 스타트업

이 논문의 주제(최적화)와 같은 R&D 영역의 미국 스타트업

AI/ML 온디바이스

Anthropic

San Francisco, CA · 2021

**Constitutional AI** — 인간 라벨 대신 '헌장(Constitution)'으로 안전성 자기비판 후 RLHF/RLAIF 학습. Sleeper Agents / Sycophancy 등 안전 연구로 유명. Claude 3.5 Sonnet은 SWE-bench Verified 최고 성능 기록. Claude 4 Opus는 코딩·분석·장문 처리에 강점. AI 안전·해석 가능성(Interpretability) 분야를 최우선으로 투자.

AI/ML 온디바이스

PrismML

Pasadena, California, USA (Caltech 인근 · Caltech 스핀오프) · 2025

**1-bit / Ternary 가중치 압축의 선구주자**. 목적 함수는 모델 크기·복잡도 증가 없이 'intelligence density'(단위 추론당 intelligence)를 질적으로 끌어올리는 것 — 이들이 말하는 'Concentrating intelligence'. 기존 PTQ(Post-Training Quantization) 방식과 달리, 학습 단계부터 1-bit을 first-class로 가정하고 학습하는 full-stack 접근. 1-bit 가중치 세팅에서도 LLM-quality 텍스트 생성을 달성한 최초의 상용 솔루션. Bonsai 시리즈는 27B 같은 대형 모델도 6GB 미만 메모리 footprint로 단일 스마트폰에서 실시간 추론이 가능. 셀룰러 폰에서 27B 추론은 본질적으로 모델 크기와 정확도 trade-off의 종결을 의미.

AI/ML 온디바이스

Cartesia

San Francisco, CA · 2023

State Space Models (S4/Mamba) — **sequence 길이에 linear scaling**, transformer의 quadratic attention 대비 memory·power 효율 압도. Hardware-aware algorithm (kernel fusion, parallel scan, recomputation) 적용. 모듈 SSM + MLP 블록을 통합한 homogeneous architecture. Sonic (TTS) + Ink (STT) + Line (agent platform) + H-Nets (hierarchical 토크나이저 프리) 풀스택. Cloud + On-premise + On-device 동시 배포 (in-region mandatory). 실시간 voice AI 시장을 latency-first로 설계.

스타트업 전체 보기 →