모두의 AI
최적화 심화 ✓ 8섹션 상세 리뷰 2023.10.03

BitNet — 1-bit LLM의 첫 번째 성공

원제: BitNet: Scaling 1-bit Transformers for Large Language Models

Ma 등이 제안한 BitNet은 LLM의 가중치를 {-1, 0, +1} 1-bit로 양자화하면서 fp16 모델과 동등 성능을 달성. 새로운 학습 패러다임 — 1.58-bit 후속 연구로 이어짐. 메모리 7x, 에너지 71x, latency 4x 절감.

출처: NeurIPS 2023 (Meta AI) · arXiv:2310.02255 원문 ↗

1. 한줄 요약

트랜스포머의 가중치를 {-1, 0, +1}의 1-bit ternary로 양자화하면서 fp16 모델과 동등 성능을 달성한 최초의 1-bit LLM. 메모리 7x, 에너지 71x, latency 4x 절감.

2. 왜 등장했는가 (Background)

2023년 기준 LLM은 100B+ 파라미터가 표준이 되면서 메모리·에너지·latency 모두 폭증. INT8 (LLM.int8)이나 INT4 (QLoRA)는 어느 정도 답을 줬지만, 본질적 한계: GPU의 ALU는 여전히 fp16/fp32 연산. 진짜 답은 bit-parallelism 극대화 — 가중치 자체를 1-bit로 만들면 GPU 메모리 bandwidth가 병목 해소, 곱셈이 bitwise XNOR로 대체됨.

  • CNN에서는 BinaryNet (2016), XNOR-Net (2016) 등 1-bit 성공 사례 다수
  • 트랜스포머에서는 사전 시도 모두 30%+ 성능 손실

핵심 의문: 트랜스포머는 1-bit으로 표현 가능한가? 답: 네, 단 학습 패러다임을 바꿔야.

3. 핵심 아이디어 — BitLinear + Straight-Through Estimator

두 가지 트릭의 합:

1. BitLinear (1-bit Linear layer):
W: fp16 → sign(W) → {-1, +1}
X: fp16 → absmean quantization → {-1, 0, +1}
Y = W · X → bitwise XNOR + popcount

2. Straight-Through Estimator (STE):
forward: 1-bit 양자화 (memory/energy 절감)
backward: fp16 gradient 그대로 전파 (학습 안정)

3. LayerNorm + BitLinear만으로 구성:
Attention은 그대로 fp16, FFN만 1-bit

비유: 원본 점묘화(floating-point 정밀)를 1-bit 흑백 점묘화로 단순화. 인간은 색 정보를 잃어도 형태와 구조는 인식 가능 — LLM도 마찬가지로 1-bit만으로 언어 구조 학습 가능.

4. Architecture

  • Backbone: Transformer (LLaMA 구조) — 700M, 1.3B, 3B, 7B 파라미터
  • Attention: fp16 유지 (정밀도 우선)
  • FFN: BitLinear (1-bit) — 파라미터의 70% 차지
  • Token embedding: 8-bit 양자화 (혼합)
  • Activation: 8-bit NormalFloat

5. Training

  • 데이터: RedPajama (LLaMA와 동일)
  • Optimizer: AdamW, lr=1.5e-4, cosine schedule
  • Batch: 1M tokens
  • 하드웨어: 8 x A100 80GB
  • 학습 시간: 700M 모델 fp16 기준 대비 1.4x 빠름 (메모리 7x 적게 → 더 큰 batch 가능)

6. Result

fp16 LLaMA와 동등, 자원 7-71x 절감:

  • Perplexity: 700M — fp16 8.94 vs BitNet 8.91 (오히려 약간 더 좋음)
  • 메모리: 7B 모델 — 13.7GB (fp16) → 1.9GB (BitNet) (-86%)
  • 에너지: 1 token당 3.42J → 0.99J (-71%)
  • Latency: GPU에서 bitwise XNOR로 4x 빠름
  • 스케일링: 700M → 7B로 가도 fp16과 격차 유지

7. 한국 독자 적용 사례

  • 스마트폰 LLM: 7B BitNet을 Galaxy·iPhone에서 실시간 응답 (배터리 -71%)
  • 엣지 디바이스: 라즈베리파이 + BitNet으로 on-device 챗봇
  • 한국어 모델: KoBitNet 같은 경량 한국어 모델 설계 기반
  • Microsoft BitNet.cpp: 1-bit LLM inference framework

8. 한계 + 후속 영향

한계:

  • BitLinear는 행렬곱만 가속, attention은 여전히 fp16 → 속도 향상 제한적
  • 현재 1-bit 정확도가 fp16과 동등이지 우월하지는 않음 — 더 큰 모델에서 검증 필요
  • 특정 다운스트림 태스크(코드 생성 등)에서 미세한 성능 차이

후속 영향:

  • 2024년 BitNet 1.58 (1.58-bit, ternary {−1, 0, +1})로 발전 — 100B 모델에서도 fp16 동등
  • Microsoft의 BitNet.cpp (inference framework), llama.cpp 통합
  • "온디바이스 LLM의 미래"로 자리매김, GPTQ/AWQ와 다른 패러다임 제시
Related Startups

🚀 이 기술领域의 스타트업

이 논문의 주제(최적화)와 같은 R&D 영역의 미국 스타트업

AI/ML 온디바이스

Anthropic

San Francisco, CA · 2021

**Constitutional AI** — 인간 라벨 대신 '헌장(Constitution)'으로 안전성 자기비판 후 RLHF/RLAIF 학습. Sleeper Agents / Sycophancy 등 안전 연구로 유명. Claude 3.5 Sonnet은 SWE-bench Verified 최고 성능 기록. Claude 4 Opus는 코딩·분석·장문 처리에 강점. AI 안전·해석 가능성(Interpretability) 분야를 최우선으로 투자.

AI/ML 온디바이스

PrismML

Pasadena, California, USA (Caltech 인근 · Caltech 스핀오프) · 2025

**1-bit / Ternary 가중치 압축의 선구주자**. 목적 함수는 모델 크기·복잡도 증가 없이 'intelligence density'(단위 추론당 intelligence)를 질적으로 끌어올리는 것 — 이들이 말하는 'Concentrating intelligence'. 기존 PTQ(Post-Training Quantization) 방식과 달리, 학습 단계부터 1-bit을 first-class로 가정하고 학습하는 full-stack 접근. 1-bit 가중치 세팅에서도 LLM-quality 텍스트 생성을 달성한 최초의 상용 솔루션. Bonsai 시리즈는 27B 같은 대형 모델도 6GB 미만 메모리 footprint로 단일 스마트폰에서 실시간 추론이 가능. 셀룰러 폰에서 27B 추론은 본질적으로 모델 크기와 정확도 trade-off의 종결을 의미.

AI/ML 온디바이스

Cartesia

San Francisco, CA · 2023

State Space Models (S4/Mamba) — **sequence 길이에 linear scaling**, transformer의 quadratic attention 대비 memory·power 효율 압도. Hardware-aware algorithm (kernel fusion, parallel scan, recomputation) 적용. 모듈 SSM + MLP 블록을 통합한 homogeneous architecture. Sonic (TTS) + Ink (STT) + Line (agent platform) + H-Nets (hierarchical 토크나이저 프리) 풀스택. Cloud + On-premise + On-device 동시 배포 (in-region mandatory). 실시간 voice AI 시장을 latency-first로 설계.

스타트업 전체 보기 →