BitNet 1.58 — ternary LLM의 실용화
원제: The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits
Ma 등이 제안한 BitNet 1.58은 ternary {−1, 0, +1} 가중치로 100B+ LLM에서도 fp16과 동등 성능을 달성. BitNet b1.58 (3B) 오픈소스 공개. llama.cpp 통합으로 CPU에서도 5-7x 빠른 추론.
1. 한줄 요약
트랜스포머의 가중치를 {-1, 0, +1}의 1.58-bit ternary로 양자화한 LLM. 100B+ 모델에서도 fp16과 동등 성능, 메모리 10x, latency 7x, 에너지 21x 절감. 1.58 bits = log2(3) ≈ 1.585.
2. 왜 등장했는가 (Background)
2024년 기준 LLM은 점점 더 거대해지며 자원 소모 폭증. BitNet v1 (2023)은 1-bit {-1, +1}로 좋은 결과를 냈지만, 0이 없어서 표현력이 제한. 실은 ternary {-1, 0, +1}가 거의 같은 메모리인데 표현력 2x.
- log2(2) = 1 bit (binary)
- log2(3) ≈ 1.58 bits (ternary) — 거의 같은 메모리 + 0이 추가되어 sparse 표현 가능
핵심 발견: 1-bit에 0을 추가하는 것만으로 FFN의 표현력·학습 안정성·수렴 속도가 모두 개선. 100B 모델에서도 fp16과 동등.
3. 핵심 아이디어 — absmean Ternary Quantization
BitLinear의 ternary 버전:
1. absmean Quantization:
γ = (1/n) · Σ|W_ij| # 가중치 절댓값 평균
W_t = round(clip(W / γ, -1, +1)) → {-1, 0, +1}
2. Straight-Through Estimator (STE):
forward: ternary (메모리/에너지 절감)
backward: fp16 gradient 그대로
3. Layer별 γ 학습:
각 layer가 자신의 γ를 학습, 균일 정규화비유: 점묘화를 3색(검/회/백)으로 단순화. 단, 각 픽셀에서 0(흰색)을 추가할 수 있어 그라데이션 표현 가능. 1-bit(검/백)보다 자연스러움.
4. Architecture
- Backbone: LLaMA 구조 그대로 — RMSNorm, SwiGLU, RoPE, GQA 모두 호환
- Attention: fp16 유지 (BitNet v1과 동일)
- FFN: BitLinear (1.58-bit ternary)
- Token embedding: fp16
5. Training
- 데이터: RedPajama (LLaMA와 동일 1.2T tokens)
- Optimizer: AdamW, lr=2e-4, cosine schedule, warmup 2000 step
- Batch: 4M tokens (메모리 절감 덕분에 큰 batch 가능)
- 학습 안정화: LayerNorm 위치 조정, QK-Norm 추가
6. Result
스케일 100B까지 fp16과 격차 유지:
- Perplexity: 70B — fp16 5.6 vs BitNet 1.58 5.5 (오히려 약간 더 좋음)
- MMLU: 70B — fp16 68.8% vs BitNet 1.58 68.7% (오차 0.1%p)
- 메모리: 7B 모델 13.7GB → 1.4GB (-90%)
- Latency: ARM CPU에서 5-7x 빠름 (bitwise operation)
- 에너지: -21x (메모리 bandwidth + bitwise)
7. 한국 독자 적용 사례
- 스마트폰 LLM: 70B BitNet 1.58을 Galaxy S25에서 실시간 응답 (배터리 -21x)
- 엣지 디바이스: 라즈베리파이, Coral, Jetson에서 70B 모델 운영
- 한국어 특화: KoBitNet 1.58 (KoLLaMA 기반) — 오픈소스 진행 중
- Microsoft bitnet.cpp: 1-bit LLM inference framework, llama.cpp 통합
8. 한계 + 후속 영향
한계:
- 학습은 여전히 fp16 가중치 + ternary forward/backward (STE) → 학습 시 메모리는 fp16과 비슷
- 특정 다운스트림 태스크(수학·코드)에서 미세한 성능 차이 가능
- BitNet 1.58 v2 (2024): 활성화까지 1-bit으로 확장
후속 영향:
- 100B 모델의 모바일 배포 시대 — "모든 LLM이 1-bit" 표제
- Microsoft의 BitNet.cpp + llama.cpp 통합으로 오픈소스 생태계 확장
- GPTQ/AWQ와 다른 패러다임(weight-only vs native 1-bit), 2026년 1-bit LLM 경쟁 본격화 예상
🚀 이 기술领域의 스타트업
이 논문의 주제(최적화)와 같은 R&D 영역의 미국 스타트업
Anthropic
San Francisco, CA · 2021
**Constitutional AI** — 인간 라벨 대신 '헌장(Constitution)'으로 안전성 자기비판 후 RLHF/RLAIF 학습. Sleeper Agents / Sycophancy 등 안전 연구로 유명. Claude 3.5 Sonnet은 SWE-bench Verified 최고 성능 기록. Claude 4 Opus는 코딩·분석·장문 처리에 강점. AI 안전·해석 가능성(Interpretability) 분야를 최우선으로 투자.
PrismML
Pasadena, California, USA (Caltech 인근 · Caltech 스핀오프) · 2025
**1-bit / Ternary 가중치 압축의 선구주자**. 목적 함수는 모델 크기·복잡도 증가 없이 'intelligence density'(단위 추론당 intelligence)를 질적으로 끌어올리는 것 — 이들이 말하는 'Concentrating intelligence'. 기존 PTQ(Post-Training Quantization) 방식과 달리, 학습 단계부터 1-bit을 first-class로 가정하고 학습하는 full-stack 접근. 1-bit 가중치 세팅에서도 LLM-quality 텍스트 생성을 달성한 최초의 상용 솔루션. Bonsai 시리즈는 27B 같은 대형 모델도 6GB 미만 메모리 footprint로 단일 스마트폰에서 실시간 추론이 가능. 셀룰러 폰에서 27B 추론은 본질적으로 모델 크기와 정확도 trade-off의 종결을 의미.
Cartesia
San Francisco, CA · 2023
State Space Models (S4/Mamba) — **sequence 길이에 linear scaling**, transformer의 quadratic attention 대비 memory·power 효율 압도. Hardware-aware algorithm (kernel fusion, parallel scan, recomputation) 적용. 모듈 SSM + MLP 블록을 통합한 homogeneous architecture. Sonic (TTS) + Ink (STT) + Line (agent platform) + H-Nets (hierarchical 토크나이저 프리) 풀스택. Cloud + On-premise + On-device 동시 배포 (in-region mandatory). 실시간 voice AI 시장을 latency-first로 설계.