HoloQ-VLA: 비전-언어-액션 모델의 균일 W4A4 양자화
원제: HoloQ-VLA: Uniform W4A4 Quantization of Vision-Language-Action Models
Vision-Language-Action(VLA) 로봇 정책 모델 전체를 단일 Hadamard 회전만으로 W4A4 균일 양자화. 기존 mixed-precision 대비 메모리 3.7배↓·latency 3.5배↓하면서 120개 태스크 성공률 손실 0.8%p. OpenVLA-7B를 3.8GB로 줄여 Jetson Orin에서 110ms 추론. 국내 휴머노이드·협동로봇·가전로봇의 온디바이스 VLA 배포에 직접 활용.
1. 한줄 요약
Vision-Language-Action(VLA) 로봇 정책 모델의 전체를 W4A4(4-bit weight·activation) 균일 양자화하는 첫 번째 방법. 단일 Hadamard 회전으로 diffusion action head의 outlier를 흡수해, mixed-precision 없이도 성능 손실 1%p 미만으로 온디바이스 배포를 가능케 합니다.
2. 왜 등장했는가 (Background)
VLA 모델(예: OpenVLA·RT-2·π0)은 자연어 명령을 보고 로봇 행동 trajectory를 출력하는 통합 정책입니다. 그러나 backbone이 LLM급(7~13B)이고 action head가 diffusion-based이므로 온디바이스 배포가 사실상 불가능했습니다. 기존 양자화 시도(SmoothQuant·QLoRA)는 backbone만 4-bit로 줄이고 action head는 FP16 유지 → 메모리/속도 이득 제한적. diffusion head의 outlier가 양자화 noise에 극도로 취약해 균일 저비트화가 깨지면 control 정확도가 급락하는 문제가 있었습니다.
3. 핵심 아이디어
핵심 통찰: outlier는 activation 좌표축의 회전으로 분산 가능. Hadamard 회전을 pre-quantization에 적용하면 outlier가 모든 차원에 균일하게 spread → 4-bit로 양자화해도 손실이 작아집니다.
X_q = Q( H · X · H^T ) # H: Hadamard matrix, Q: 4-bit quantization
Y = H^T · ( X_q ) · H # 역회전 후 computeaction head는 diffusion timestep이 진행될수록 noise schedule이 변하므로 timestep-aware scaling을 추가하여 outlier 패턴 변화에 적응합니다.
4. Model Architecture
- Base VLA: OpenVLA-7B (SigLIP 비전 인코더 + Llama 2 7B + diffusion action head)
- Hadamard Rotation Layer: 모든 Linear layer 앞뒤에 부착, 2K 크기 회전 (computational overhead < 1%)
- Timestep-aware Scaling: diffusion step t마다 activation scale factor α(t) 학습
- PTQ-only: 학습 데이터 없이 calibration set 512 샘플만으로 20분 안에 양자화 완료
5. Training & Data
- Calibration: OpenX-Embodiment subset 512 trajectories, Bridge-256 manipulation tasks
- 평가지표: 6개 시뮬레이션(SimplerEnv·LIBERO·RLBench) + 1개 real-world(7-DoF arm)
- 비교 대상: FP16 baseline, W8A8 PTQ, W4A16 (SmoothQuant), mixed-precision W4A8/F16
- Fine-tuning: PTQ only, QAT(quantization-aware training)도 시도했으나 +0.3%p로 marginal
6. Result
SimplerEnv·LIBERO·RLBench 120개 task 평균:
- 성공률: FP16 78.4% → HoloQ W4A4 77.6% (0.8%p↓, 통계적 유의성 borderline)
- Mixed-precision (W4A16): 76.1% (action head FP16 유지) — HoloQ가 이김
- 메모리: 14GB → 3.8GB (3.7배↓)
- 추론 latency: 380ms → 110ms (Jetson Orin 64GB, 단일 inference)
- 기존 방법 실패: Round-to-Nearest W4A4는 41.2%로 collapse
7. 한국 독자 적용 사례
- 현대로보틱스·레인보우로보틱스: Boston Dynamics Spot·휴머노이드 정책 모델을 실시간 로봇 on-board에 올릴 수 있게 됨
- LG전자 CLOi·삼성전자 가전로봇: VLA 모델을 가전제품 임베디드 보드에 탑재 → 클라우드 의존도 ↓
- 물류·서비스: 쿠팡 로켓배송·배달의민족 픽업로봇 등 동기화 latency ↓
- 산업용 협동로봇: 두산로보틱스 협동로봇 실시간 fine-tuning, factory cell 자립도↑
8. 한계 + 후속 영향
한계:
- Hadamard 회전이 2K×2K 단위로 고정 → long-context·multi-camera VLA에서는 block size 조정 필요
- Real-world 실험이 7-DoF 단일 arm만, bipedal·humanoid VLA는 미검증
- quantization-aware training 대비 PTQ-only의 robustness가 변동 작업에 약함
후속 영향:
- Hugging Face Transformers·vLLM·TensorRT-LLM 등 추론 스택에 균일 W4A4 경로가 추가될 가능성↑
- Diffusion head의 timestep-aware scaling 패턴이 VLM·video diffusion에도 일반화
- 2026년 휴머노이드 로봇 가격 경쟁에서 온디바이스 VLA가 표준으로 자리잡는 데 기여
- 국내 로봇·가전 기업이 중국·미국 대비 가격·자립도 경쟁력 확보
🚀 이 기술领域의 스타트업
이 논문의 주제(최적화)와 같은 R&D 영역의 미국 스타트업
Anthropic
San Francisco, CA · 2021
**Constitutional AI** — 인간 라벨 대신 '헌장(Constitution)'으로 안전성 자기비판 후 RLHF/RLAIF 학습. Sleeper Agents / Sycophancy 등 안전 연구로 유명. Claude 3.5 Sonnet은 SWE-bench Verified 최고 성능 기록. Claude 4 Opus는 코딩·분석·장문 처리에 강점. AI 안전·해석 가능성(Interpretability) 분야를 최우선으로 투자.
PrismML
Pasadena, California, USA (Caltech 인근 · Caltech 스핀오프) · 2025
**1-bit / Ternary 가중치 압축의 선구주자**. 목적 함수는 모델 크기·복잡도 증가 없이 'intelligence density'(단위 추론당 intelligence)를 질적으로 끌어올리는 것 — 이들이 말하는 'Concentrating intelligence'. 기존 PTQ(Post-Training Quantization) 방식과 달리, 학습 단계부터 1-bit을 first-class로 가정하고 학습하는 full-stack 접근. 1-bit 가중치 세팅에서도 LLM-quality 텍스트 생성을 달성한 최초의 상용 솔루션. Bonsai 시리즈는 27B 같은 대형 모델도 6GB 미만 메모리 footprint로 단일 스마트폰에서 실시간 추론이 가능. 셀룰러 폰에서 27B 추론은 본질적으로 모델 크기와 정확도 trade-off의 종결을 의미.
Cartesia
San Francisco, CA · 2023
State Space Models (S4/Mamba) — **sequence 길이에 linear scaling**, transformer의 quadratic attention 대비 memory·power 효율 압도. Hardware-aware algorithm (kernel fusion, parallel scan, recomputation) 적용. 모듈 SSM + MLP 블록을 통합한 homogeneous architecture. Sonic (TTS) + Ink (STT) + Line (agent platform) + H-Nets (hierarchical 토크나이저 프리) 풀스택. Cloud + On-premise + On-device 동시 배포 (in-region mandatory). 실시간 voice AI 시장을 latency-first로 설계.