Archer: 확산 언어 모델의 효율적 롤백을 위한 캐시 은닉 상태 적응형 재사용
원제: Archer: Adaptive Reuse of Cached Hidden States for Efficient Rollback in Diffusion Language Models
확산 언어 모델(DLM)이 자기회귀 LLM 대비 갖는 롤백 가능성을 살리면서 KV cache 효율을 3.2배 끌어올리는 Archer 메커니즘. 응답 토큰의 은닉 상태를 step마다 적응적으로 재사용하여 prompt KV cache는 고정. 추론 latency 3배↓·메모리 1/4.5로 감소하면서 코드/수학 정확도 손실은 1%p 미만. 한국어 DLM·온디바이스·저지연 챗봇에 즉각 적용.
1. 한줄 요약
확산 언어 모델(DLM)의 롤백(rollback) 가능성을 살리면서 추론 비용을 줄이는 캐시 메커니즘 Archer를 제안. 매 denoising step에서 prompt는 그대로 두고 response hidden state만 적응적으로 재사용하여 KV cache 효율을 3~5배 끌어올립니다.
2. 왜 등장했는가 (Background)
확산 언어 모델(DLM, 예: LLaDA·Dream·MDLM)은 자기회귀(AR) LLM과 달리 이전 토큰을 재조정할 수 있어 Hallucination 감소·플래닝 능력에서 강점을 보입니다. 그러나 매 denoising step마다 전체 컨텍스트를 다시 forward해야 하므로 추론 비용이 AR 모델의 5~10배에 달합니다. 기존 KV cache는 "과거 상태는 변하지 않는다"는 가정에 기반하므로 rollback과 양립 불가능했습니다. 이 모순이 DLM의 실용화 최대 걸림돌이었습니다.
3. 핵심 아이디어
관찰: denoising step t에서 prompt token은(질의) 변하지 않고, response token만 수정됩니다. 따라서:
- Prompt KV cache는 모든 step에서 동일 → 그대로 재사용
- Response KV cache는 step마다 변하지만, 이전 step의 hidden state를 project해서 재사용 가능
Archer는 step마다 두 가지 모드를 적응적으로 전환합니다.
if delta_norm(hidden_t, hidden_{t-1}) < threshold:
reuse_hidden_{t-1}_projected(W_t) # 빠른 모드
else:
recompute_full() # 정밀 모드Wt는 step-specific 가벼운 projection layer(2-layer MLP). 두 모드 전환은 학습된 라우터가 결정합니다.
4. Model Architecture
- Base DLM: LLaDA-8B·Dream-7B 계열 diffusion transformer
- Router Module: 2-layer MLP, 입력은 (step index, hidden norm, variance) → 0/1 출력 (재사용 vs 재계산)
- Projection Layer: 각 step마다 별도 가벼운 Wt (총 ~5% 추가 파라미터)
- Step-aware cache pool: response KV cache를 LRU 방식으로 보관, step 간 보존
5. Training & Data
- 사전 데이터: SlimPajama 200B 토큰으로 base DLM 학습
- Router 학습: 50K supervised (step, hidden) 페어, 라벨은 "재계산 정확도 손실 1%p 이상이면 recompute"
- Projection 학습: 5K step (전체의 1.2%)에 대해서만 fine-tune, 나머지는 freezing
- Instruction Tuning: OpenOrca·UltraChat 1M 추가로 downstream task 성능 유지
6. Result
HumanEval·GSM8K·MMLU·RepliQA 등 6개 다운스트림 태스크 평균:
- 추론 latency: 동일 step 수 대비 3.2배 빠름 (128 step 기준)
- Memory 사용량: KV cache 1/4.5 → 16GB GPU에서 8B 모델 실행 가능
- 품질 손실: HumanEval pass@1 -0.8%p, GSM8K 정확도 -0.4%p, 통계적으로 비유의
- Recall@5 (rollback 효율): 정밀 모드 전환이 전체 step의 12%만 발생, 나머지 88%는 재사용
7. 한국 독자 적용 사례
- 한국어 DLM 자체 개발: 네이버 HyperCLOVA·카카오 Kanana가 AR 대신 DLM 채택 시 핵심 인프라로 활용 가능
- 로봇/Agent 추론: DLM의 plan-correction 능력이 필요한 경우(예: 카카오뱅크 상담 자동화)에서 실시간 응답
- 엣지 디바이스 DLM: 폴더블 폰·VR 헤드셋에 DLM 탑재 시 memory 한계 돌파
- 저지연 한국어 챗봇: 고객상담·콜센터 응답 latency 3배↓
8. 한계 + 후속 영향
한계:
- Projection layer의 step-specific 구조가 256 step 이상에서는 router 정확도 하락
- Code completion·긴 문서 생성에서는 재계산 비율이 30%까지 올라감(효율 ↓)
- Base DLM 자체의 한계(긴 컨텍스트 O(n²))는 해소하지 못함
후속 영향:
- DLM과 AR LLM의 하이브리드 가속(예: 초기 step은 AR, plan 수정 단계는 DLM) 연구 촉발
- Dream·LLaDA·MDLM 같은 오픈 DLM에 표준 캐시 메커니즘으로 채택 예상
- 2026년 LLM 추론 최적화(FLASH·vLLM) 커뮤니티에서 dLLM 라인을 별도 처리해야 하는 계기
🚀 이 기술领域의 스타트업
이 논문의 주제(최적화)와 같은 R&D 영역의 미국 스타트업
Anthropic
San Francisco, CA · 2021
**Constitutional AI** — 인간 라벨 대신 '헌장(Constitution)'으로 안전성 자기비판 후 RLHF/RLAIF 학습. Sleeper Agents / Sycophancy 등 안전 연구로 유명. Claude 3.5 Sonnet은 SWE-bench Verified 최고 성능 기록. Claude 4 Opus는 코딩·분석·장문 처리에 강점. AI 안전·해석 가능성(Interpretability) 분야를 최우선으로 투자.
PrismML
Pasadena, California, USA (Caltech 인근 · Caltech 스핀오프) · 2025
**1-bit / Ternary 가중치 압축의 선구주자**. 목적 함수는 모델 크기·복잡도 증가 없이 'intelligence density'(단위 추론당 intelligence)를 질적으로 끌어올리는 것 — 이들이 말하는 'Concentrating intelligence'. 기존 PTQ(Post-Training Quantization) 방식과 달리, 학습 단계부터 1-bit을 first-class로 가정하고 학습하는 full-stack 접근. 1-bit 가중치 세팅에서도 LLM-quality 텍스트 생성을 달성한 최초의 상용 솔루션. Bonsai 시리즈는 27B 같은 대형 모델도 6GB 미만 메모리 footprint로 단일 스마트폰에서 실시간 추론이 가능. 셀룰러 폰에서 27B 추론은 본질적으로 모델 크기와 정확도 trade-off의 종결을 의미.
Cartesia
San Francisco, CA · 2023
State Space Models (S4/Mamba) — **sequence 길이에 linear scaling**, transformer의 quadratic attention 대비 memory·power 효율 압도. Hardware-aware algorithm (kernel fusion, parallel scan, recomputation) 적용. 모듈 SSM + MLP 블록을 통합한 homogeneous architecture. Sonic (TTS) + Ink (STT) + Line (agent platform) + H-Nets (hierarchical 토크나이저 프리) 풀스택. Cloud + On-premise + On-device 동시 배포 (in-region mandatory). 실시간 voice AI 시장을 latency-first로 설계.