논문 리뷰
arXiv 등 최신 AI 논문을 한국어로 큐레이션합니다 · 전체 32편 · 7일 이내 7편
엣지 SLM의 다국어 양자화 세금: 구조적 붕괴와 문자적 취약성
4-bit 가중치 양자화가 다국어 소형 LLM(Gemma 4·Qwen 3.5)에 미치는 손실을 8개 언어로 분석. 영어는 1~3%p 손실이지만 한국어·아랍어 같은 비라틴/저자원 언어에서 5~22%p 손실이 발생하며, self-attention 초기층에서 구조적 붕괴가 시작됨. 한국 독자는 온디바이스 한국어 SLM 배포 시 품질 가이드로 활용 가능.
Archer: 확산 언어 모델의 효율적 롤백을 위한 캐시 은닉 상태 적응형 재사용
확산 언어 모델(DLM)이 자기회귀 LLM 대비 갖는 롤백 가능성을 살리면서 KV cache 효율을 3.2배 끌어올리는 Archer 메커니즘. 응답 토큰의 은닉 상태를 step마다 적응적으로 재사용하여 prompt KV cache는 고정. 추론 latency 3배↓·메모리 1/4.5로 감소하면서 코드/수학 정확도 손실은 1%p 미만. 한국어 DLM·온디바이스·저지연 챗봇에 즉각 적용.
HoloQ-VLA: 비전-언어-액션 모델의 균일 W4A4 양자화
Vision-Language-Action(VLA) 로봇 정책 모델 전체를 단일 Hadamard 회전만으로 W4A4 균일 양자화. 기존 mixed-precision 대비 메모리 3.7배↓·latency 3.5배↓하면서 120개 태스크 성공률 손실 0.8%p. OpenVLA-7B를 3.8GB로 줄여 Jetson Orin에서 110ms 추론. 국내 휴머노이드·협동로봇·가전로봇의 온디바이스 VLA 배포에 직접 활용.
ThinkRetrieve: 테스트-시간 스케일링을 위한 검색-증강 추론 궤적
LLM의 test-time scaling 한계를 추론 단계마다 solved example을 검색해 보완하는 ThinkRetrieve. AIME 2024에서 56.3%→71.9%, 한국어 수학에서 68.4%→84.1%로 정확도 12~16%p 향상, 토큰 소비는 35%↓. 한국어 RAG·수학 튜터·법률 LLM·의료 AI에 즉각 적용 가능.
장기 툴 사용 에이전트 작업을 위한 효율적 강화학습
장기 툴 사용 에이전트 RL 학습을 위한 모듈형 시스템 SINKFLEX-RL. Gymnasium 래퍼·VERL rollout·Sink-Normalized Attention·GRPO 결합으로 τ-bench 38.2%→58.9%, SWE-bench 12.4%→23.1%, 7개 벤치마크 평균 +13.4%p. 학습 비용 1/4.5↓(8×H100 32h). 한국어 CS·Banking·헬프데스크 RL 학습에 즉각 활용.
PRMU: 멀티모달 LLM의 인물 중심 지식 언러닝을 위한 corpus-free 벤치마크
멀티모달 LLM(MLLM)의 인물 정보 삭제(unlearning)를 corpus-free 환경에서 평가하는 첫 벤치마크 PRMU. 5,000명 인물·6,000개 query·11개 SOTA MLLM·10개 알고리즘 평가. 평균 47% 삭제 실패, adversarial에서 68% leak. WGA가 best(31% 실패). EU AI Act·한국 AI기본법 '잊혀질 권리' 대응 필수 도구로 부상.
대형 언어 모델의 불확실성 신호로서의 어텐션 경로 취약성
LLM의 불확실성을 출력 confidence가 아닌 어텐션 헤드 마스킹 후 부분 망 간 상호정보량(BALD)으로 측정하는 학습-free 추정기 ASMI. Hallucination detection AUROC 0.71→0.84, calibration 0.18→0.11. 한국어 RAG·민감 도메인 챗봇·TruthfulQA-Ko 평가·LLM-as-judge 신뢰도 산출에 활용.
ThinkReset — 제한된 문맥에서 장기 추론을 이어가는 중간 인터페이스
ThinkReset은 중간 결과를 재사용 가능한 인터페이스로 기록하고 문맥을 초기화해, 제한된 문맥 창에서도 장기 추론을 이어가는 방법을 제안합니다.
ViSAGE — 장편 영상 이해를 위한 자기 교정 메모리
ViSAGE는 영상 속 개체의 정체성을 묶고 과거 기록을 다시 고치는 자기 교정형 멀티모달 메모리를 제안합니다.
SciToolAgent-Evo — 과학 도구를 스스로 확장하는 온톨로지 인식 에이전트
SciToolAgent-Evo는 변화하는 과학 작업에서 도구를 탐색·획득하고 온톨로지 그래프에 통합하는 자기 진화형 에이전트입니다.
ActFovea — 시각·행동 일관성으로 로봇 VLA를 실행 중 보호하기
ActFovea는 시각·상태·행동의 시간적 일관성을 검사해 VLA 로봇 정책을 재학습 없이 실행 중 보호합니다.
CLIFT — 모델을 열지 않고 휴머노이드 로봇을 현장 특화하기
CLIFT는 모델 가중치와 내부 학습 신호를 보지 못하는 관리형 API에서도 배포 보상을 지도학습 데이터로 바꿔 로봇 정책을 반복 개선합니다.
Translation with Thought — 번역 난이도에 맞춰 추론량을 조절하기
TwT는 번역 난이도에 따라 직관적 처리와 숙고형 추론을 선택해 품질을 유지하면서 추론 토큰을 줄입니다.
ECL — 네 가지 학습 방식을 하나로 묶은 온디바이스 적응
ECL은 임베더 중심 설계로 퓨샷·제로샷·연속·인컨텍스트 학습을 자원 제약 엣지 기기에서 통합합니다.
능동적 기업용 에이전트를 위한 컨텍스트 그래프
검색 증강 생성(RAG)과 에이전트 프레임워크는 기업용 AI를 크게 발전시켰지만, 에이전트는 여전히 본질적으로 반응적입니다. 즉, 사람이 질의하기 전에는 움직이지 않습니다. 본 논문은 진정한 기업용 능동성(proactive enterprise)을 위해 컨텍스트 그래프를 제안하며, 에이전트가 사용자 질의 이전에도 컨텍스트를 추적하고 행동할 수 있도록 설계합니다.
농업 회복력 분석을 위한 AI 통합 모델
농산물 공급망은 연계된 생물물리적·경제 시스템의 충격에 취약합니다. 본 연구는 경제 모델(GTAP)과 생물물리 모델(APSIM)을 결합한 AI 도구를 개발해 공급망 회복력을 분석합니다. 정책 입안자와 농산업 의사결정자에게 정량적 시나리오를 제공합니다.
인간과 대규모 언어 모델 집합을 위한 적대적 사회 인식론
본 논문은 인간과 LLM이 밀접하게 상호작용하는 의사소통 환경에서 작동하는 적대적 사회 인식론(ASE)을 제안합니다. 증언·추론·제도적 인증·암묵적 신뢰의 사슬 위에서 공공적 주장이 형성되는 양상을 분석합니다.
임상 요구와 AI 역량의 정렬 — 의료 추론 LLM 서베이
대규모 언어 모델(LLM)은 의료 분야에서 임상 추론과 환자 진료 보조 도구로 부상하고 있습니다. 본 서베이는 의료 LLM의 최근 진전을 다루며, 추론 응용·데이터셋·평가 방법·현실 배치 시 고려 사항을 정리합니다.
정렬 타당성 — 의료 AI 보증을 위한 새로운 기준
LLM은 정신 건강 지원의 중요한 제공자가 되었지만, 여전히 attention economy의 산물이며 상업적 목표가 실질적 치료보다 사용자 지속 참여를 우선시하는 구조입니다. 본 논문은 의료 AI에서 정렬 타당성(alignment plausibility)을 새로운 보증 기준으로 제안합니다.
AgentLens — 코딩 에이전트 평가를 위한 실전 궤적 리뷰
저자는 인터랙티브 코드 에이전트를 위한 실전 평가 벤치마크 AgentLens를 제시합니다. 기존 코드 에이전트 벤치마크는 작업 성공 여부(0/1) 하나로 평가하지만, 실제 사용자는 전체 궤적의 품질을 경험합니다. AgentLens는 실제 배포 환경에서 평가한 궤적 리뷰를 제공합니다.
인컨텍스트 검색은 언제 도움이 되는가 — 반성적 추론의 샘플링 복잡도 이론
확장된 추론으로 LLM을 학습시키면 인컨텍스트 검색(in-context search)이 가능해집니다. 모델이 해법을 생성·비판·수정하는 과정을 반복하는 것이죠. 본 논문은 인컨텍스트 검색의 이론적 분석을 샘플링 복잡도 관점에서 제시합니다.
에이전트 기반 모델링에서의 LLM 추론
에이전트 기반 모델링(ABM)은 정책 결정에 유용한 수백만 명 단위의 개인과 상호작용을 시뮬레이션할 수 있지만, 전통적으로 정적 사전 분포에 의존해 환경 변화에 적응하지 못합니다. 본 논문은 LLM 기반 추론을 ABM에 통합해 적응형 모델링을 구현합니다.
QANTIS — IBM Heron 기반 하드웨어 보정 순차 POMDP 신념 갱신
부분 관측성 하에서 작동하는 자율 시스템은 원시 센서 이벤트가 아니라 신념(belief) 위에서 행동합니다. QANTIS는 양자 프로세서를 보정된 신념 갱신 서비스로 사용해 prior와 관측 모델을 받아 사후 신념을 추정합니다.
ARC-AGI-1 추상 추론·일반화를 위한 비용 효율적 에이전트 하네스
ARC-AGI-1의 최근 진전은 두 가지 경로에서 옵니다. 진보 모델의 대규모 테스트-타임 연산(진화 탐색·완전 샘플링·확장 연쇄 추론), 또는 벤치마크 특화 튜닝. 본 연구는 비용 효율적인 에이전트 하네스를 제시합니다.
BitNet 1.58 — ternary LLM의 실용화
Ma 등이 제안한 BitNet 1.58은 ternary {−1, 0, +1} 가중치로 100B+ LLM에서도 fp16과 동등 성능을 달성. BitNet b1.58 (3B) 오픈소스 공개. llama.cpp 통합으로 CPU에서도 5-7x 빠른 추론.
FlashAttention-2 — GPU attention의 사실상 표준
Tri Dao가 제안한 FlashAttention-2는 GPU SRAM에 tile 단위로 attention을 올려 HBM I/O를 최소화. FlashAttention v1 대비 2x, A100/H100에서 표준 attention 대비 4-9x 빠름. PyTorch native 통합.
BitNet — 1-bit LLM의 첫 번째 성공
Ma 등이 제안한 BitNet은 LLM의 가중치를 {-1, 0, +1} 1-bit로 양자화하면서 fp16 모델과 동등 성능을 달성. 새로운 학습 패러다임 — 1.58-bit 후속 연구로 이어짐. 메모리 7x, 에너지 71x, latency 4x 절감.
QLoRA — 65B 모델을 단일 GPU에서 fine-tuning
Dettmers 등이 제안한 QLoRA는 4-bit NormalFloat(NF4) 양자화 + Low-Rank Adapter + paged optimizer를 결합해, 65B 모델을 단일 48GB GPU에서 fine-tuning. full fine-tuning 대비 메모리 1/4, 성능은 동등. HuggingFace PEFT 통합으로 즉시 사용 가능.
SmoothQuant — LLM용 W8A8 PTQ의 표준
Xiao 등이 제안한 SmoothQuant는 LLM activation의 outlier를 가중치에 분산시키는 수학적 변환으로 W8A8 양자화 정확도를 회복. ONNX Runtime + TensorRT-LLM 통합, NVIDIA GPU에서 fp16 대비 1.5x 속도 향상.
LLM.int8() — 스케일 트랜스포머의 8-bit 행렬곱
Dettmers 등이 제안한 LLM.int8()은 175B OPT 트랜스포머를 int8 행렬곱으로 추론하면서 perplexity 손실 0을 달성. 핵심 통찰은 모든 가중치를 8-bit로 압축하면 안 된다 — outlier feature(0.1%)만 fp16으로 분리하고 나머지는 int8로. HuggingFace BitsAndBytes 라이브러리로 즉시 사용 가능.
Latent Diffusion Models — Stable Diffusion의 원리
CompVis(뮌헨 LMU) + Runway 팀이 제안한 Latent Diffusion Model. 픽셀 대신 VAE의 잠재 공간에서 denoising을 수행해 학습 비용 10배↓·고해상도 512×512 생성. Stability AI의 Stable Diffusion, SDXL·SD3의 직접적 기반.
Attention Is All You Need — Transformer의 탄생
2017년 구글 브레인 팀이 제안한 Transformer. RNN·CNN 없이 self-attention만으로 번역 모델을 만들어 병렬 학습과 장거리 의존성 동시 해결. WMT 2014 영어-독일어 BLEU 28.4·영어-프랑스어 41.8로 SOTA 경신. 이후 모든 LLM(GPT·Claude·Gemini·Llama)의 기반.