모두의 AI
LLM 중급 ✓ 8섹션 상세 리뷰 5일 전

ThinkRetrieve: 테스트-시간 스케일링을 위한 검색-증강 추론 궤적

원제: ThinkRetrieve: Retrieval-Augmented Reasoning Traces for Test-Time Scaling

LLM의 test-time scaling 한계를 추론 단계마다 solved example을 검색해 보완하는 ThinkRetrieve. AIME 2024에서 56.3%→71.9%, 한국어 수학에서 68.4%→84.1%로 정확도 12~16%p 향상, 토큰 소비는 35%↓. 한국어 RAG·수학 튜터·법률 LLM·의료 AI에 즉각 적용 가능.

출처: arXiv cs.AI · arXiv:2608.10928 원문 ↗

1. 한줄 요약

LLM의 test-time scaling(긴 CoT) 한계를 추론 단계마다 관련 예시를 검색해 보완하는 프레임워크 ThinkRetrieve 제안. AIME·Math·HumanEval에서 CoT만 단독으로 쓸 때보다 12~24%p 정확도 향상을 보이면서도 컴퓨트 비용은 1/3.


2. 왜 등장했는가 (Background)

LRM(Large Reasoning Model, 예: OpenAI o1·DeepSeek-R1·QwQ)은 test-time compute를 늘려(longer CoT) 성능을 끌어올리는 paradigm을 정착시켰습니다. 그러나 최근 연구들이 보여준 한계:

  • Diminishing returns: step을 2배 늘려도 정확도 0~2%p만 오름
  • Negative returns: 너무 긴 trace는 오히려 error compounding·drift 발생
  • Cost explosion: 한 문제당 토큰 5K~30K 소비, 응답 latency 급증

이에 "더 길게 사고" 대신 "더 정확하게 사고"라는 방향이 대두되었고, RAG와 결합해 external solved examples를 주입하는 것이 핵심으로 떠올랐습니다.


3. 핵심 아이디어

단순 top-k retrieval이 아니라, 현재 추론 step의 부분 사고(partial reasoning)와 가장 유사한 solved example의 해당 step을 retrieve.

for step s in reasoning_trace:
query = embedding(partial_reasoning_so_far)
retrieved = top_k(corpus, query, k=2)
augmented_step = llm.continue(
context + step_prompt + retrieved_examples
)

핵심 설계:

  1. Step-level (not query-level) retrieval: 전체 문제가 아니라 현재 사고 단계와 매칭
  2. Curriculum-aware corpus: 난이도 분포가 균형 잡힌 solved example bank (1M problems)
  3. Adaptive termination: 검색 결과가 더 이상 도움이 안 되면 early-termination

4. Model Architecture

  • Retriever: BGE-M3 (다국어 dense retrieval), Korean·English 동시 지원
  • Corpus Index: 1M solved math/code problems, step-level split (avg 6.4 steps per problem)
  • Reasoner: QwQ-32B-Preview + DeepSeek-R1-Distill-70B 두 가지 평가
  • Controller: 각 step마다 retrieval-trace tradeoff 학습된 라우터

5. Training & Data

  • Corpus: MATH train set + NuminaMath + OpenR1-Math (총 1.2M problems, step-level 풀이 포함)
  • Retriever 학습: contrastive (BM25 baseline + GPT-4 labeled 50K positive pairs)
  • Controller: 5K traces에서 지도학습, "retrieval hit가 있으면 계속, 없으면 stop"
  • 평가지표: AIME 2024/2025, MATH-500, HumanEval, GPQA-Diamond, Korean MATH (K-MATH)

6. Result

DeepSeek-R1-Distill-70B 기준 (평균):

  • AIME 2024 pass@1: 56.3% (baseline R1) → 71.9% (ThinkRetrieve) · +15.6%p
  • MATH-500: 92.7% → 97.2% · +4.5%p
  • K-MATH (한국어 수학): 68.4% → 84.1% · +15.7%p (한국어 corpus 효과)
  • HumanEval: 88.1% → 91.5% · +3.4%p
  • 평균 토큰 소비: 18,240 → 11,820 (-35%)
  • 총 wall-clock: 4.1s → 3.5s (검색이 trace보다 빠른 경우 多)

7. 한국 독자 적용 사례

  • 한국어 수학/과학 튜터링: 대성마이맥·EBSi AI 튜터가 R1·QwQ 한국어 모델에 ThinkRetrieve 결합하면 한국어 수학 15%p↑
  • 법률·계약 LLM: 한국 법령 판례 corpus를 step-level로 chunking, 계약 검토 정확도↑
  • 의료 AI: 가이드라인·논문 데이터베이스와 결합, 근거 기반 진료 보조
  • 코딩 에이전트: GitHub 이슈→PR 자동 작성 시 기존 오픈소스 PR 풀이 검색
  • LLM 자체 학습: 한국어 SFT 데이터 부족 문제 보완 — 외국 reasoning 데이터 + retrieved example로 한국어 능력↑

8. 한계 + 후속 영향

한계:

  • Corpus 구축 비용이 매우 큼 (1M problems × step-level annotation)
  • Retriever 자체가 한국어에 약하면 step-level 매칭이 깨짐 (BGE-M3 외 대안 필요)
  • Hallucination이 retrieved example에서 새는 경우 difficulty selection tricky

후속 영향:

  • OpenAI o3·Anthropic Claude 4 등의 "thinking with retrieval" 자연스러운 결합
  • RAG convention이 "전체 query → top-k" → "partial reasoning → step-level top-k"로 paradigm shift
  • 한국어·저자원 언어 LLM의 추론 능력 격차 해소에 직접 기여
  • Agentic RAG(2605.11611 CuSearch 등)·self-evolving agent(MEGA 2608.10504)와 시너지
Related Startups

🚀 이 기술领域의 스타트업

이 논문의 주제(LLM)와 같은 R&D 영역의 미국 스타트업

AI/ML 온디바이스

Anthropic

San Francisco, CA · 2021

**Constitutional AI** — 인간 라벨 대신 '헌장(Constitution)'으로 안전성 자기비판 후 RLHF/RLAIF 학습. Sleeper Agents / Sycophancy 등 안전 연구로 유명. Claude 3.5 Sonnet은 SWE-bench Verified 최고 성능 기록. Claude 4 Opus는 코딩·분석·장문 처리에 강점. AI 안전·해석 가능성(Interpretability) 분야를 최우선으로 투자.

AI/ML 온디바이스

PrismML

Pasadena, California, USA (Caltech 인근 · Caltech 스핀오프) · 2025

**1-bit / Ternary 가중치 압축의 선구주자**. 목적 함수는 모델 크기·복잡도 증가 없이 'intelligence density'(단위 추론당 intelligence)를 질적으로 끌어올리는 것 — 이들이 말하는 'Concentrating intelligence'. 기존 PTQ(Post-Training Quantization) 방식과 달리, 학습 단계부터 1-bit을 first-class로 가정하고 학습하는 full-stack 접근. 1-bit 가중치 세팅에서도 LLM-quality 텍스트 생성을 달성한 최초의 상용 솔루션. Bonsai 시리즈는 27B 같은 대형 모델도 6GB 미만 메모리 footprint로 단일 스마트폰에서 실시간 추론이 가능. 셀룰러 폰에서 27B 추론은 본질적으로 모델 크기와 정확도 trade-off의 종결을 의미.

AI/ML 온디바이스

Cartesia

San Francisco, CA · 2023

State Space Models (S4/Mamba) — **sequence 길이에 linear scaling**, transformer의 quadratic attention 대비 memory·power 효율 압도. Hardware-aware algorithm (kernel fusion, parallel scan, recomputation) 적용. 모듈 SSM + MLP 블록을 통합한 homogeneous architecture. Sonic (TTS) + Ink (STT) + Line (agent platform) + H-Nets (hierarchical 토크나이저 프리) 풀스택. Cloud + On-premise + On-device 동시 배포 (in-region mandatory). 실시간 voice AI 시장을 latency-first로 설계.

스타트업 전체 보기 →