모두의 AI
멀티모달 중급 ✓ 8섹션 상세 리뷰 5일 전

PRMU: 멀티모달 LLM의 인물 중심 지식 언러닝을 위한 corpus-free 벤치마크

원제: PRMU: A Corpus-Free Benchmark for Person-Centric Knowledge Unlearning in Multimodal Large Language Models

멀티모달 LLM(MLLM)의 인물 정보 삭제(unlearning)를 corpus-free 환경에서 평가하는 첫 벤치마크 PRMU. 5,000명 인물·6,000개 query·11개 SOTA MLLM·10개 알고리즘 평가. 평균 47% 삭제 실패, adversarial에서 68% leak. WGA가 best(31% 실패). EU AI Act·한국 AI기본법 '잊혀질 권리' 대응 필수 도구로 부상.

출처: arXiv cs.CV · arXiv:2608.11149 원문 ↗

1. 한줄 요약

멀티모달 LLM(MLLM)의 인물 정보 삭제(unlearning)corpus-free 환경에서 평가하는 첫 벤치마크 PRMU 제안. 원본 forget/retain 데이터셋 없이도 자연 발생 학습 지식을 진단·삭제하는 6,000개 query로, 11개 SOTA MLLM에서 평균 47% 삭제 실패율을 보였습니다.


2. 왜 등장했는가 (Background)

EU AI Act(2024)·한국 AI 기본법(2026.1)은 개인 정보 삭제권(GDPR Article 17)을 LLM에 명시적으로 요구합니다. "잊혀질 권리"의 LLM 버전 — 사용자가 "나에 대한 학습을 잊어라"라고 요청하면 모델이 해당 인물을 식별·재현·기술하지 못해야 합니다. 기존 MLLM unlearning 연구는 원본 학습 코퍼스 일부를 forget set으로 가정했지만, 실제 대형 모델은 사전학습 데이터가 폐쇄·미공개인 경우가 대부분이라 현실성 부족이었습니다. PRMU는 corpus-free — 모델 안에 이미 박혀있는 자연 발생 인물 지식을 진단하는 데 초점.


3. 핵심 아이디어

4단계 파이프라인:

  1. Person probing: 5,000명의 유명 인물(이름·이미지·텍스트 묘사 3-modality), 11개 MLLM에 대해 identification·description·inference 3가지 task로 query
  2. Knowledge qualification: 모델이 정확히 답하면 "known", 부정확하면 "unknown" — 이 set이 baseline reference
  3. Unlearning protocol: 10가지 인기 unlearning 알고리즘(gradient ascent·NPO·SCRUB·WGA·ToFU·MU)等을 적용하되 forget set은 모델 자체 query 응답 (corpus-free)
  4. Evaluation: 6,000개 post-unlearning query로 (a) deletion success, (b) utility retention, (c) adversarial robustness 측정

4. Model Architecture

  • Tested MLLMs: LLaVA-1.6-13B, Qwen2-VL-7B, InternVL2-8B, GPT-4V, Claude 3.5 Sonnet, Gemini 1.5 Pro 등 11개
  • Unlearning algorithms: Gradient ascent, SCRUB, NPO, WGA, IDEM, Task Vector, MU, ToFU, SalUn, RMU
  • Prompt types: zero-shot, retrieval-augmented, chain-of-thought — 단순 prompt와 adversarial prompt 분리 평가
  • Modality coverage: image-only, text-only, image+text 3가지

5. Training & Data

  • Person set: 5,000명 (스포츠·학자·정치인·배우·Youtuber 균형), wikipedia·이미지 100+장·인용 가능한 interview transcript
  • Query templates: 6,000개 (identification 1,800 + description 2,400 + inference 1,800)
  • Adversarial subset: 1,200개 (간접 inference, paraphrase, role-play)
  • 평가자: GPT-4o judge + 3명의 human annotator (agreement 0.87)

6. Result

11개 MLLM × 10가지 알고리즘 평균:

  • Deletion Success Rate (낮을수록 좋음): 평균 47% — 절반 가까이 unlearning 실패
  • Utility Retention (MMLU·OCR·VQA): 평균 -3.8%p (acceptable)
  • Adversarial robustness: 평균 68% — paraphrase·role-play에서 정보 leak 빈번
  • Best algorithm: WGA(Weighted Gradient Ascent) — 31% deletion failure
  • Worst algorithm: Plain gradient ascent — 79% failure
  • Closed vs open 모델: GPT-4V·Claude 3.5가 더 robust (instruction-following이 unlearning 행동 우선)

7. 한국 독자 적용 사례

  • 한국 AI 기본법 대응: 2026년 1월 시행된 AI 기본법이 명시한 "개인 정보 처리 거부권"을 호환하려면 MLLM unlearning 기술이 필수. PRMU는 국내 MLLM(LG EXAONE-VL·NAVER HyperCLOVA Vision·Kakao Kanana-Vision) 평가 베이스라인
  • 초상권·저작권 분쟁: 셀럽·정치인·일반인 얼굴이 학습된 모델을 배포하는 스타트업이 입증 책임을 충족하는 데 활용
  • 국내 의료 AI: 환자 동의 철회 시 모델이 환자를 식별하지 못하게 하는 메커니즘 검증
  • AI 윤리 컨설팅: PRMU 점수가 MLLM 출시 전 self-audit 항목으로 채택 가능

8. 한계 + 후속 영향

한계:

  • 5,000명 표본이 글로벌 다양성을 incomplete — 한국·동남아 인물 부족
  • corpus-free의 평가가 실제로 forget이 일어났는지 간접 측정 — fine-tuning memorization은 검증 어려움
  • Closed 모델(GPT-4V·Claude) 내부 알고리즘 노출 불가, 동일 baseline 적용 어려움

후속 영향:

  • MLLM unlearning 연구의 표준 벤치마크로 자리잡을 가능성↑ — WMDP·MMLU-Redux의 multimodal counterpart
  • EU AI Act·한국 AI기본법 실효성 평가 도구로 정책当局 활용
  • Medical AI·금융 AI 등 high-stakes 도메인에서 unlearning audit 표준화
  • WGA·SalUn 등 알고리즘의 개선 race 촉발
Related Startups

🚀 이 기술领域의 스타트업

이 논문의 주제(멀티모달)와 같은 R&D 영역의 미국 스타트업

스타트업 전체 보기 →