모두의 AI
멀티모달 중급 ✓ 8섹션 상세 리뷰 2주 전

CLIFT — 모델을 열지 않고 휴머노이드 로봇을 현장 특화하기

원제: CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning

CLIFT는 모델 가중치와 내부 학습 신호를 보지 못하는 관리형 API에서도 배포 보상을 지도학습 데이터로 바꿔 로봇 정책을 반복 개선합니다.

출처: arXiv cs.AI · arXiv:2607.29172 원문 ↗

1. 한줄 요약


CLIFT는 폐쇄형 로봇 파운데이션 모델의 가중치·그래디언트·손실을 볼 수 없어도, 실제 배포에서 얻은 보상을 API가 받을 수 있는 지도 데이터로 변환해 휴머노이드 정책을 반복 개선하는 방법입니다.


2. 왜 등장했는가 (Background)


강력한 로봇 모델은 독점 데이터와 폐쇄 가중치로 제공되는 경우가 많고, 사용자는 관리형 SFT API에 시연 데이터를 보내 조정된 정책을 받는 방식에 의존할 수 있습니다. 그러나 순수 모방학습만으로는 새로운 상태, 행동 추적 동역학, 지연, 접촉이 많은 휴머노이드 작업의 실패를 충분히 고치기 어렵습니다. 내부 학습 신호 없이도 폐루프 개선을 만드는 것이 이 연구의 출발점입니다.


3. 핵심 아이디어


실제 로봇이 작업을 수행하면 배포 시점의 보상과 실패 정보를 모읍니다. 이를 API에 제출할 수 있는 지도학습 예제로 바꾸고, 다시 조정된 정책을 배포해 새로운 피드백을 얻는 순환을 만듭니다. 핵심은 모델을 열거나 강화학습의 내부 확률을 계산하지 않고도, 관측된 결과를 다음 SFT 데이터로 재구성한다는 점입니다.


시연 데이터 → 관리형 SFT API → 로봇 배포
→ 보상·실패 기록 → API용 지도 데이터 변환
→ 재학습 요청 → 다음 배포

4. Model Architecture


CLIFT의 시스템 구조는 로봇 파운데이션 모델 자체보다 API와 현실 환경 사이의 데이터 변환 고리에 있습니다. 연구 대상은 Gemini Robotics On-Device이며, 정책 출력과 실제 행동 사이의 차이를 배포 피드백으로 측정하고 그 차이를 시연 형식으로 되돌립니다. 초록은 GROD의 내부 네트워크 구조나 변환기의 구체적 모델을 설명하지 않으므로, 내부 아키텍처를 추정해서는 안 됩니다.


5. Training & Data


초록에서 확인되는 데이터는 동일한 시연 데이터로 비교한 직접 SFT와, 실제 휴머노이드 배포에서 얻은 보상 피드백으로 만든 API 호환 지도 데이터입니다. CLIFT는 이 데이터 순환을 두 번의 flywheel cycle로 수행해 정책을 개선했다고 보고합니다. 시연 수, 보상 정의, 작업 수와 API의 세부 제한은 초록에 제시되지 않았습니다.


6. Result


실제 휴머노이드에서 직접 SFT한 GROD가 같은 시연으로 학습한 주요 오픈 웨이트 VLA보다 크게 앞섰지만, 민첩하고 접촉이 많은 작업에서 배포 수준의 숙련에는 미치지 못했다고 저자들은 설명합니다. CLIFT를 두 번 순환한 뒤에는 거의 완벽한 성공에 도달했다고 보고합니다. 초록에는 절대 성공률이나 작업별 표가 없으므로 이 표현 이상으로 수치를 확장하지 않습니다.


단계초록에 확인되는 결과
직접 SFT동일 시연의 주요 오픈 웨이트 VLA보다 우수
CLIFT 두 순환거의 완벽한 성공에 도달
내부 접근가중치·그래디언트·손실 없이 개선

7. 한국 독자 적용 사례


국내 로봇 스타트업이나 연구실이 폐쇄형 로봇 API를 활용해 현장별 집기·조립 작업을 특화할 때 참고할 수 있습니다. 실패 영상을 무작정 다시 학습시키기보다, 어떤 상태에서 어떤 행동이 실패했는지와 보상 결과를 API용 예제로 정리하는 운영 루프를 만들 수 있습니다. 개인정보와 작업자 안전 정보가 포함된 로그는 별도 접근 통제가 필요합니다.


8. 한계 + 후속 영향


관리형 API의 데이터 형식·호출 비용·업데이트 지연에 성능이 크게 좌우될 수 있으며, 사용자는 여전히 모델 내부를 검증할 수 없습니다. 실제 보상 신호가 부정확하면 실패를 교정하기보다 잘못된 행동을 반복 학습할 위험도 있습니다. 후속 연구는 작업별 보상 설계, API 버전 변화에 대한 안정성, 오프라인 검증과 안전 중단 기준을 다뤄야 합니다.

Related Startups

🚀 이 기술领域의 스타트업

이 논문의 주제(멀티모달)와 같은 R&D 영역의 미국 스타트업

스타트업 전체 보기 →