← 수도리무브 — 로보틱스 · 피지컬 AI
층 구조

Sharpa는 손안 조작만 강화학습으로 굽고 나머지는 VLA에 맡겼다

로봇 손을 만들어 온 회사가 낸 이층 구조를 뜯어봅니다. 사람이 조종해도 실패하는 구간만 강화학습 정책으로 미리 구워 발 페달에 붙였고, 그 효과가 성공률보다 데이터 수율에서 크게 드러납니다.

sudoremove JB · JC2026-03-1623분YouTube

Sharpa 는 로봇 손을 만들어 온 회사다. 엔비디아 GTC 부스에서 사과 깎기를 걸고, 사람이 조종하기 가장 어려운 손안 조작만 강화학습 정책으로 미리 구워 발 페달에 붙였다. 나머지는 모방학습 VLA(Vision-Language-Action, 시각·언어·행동 통합 모델)가 맡는 이층 구조이고, 진행자들은 이것을 위계적 구조로 읽는다.

핵심 포인트

  • 손안 조작만 떼어 강화학습으로 풀었다. 적당한 힘으로 쥐는 데에는 정답 데이터가 없어 사람 시범으로 못 가르친다. 그래서 PPO(Proximal Policy Optimization, 잘한 행동 쪽으로 정책을 조금씩 미는 강화학습 방법)로 아이작 랩(엔비디아의 로봇 시뮬레이터. 로봇 수천 대를 동시에 돌린다)에서 정책 둘을 굽는다 — 안정적으로 쥐기와 축 기준 돌리기다.
  • 조종 장비에 발 페달 세 개가 달렸다. 외골격과 햅틱 피드백에 더해 페달이 있고, 페달을 밟으면 그 강화학습 스킬이 켜진다. 게임에서 A키가 잡기, B키가 돌리기인 것과 같은 구조다.

페달이 왜 달렸나

페달 없이 사람이 다 조종하면사람 손가락으로쥐고 돌리기까지 흉내조종 자체가 실패한다적당한 힘엔 정답이 없다90회 중 31회만학습 데이터로 쓴다페달로 그 구간만 넘기면팔 옮기기사람이 한다발 페달 셋쥐기 · 축 기준 돌리기강화학습 정책 둘이 맡는다89% 가쓸 만해진다페달 누른 시점까지 모방학습이 배워, 나중에는 VLA 출력 하나가 그 스위치가 된다
사람이 외골격을 걸치고 로봇을 조종해 데이터를 모으는데, 손가락으로는 흉내가 안 되는 구간이 있다 — 적당한 힘으로 쥐고 축을 잡아 돌리는 동작이다. 그 구간에서 조종이 실패하니 90회를 시도해 31회만 학습 데이터가 됐다. 발 페달은 그 구간만 강화학습 정책에 넘기는 스위치이고, 그러자 89%가 쓸 만해졌다.
  • 페달 신호까지 학습 대상이다. 모방학습 단계에서 페달을 누른 시점을 함께 배워, 추론할 때 VLA의 출력 하나가 「사과 잡기 스킬 켜기」가 된다. 사람 발이 빠지는 자리가 여기다.
  • 효과는 성공률보다 데이터 수율에서 크게 드러난다. 텔레오퍼레이션(사람이 장비를 걸치고 로봇을 직접 조종하는 것)만으로는 90회 중 31회만 학습에 쓸 수 있는데, 강화학습 정책을 켜면 89%가 쓸 만해진다. 사과 깎기 성공률 자체는 30%이고 π0 베이스라인은 0%다.
  • 힘과 촉각은 뒤에서 주입한다. π0 백본이 촉각 입력을 받지 않아, 액션 토큰이 나온 뒤에 관절 토크와 손끝 촉각 센서를 받는 작은 MoE 트랜스포머를 따로 학습해 잔차로 얹는다.

판단과 반사를 나눠 맡긴다

사람 조종자외골격 · 햅틱 · 발 페달 3개판단 — 무엇을 할 차례인가VLA · 조종 데이터를 흉내 내 배운다출력 하나가 「스킬 켜기」반사 — 몸에 익어 바로 나가는 동작강화학습으로 미리 구워 둔 정책쥐기 · 축 기준 돌리기스킬 켜기 신호로봇 손
판단은 무엇을 할 차례인지 정하는 몫이고, 반사는 숙달돼서 생각하지 않고 나가는 동작이다. 오른손으로 사과를 깎는 동작은 VLA가 흉내 내 배우고, 손가락으로는 조종이 안 되는 쥐기와 돌리기는 강화학습 정책이 맡는다. 페달을 누른 시점까지 VLA가 배워 나중에는 스스로 켠다.
  • 사람의 반사 동작에 견준다. 숙달된 사람이 생각하지 않고 하는 동작을 미리 구워 둔 스킬로 읽고, 손가락을 여섯 개 일곱 개로 늘려 사람이 못 하는 스킬을 만들 수도 있다는 상상까지 나아간다.

주요 숫자

90회 중 31회
순수 텔레오퍼레이션으로 건진 학습 데이터
89%
강화학습 스킬을 켜고 조종했을 때의 수율
30% / 0%
사과 깎기 성공률과 π0 베이스라인
페달 3개
조종자가 스킬을 켜는 입력

이게 정답이 아닐 수도 있죠. 근데 이게 됐다라는 걸 보여줬다는게 나는 굉장히 중요한 거 같아요.

반론 · 충돌

  • 성공률 30%를 어떻게 읽을 것인가사과 깎기 성공 판정 기준이 논문 밖에서는 확인되지 않는다. 베이스라인이 0%라는 대비가 커 보여도 실험 표가 하나뿐이고, 진행자들도 GTC 부스에서 실제로 그 시연을 할지 확신하지 않는다.
  • 무엇이 주된 기여인가 — 같은 편 진행자들 사이한쪽은 스킬 위계(어려운 구간을 떼어 미리 굽고 VLA가 켜게 한 것)를 기여로 보고, 힘·촉각 잔차는 왜 필요한지 논문만으로는 모르겠다고 말한다. 무엇이 수율을 올렸는지는 따로 떼어 실험한 자료가 없다.
  • 같은 채널 「Action Data Scaling 문제」기초 4강은 데이터를 모으는 경로 다섯 가운데 어느 것도 스케일 문제를 푼다고 입증되지 않았다고 닫는다. Sharpa가 올린 것은 모델 성능이 아니라 사람이 조종해 건지는 비율이다. 병목을 옆으로 밀어 둔 것이지 없앤 것은 아니다.
유튜브 자동 자막 전문을 요약한 카드입니다. 자동 인식이라 회사·모델 이름이 흔들리는 대목이 있어 영상 설명란과 논문으로 맞춰 적었습니다. 자막은 Sharpa를 「셰파」와 「샤파」로 번갈아 받아 적고 설명란 목차에도 Sherpa가 한 번 나오는데, 논문 링크 표기를 따라 Sharpa로 통일했습니다. 이 회사가 로봇 손을 만들어 왔다는 것은 이 편이 아니라 같은 채널의 「로봇 손 직접 다 써보고 알려 드림」(2026-06-21)과 「CES 로봇 리뷰」(2026-01-14)에서 다룹니다. 숫자는 진행자가 말한 것을 그대로 옮겼고 따로 검증하지 않았습니다. 투자 추천이 아닙니다. 같은 영상에서 카드 둘이 나왔습니다 — 한 편이 회사 둘을 나란히 다뤄, 방법이 갈리는 자리에서 방식별로 나눠 실었습니다.