← 수도리무브 — 로보틱스 · 피지컬 AI
휴먼 영상 학습과 액션 데이터 병목

Figure Helix는 2025년 6월에도 물류 한 과제에 상체만 썼고 온몸 균형은 다루지 않았다

여덟 달 뒤 나올 Helix 02(온몸 균형까지 이미테이션 러닝으로 푼 모델)보다 앞선 시점의 Helix를 잡는다. 이때는 물류 한 과제에 상체만 쓰고 있었고, 개선은 프레임·촉각 입력을 늘리고 스테레오 카메라를 다는 인지 쪽에 머물렀다. 같은 편에서 테슬라 옵티머스의 싱글 뉴럴넷 주장과 화성행 계획, 그리고 로봇 액션 데이터를 만드는 두 방식 방법(엔비디아 드림젠의 영상 생성과 HuggingFace SmolVLA의 크라우드소싱)까지 함께 본다.

sudoremove JB · JC2025-06-1030분YouTube

Figure AI가 2025년 6월 7일 공개한 Helix 1시간 데모는 물류 창고에서 종이 택배 바코드를 스캐너 쪽으로 돌려 보내는 과제 하나에 상체만 써서, 실패(약 40분 지점에서 택배를 떨어뜨림)와 복구까지 그대로 담았다. 이 시점 Helix는 골반·다리를 쓰는 온몸 제어는 아직 다루지 않는다. 같은 편에서 테슬라 옵티머스가 단일 신경망 하나로 여러 과제를 프롬프트에 따라 수행한다고 주장한 데모와, 2026년 화성 무인 발사 계획도 함께 짚는다.

핵심 포인트

  • 물류 한 과제, 상체만. 세 달 전(2025년 3월) 공개분은 느린 컨베이어에서 물건을 미는 정도였는데, 6월 7일 공개분은 디포머블(deformable, 힘을 주면 형태가 바뀌는) 종이 택배를 한 시간 동안 실패를 거의 없이 다뤘다. 골반·다리를 쓰는 온몸 제어는 이 시점에 아직 없다.
  • 실패도 그대로 담겼다. 약 40분 지점에서 택배를 떨어뜨리고, 세로로 놓인 박스에서는 바코드를 못 찾는 장면이 나온다. 학습 데이터에 그 각도가 충분치 않았을 가능성으로 진행자들은 짚는다.

오래 버티는 것과 넓게 되는 것

2025년 6월 데모물류 한 과제오래 — 1시간 이어감40분에 한 번 떨어뜨렸다넓게 — 여러 과제 전환낯선 환경점선 쪽은 이 편에서 보이지 않았다긴 데모는 오래 버틴다는 증거이지 넓게 된다는 증거가 아니다온몸 균형은 여덟 달 뒤 Helix 02 에서야 나온다
한 시간짜리 데모는 오래 버틴다는 증거다. 여러 과제를 넘나들거나 낯선 환경에서 된다는 증거는 아니다. 이 편이 안 다룬 온몸 균형은 여덟 달 뒤 Helix 02 카드에서 나온다.
  • 입력이 프레임·촉각·스테레오로 늘었다. 한 장짜리 이미지 대신 여러 프레임을 함께 보고, 촉각(force feedback) 입력도 더했다. 카메라도 단일에서 스테레오로 바뀌었다.
  • 옵티머스는 프롬프트 하나로 여러 과제를 한다고 주장했다. 2025년 5월 21일 공개 영상에서 "버려라" 같은 프롬프트를 주면 그 지시대로 움직인다. 과제별 파인튜닝이 아니라 단일 신경망 하나라는 게 주장의 핵심이다.
  • 사람 1인칭 영상으로 학습했다는 주장은 검증되지 않는다. 액션 라벨이 없는 사람 영상에서 관절값을 어떻게 뽑았는지 진행자들도 "정확히 잘 모르겠다"고 밝힌다.
  • 2026년 화성 무인 발사의 첫 화물로 검토된다. 일론 머스크는 성공 확률을 "50:50"이라 밝히며, 옵티머스에게 빨래 개기·땅파기 같은 노동을 맡길 계획이라고 말했다.
  • 드림젠은 영상 생성 모델로 액션을 역산한다. 엔비디아 드림젠은 월드 모델(world model, 물리 법칙을 내재적으로 학습해 다음 장면을 예측하는 영상 생성 모델)을 소량의 텔레오퍼레이션(teleoperation, 사람이 원격으로 로봇을 조종해 시범을 보이는 방식) 데이터로 파인튜닝한 뒤, IDM(Inverse Dynamics Model, 연속 관찰 사이 차이로 행동을 역산하는 모델)으로 관절값을 만들어 낸다.
  • SmolVLA는 반대로 갔다. 이 영상 녹화 5일 전(6월 5일) 공개된 SmolVLA는 시뮬레이션도 영상 생성도 없이, 값싼 오픈소스 로봇을 커뮤니티가 각자 돌려 올린 데이터셋만으로 학습했다.

주요 숫자

1시간
Helix가 물류 한 과제를 실패 거의 없이 지속한 데모 길이
약 40분 지점
택배를 떨어뜨리는 실패가 나온 순간
50:50
일론 머스크가 밝힌 2026년 말 화성 무인 발사 성공 확률
5일 전
SmolVLA가 이 영상 녹화 5일 전(6월 5일) 공개된 시점

화성 가야 되니까.

반론 · 충돌

  • 같은 채널 「Whole-Body Control 시대의 시작」(2026-02-05)이 편의 Helix는 물류 한 과제에 상체만 쓰고 균형 제어는 언급조차 없다. 여덟 달 뒤 Helix 02는 골반·다리를 쓰는 온몸 제어를 자율로 시연하고, 균형을 담당하는 System 0을 강화학습이 아니라 이미테이션 러닝으로 학습했다고 밝힌다. 이 편에서 진행자들이 짚은 「액션 데이터가 없다」는 병목이, 균형이라는 전혀 다른 축에서도 결국 사람 시연 데이터로 풀렸다는 뜻이지만 이 편 시점에는 그 경로 자체가 논의되지 않는다.
  • 옵티머스의 "사람 영상 학습" 주장진행자들 스스로 이 편 안에서 액션 라벨이 없는 사람 영상으로 어떻게 관절값을 학습했는지 확인하지 못했다고 밝힌다. 테슬라가 공개한 것은 결과 영상 하나뿐이고, 방법론을 검증할 논문이나 기술 문서는 이 시점에 나오지 않는다.
  • 이 편 자체의 약점Helix 1시간 데모도 Figure AI가 직접 편집해 공개한 자료라 실패 구간이 얼마나 걸러졌는지 알 수 없다. 옵티머스의 싱글 뉴럴넷 주장도 회사 발표 영상 하나에 의존하며, 제3자가 재현하거나 검증한 사례는 이 편에 나오지 않는다.
유튜브 자동 자막 전문을 요약한 카드입니다. 자동 인식이라 회사·모델 이름이 흔들리는 대목이 있어 영상 설명란과 논문으로 맞춰 적었습니다. 숫자는 진행자가 말한 것을 그대로 옮겼고 따로 검증하지 않았습니다. 투자 추천이 아닙니다. 이 편은 2026-02-05 「Whole-Body Control 시대의 시작」 카드보다 여덟 달 앞선 시점을 다루며, 이 시점 Helix는 온몸 제어를 아직 다루지 않습니다.