← 수도리무브 — 로보틱스 · 피지컬 AI
VLA · 휴머노이드 전신 제어

Figure AI가 처음 낸 VLA, Helix — 그리퍼 7 자유도를 전신 35 자유도로 밀어올렸다

휴머노이드 VLA가 그리퍼 위치 7 자유도만 움직이던 시절에서 손가락·손목·머리·몸통 35 자유도를 신경망 하나로 구동하는 시절로 처음 넘어간 순간을 잡는다. Figure AI가 오픈AI와 결별하고 판단(System 2)·반사(System 1)로 나눈 자체 VLA를 처음 공개한 배경까지 함께 본다.

sudoremove JB · JC2025-03-0522분YouTube

Figure AI가 VLA(Vision-Language-Action, 시각·언어·행동 통합 모델)인 Helix를 처음 공개했다. 그리퍼 위치만 다루던 이전 VLA와 달리 손가락 다섯 개·손목·머리·몸통까지 신경망 하나로 구동한 첫 사례이고, 판단을 맡는 System 2와 반사를 맡는 System 1로 나눈 구조를 이 편에서 처음 밝혔다.

핵심 포인트

  • 자유도 35개. 이전 VLA는 그리퍼 위치(XYZ 3개, 피치·롤·요 3개, 그리퍼 여닫음 1개, 합쳐 7 자유도)만 다뤘는데, Helix는 손가락 다섯 개씩·손목·머리·몸통까지 35 자유도를 한 번에 낸다.
  • 고전 제어 없이 신경망 하나로. 보스턴 다이내믹스 아틀라스처럼 최적화 문제를 푸는 고전 제어 대신, Helix는 신경망만으로 로봇을 구동한다. 레이턴시가 높아 못 쓴다고 여겨지던 방식이 실제로 돌아간 점에 진행자들은 놀란다.

Helix 가 처음 낸 것

한 신경망이 다루는 자유도이전 VLA — 그리퍼 7Helix — 전신 35그 안이 두 방식로 나뉜다System 2 — 판단무엇을 할지 정한다7~9HzSystem 1 — 반사관절을 움직인다200Hz학습 데이터는 원격조작으로 모은 약 500시간이라고 진행자들이 추정한다
한 신경망이 다루는 자유도가 7에서 35로 뛰었다. 그 안은 무엇을 할지 정하는 쪽과 관절을 움직이는 쪽으로 갈리고, 두 쪽이 서로 다른 주기로 돈다. 뒤 카드들의 System 0 이야기가 여기서 출발한다.
  • System 2는 판단, System 1은 반사. 7B급(진행자는 처음 8B로도 언급) VLM인 System 2가 이미지·명령·조인트 각도를 받아 7~9Hz로 판단하고, 결과를 레이턴트 벡터(latent vector, 신경망 내부의 압축된 표현 값)로 넘기면 System 1이 200Hz로 빠르게 액션을 낸다.
  • 비동기라서 시간적 오프셋을 넣었다. System 2가 판단을 내릴 때쯤 로봇 상태가 이미 바뀌어 있을 수 있어, 두 신경망 사이에 시간 오프셋을 학습에 넣었다고 진행자들은 설명한다. 정확한 이유는 회사가 공개하지 않았다.
  • 오픈AI와 결별하고 자체 모델로. 앞서 화제가 된 사과 집기 데모는 오픈AI의 스피치 API로 계획을 세운 것이었는데, 이번엔 로봇 하드웨어뿐 아니라 VLA 모델까지 Figure AI가 직접 만들었다.
  • π0와는 정반대 지향. Physical Intelligence의 π0(파이제로)는 VLM 3B로 다양한 로봇 몸체에 두루 통하는 범용성을 노리는데, Helix는 VLM 7B급을 자기 하드웨어 하나에 최적화해 35 자유도까지 끌어올렸다.
  • 학습 데이터는 텔레오퍼레이션 약 500시간. 텔레오퍼레이션(teleoperation, 사람이 로봇을 원격 조작해 움직임을 그대로 따라 하게 만드는 방식)으로 모은 데이터를, System 2의 VLM이 스스로 지시문을 추론해 자동 라벨링했을 것으로 진행자들은 추정한다.
  • GPU 두 개로 분리 구동. 느린 System 2와 빠른 System 1을 GPU 두 개에 나눠 돌리는 것으로 진행자들은 추정하며, 이 설계를 근거로 데모만 있고 실체가 없다던 기존 의심을 접는다.

주요 숫자

35 자유도
Helix가 신경망 하나로 구동하는 손·손목·머리·몸통 자유도(이전 VLA는 7)
7~9Hz
System 2(판단) VLM 출력 주파수
200Hz
System 1(반사) 액션 출력 주파수
약 500시간
텔레오퍼레이션으로 모은 학습 데이터(진행자 추정)

사람처럼 그 사람의 상체를 되게 정밀하게 지금 구동시키고 있는게 일단 처음으로 되게 신기해요

반론 · 충돌

  • 같은 채널 「Figure Helix 02는 균형마저 강화학습 없이 이미테이션 러닝으로 풀었다」이 편의 Helix(01)는 상체 위주로만 자유도를 늘렸을 뿐 하체는 고정했다. 열한 달 뒤 나온 Helix 02는 골반·다리까지 쓰는 온몸 제어로 넘어가면서 균형을 맡는 System 0을 새로 얹어 System 2·1·0 세 계층이 됐다 — 이 편의 판단·반사 이원 구조가 끝이 아니었다는 뜻이다.
  • π0를 만든 Physical Intelligence 쪽 설명은 아니다진행자들은 π0가 다양한 로봇 몸체에서 두루 되는 범용성을 목표로 한다고 소개하지만, 이는 Figure AI 쪽 발표를 들은 진행자의 정리이지 Physical Intelligence가 직접 공개한 자료로 검증한 것은 아니다.
  • 이 편 자체의 약점GPU 종류·학습 데이터 500시간·GPU 두 개 분리 구동은 모두 회사가 공개한 수치가 아니라 진행자 두 명의 추정이다. 데모 영상 외에 성공률 표나 테크니컬 페이퍼는 이 시점에 공개되지 않았다.
유튜브 자동 자막 전문을 요약한 카드입니다. 자동 인식이라 회사·모델 이름이 흔들리는 대목이 있어 영상 설명란과 논문으로 맞춰 적었습니다. 숫자는 진행자가 말한 것을 그대로 옮겼고 따로 검증하지 않았습니다. 투자 추천이 아닙니다.