← 수도리무브 — 로보틱스 · 피지컬 AI
GPU 판매전략과 비디오모델

엔비디아가 비디오모델을 밀자 1X가 그걸로 로봇을 실제로 구동했다

엔비디아 GEAR팀이 "VLM 기반 VLA는 근본적으로 틀렸다"며 비디오모델을 밀고, 진행자들은 그 배경에 GPU를 더 파는 유인이 있다고 짚습니다. 같은 시점에 1X Technologies가 그 비디오모델을 평가용이 아니라 로봇 NEO를 실제로 구동하는 데 처음 썼습니다. 로봇 회사가 왜 굳이 12초씩 걸리는 이 방식을 택했는지, 900시간+70시간이라는 적은 데이터로 무엇을 얻었는지를 뜯습니다.

sudoremove JB · JC2026-01-2227분YouTube

엔비디아 GEAR팀의 짐 판(Jim Fan)과 스펜서 항(Spencer Huang)이 "VLM(Vision-Language Model) 기반 VLA(Vision-Language-Action, 시각·언어·행동 통합 모델)는 근본적으로 틀렸을 수 있다"며 비디오모델(영상을 그대로 생성하는 모델) 기반 로봇 정책을 미는데, 진행자들은 그 배경에 비디오모델이 GPU를 훨씬 더 먹는다는 엔비디아의 판매 유인이 있다고 짚는다. 1X Technologies는 이 접근으로 로봇 NEO를 실제 구동하는 데 Redwood AI World Model을 처음 투입했다.

핵심 포인트

  • 짐 판의 셋째 교훈이 출발점이다. VLM은 언어·문서로 사전학습돼 물리 제어를 배운 적이 없고, 비전 인코더가 로봇 조작에 필요한 저수준 공간 디테일을 의도적으로 버린다는 것이다.
  • 진행자들은 이 주장 뒤에 GPU 판매 동기가 있다고 짚는다. 비디오모델은 VLM보다 GPU를 훨씬 많이 요구하는 방향이라, 엔비디아가 이걸 띄울수록 GPU 수요가 커진다는 지적이다.
  • 1X의 구조는 텍스트+프레임 → 비디오 생성 → IDM(Inverse Dynamics Model, 원하는 결과가 나오려면 어떤 행동이 필요한지 역으로 계산하는 모델)로 액션 추론 → 로봇 구동이다. 비디오 모델이 미래 영상을 상상하면 IDM이 그 영상처럼 움직일 액션을 뽑는다.

영상을 그리고 그 영상에서 행동을 뽑는다

사람 1인칭 영상중간학습 900시간NEO 로봇 데이터파인튜닝 70시간비디오모델 140억다음 장면을 그린다IDM 이 액션으로학습에 400시간로봇이 실행5초짜리 영상 하나를 그리는 데 11초, 액션 역산에 1초되긴 하는데 실시간과는 거리가 멀다학습 시간은 사람 영상이 로봇 데이터의 열세 배다
사람 1인칭 영상으로 크게 굽고 로봇 데이터로 조금 맞춘다. 그다음이 이 편의 핵심인데, 비디오모델이 다음 장면을 그리면 IDM(역동역학 모델)이 그 장면을 만드는 행동을 거꾸로 계산한다. 아래 세 줄이 지금 이 경로가 내는 값이다.
  • 사전학습은 웹 비디오 → 사람 1인칭 영상 900시간 → NEO 데이터 70시간 순이다. 로봇 자체 데이터가 70시간뿐인데도 접시 닦기처럼 텔레오퍼레이션(원격조작)으로 모으기 어려운 과제까지 수행했다고 진행자들은 전한다.
  • IDM은 400시간 분량으로 학습했고 의미 없는 무작위 동작 데이터도 섞였다. 텔레오퍼레이션 없이 모을 수 있어 상대적으로 값싼 데이터라고 진행자들은 본다.
  • 속도가 가장 큰 약점이다. 140억 파라미터 비디오모델이 5초짜리 비디오를 만드는 데 11초, IDM 추론에 1초를 더해 총 12초가 걸린다. 12초 상상하고 5초 행동하는 방식이라 즉각 반응이 필요한 과제는 못 하고 클로즈드 루프(보자마자 바로 행동하는 방식)가 안 된다.
  • 비슷한 접근이 여러 곳에서 동시에 나온다. mimic Robotics는 프리트레인된 비디오모델에 텔레오퍼레이션 데이터로 액션 디코더만 파인튜닝했고, 테슬라 옵티머스 전 리드 밀란 코박(Milan Kovac)도 사람 비디오 학습 단일 신경망 데모를 보인 뒤 보스턴 다이나믹스로 옮겼다.
  • 잡는 지점이 사람처럼 나온다는 관찰도 있다. 냄비 몸통이 아니라 손잡이를 잡는 식인데, 사람 1인칭 영상 학습의 영향으로 사람과 비슷한 어포던스(물체가 암시하는 사용 방식)를 따르는 것으로 진행자들은 추정한다.

주요 숫자

900시간 → 70시간
사람 1인칭 중간학습 시간 → NEO 로봇 데이터 파인튜닝 시간
400시간
IDM 학습에 쓴 데이터(무작위 동작 포함)
11초 + 1초
5초 비디오 생성 시간 + IDM 액션 추론 시간
140억
비디오모델 파라미터 수

비디오 모델이다라고 이제 광을 팔기 시작하는 거 같고 GPU를 더 팔기 위해서

반론 · 충돌

  • 같은 대시보드 「Dyna-2는 로봇 데이터 없이 사람 영상 170년으로 제로샷 전이를 보였다」이 편은 1X가 900시간+70시간이라는 적은 데이터로 됐다고 자랑하지만, 같은 채널이 7개월 뒤 다룬 Dyna-2는 정반대로 사람 영상 100만 시간(170년)을 써야 로봇 데이터 없이도 제로샷 전이가 됐다고 주장한다. 속도도 엇갈린다 — 1X는 12초가 걸리는데, 같은 WAM(World Action Model) 계열 DreamZero는 GB200 두 장으로 150ms까지 줄였다. "적은 데이터로 충분하다"는 이 편의 낙관과 "많을수록 좋다"는 Dyna-2의 스케일링 주장이 같은 채널 안에서 부딪힌다.
  • 같은 대시보드 「구글 딥마인드는 임바디드 리즈닝으로 VLA를 하니스해 판단과 반사를 나눴다」짐 판은 이 편에서 VLM 기반 VLA가 "근본적으로 틀렸을 수 있다"고 주장하지만, 반년 뒤 공개된 구글 딥마인드의 실제 배포판(Gemini Robotics 2.0)은 VLA를 임바디드 리즈닝이 부리는 실행 계층으로 그대로 쓴다. 업계를 이끄는 회사의 최신 상용 제품에서 VLA는 폐기되지 않고 계층 구조의 핵심 부품으로 남아 있다.
  • 이 편 자체의 약점 — 검증되지 않은 두 주장GPU를 더 팔려는 동기가 있다는 지적은 진행자들의 자체 해석일 뿐, 엔비디아 발언이나 매출 자료로 뒷받침되지 않는다. 1X의 "70시간만으로 됐다"는 주장도 자사 블로그 발표이고, 같은 과제를 VLA로 같은 컴퓨팅 예산에서 학습시켰을 때와 비교한 대조군 수치는 이 편에 나오지 않는다.
유튜브 자동 자막 전문을 요약한 카드입니다. 자동 인식이라 회사·모델 이름이 흔들리는 대목이 있어 영상 설명란과 링크로 맞춰 적었습니다. 숫자는 진행자가 말한 것을 그대로 옮겼고 따로 검증하지 않았습니다. 투자 추천이 아닙니다. mimic Robotics의 소재지(스위스·ETH 취리히)는 진행자들도 확신하지 못한 채 추정으로 남긴 것을 그대로 옮겼습니다.