월드모델(World Model)이 소라·비오3 같은 비디오 생성모델과 어디서 갈리는지 알게 된다. 1X Technologies의 1X World Model(1XWM)이 로봇 정책이 낸 행동을 입력받아 미래 영상과 성공확률을 함께 내놓아 실물 로봇 평가의 병목을 어떻게 대신하는지, 그리고 데이터가 적은 몸체에서 물리 상식이 어떻게 깨지는지까지.
sudoremove JB · JC2025-07-0921분YouTube
▾
월드모델(World Model, 특정 행동을 입력하면 그 행동이 일으킬 미래 관측을 예측하는 모델)은 소라·비오3 같은 비디오 생성모델과 다르다 — 세밀한 액션을 입력받아 그 액션에 대응하는 미래를 낸다는 점이 갈림점이다. 1X Technologies의 1X World Model(1XWM)은 로봇 정책(policy, 어떤 상황에서 어떤 행동을 할지 정하는 함수)이 낸 행동 시퀀스를 넣으면 미래 1인칭 영상과 그 시나리오의 성공확률(상태가치, state value)을 함께 내놓아, 실물 로봇을 돌리지 않고도 정책을 걸러낸다.
핵심 포인트
넥스트 프레임 예측이 왜 월드모델과 엮이는가. 언어모델이 다음 단어를 맞히다 보면 지식을 갖추게 됐듯, 비디오 모델도 다음 프레임을 잘 맞히려면 공이 바닥에 튀는 탄성 같은 세상의 물리를 알아야 한다고 진행자들이 짚는다.
그래도 구글은 자기네 비오3를 월드모델이라 안 부른다. 텍스트를 넣으면 그에 맞는 영상을 잘 만들지만, 세밀한 액션을 넣었을 때 그 액션에 대응하는 미래 관측을 내보내지는 않는다는 차이다.
실물 로봇 없이 정책을 재는 법
위가 지금까지다. 정책 하나를 시험하려면 실물 로봇을 돌려야 하고, 부서질 위험 때문에 자동으로 많이 못 돌린다. 아래가 이 편의 주장이다 — 월드모델이 이어질 장면을 그리고 상태가치라는 숫자를 내면, 그 숫자로 성공할 정책과 실패할 정책을 가릴 수 있다.
구글 딥마인드 Genie 2는 방향키가 액션이다. WASD와 스페이스바(점프) 같은 게임 조작 입력을 액션으로 받아, 시작 프레임에서 그 조작에 따라 앞으로 가거나 뒤로 가는 미래 프레임을 만든다.
1XWM은 로봇 실물 평가의 병목을 정면으로 겨눈다. 로봇을 실제로 돌려 평가하면 하드웨어가 부서질 위험이 있고 물건 위치 같은 조건을 매번 통제할 수 없다. 1XWM은 정책이 낸 행동 시퀀스를 넣어 미래 영상과 성공확률을 동시에 뽑아, 이 평가를 모델 안에서 대신한다.
예측된 성공확률과 실제 성능의 상관관계가 높았다. 학습 스텝(체크포인트)별로도, 비전 인코더(이미지를 모델이 쓸 특징으로 바꾸는 부분) 크기를 L·B로 바꿔서도 1XWM 점수와 실제 로봇 결과가 같은 방향으로 움직였다고 진행자들이 확인한다.
성공한 궤적만 넣으면 안 된다. 학습 데이터에 텔레오퍼레이션(사람이 로봇을 직접 조종해 모은 궤적)과 자율 롤아웃 모두에서 성공·실패 사례를 함께 넣어야, 모델이 성공 쪽으로 치우치지 않는다고 짚는다.
데이터 양이 적으면 물리 상식이 깨진다. NEO 로봇처럼 데이터가 적은 몸체는 서랍을 강체로 착각해 부서지는 것처럼 생성하지만, 데이터가 많은 몸체는 에어프라이어 통 모양을 미리 알고 열리는 장면을 그린다.
한계는 거울 자기 인식과 물리 법칙 위반이다. 거울 앞에서 손을 흔드는 액션을 줘도 거울 속 로봇은 움직이지 않고, 접시가 공중에 뜨는 등 물체가 물리 법칙을 어기는 장면도 나온다.
주요 숫자
4초
1XWM 입력 이미지·영상 클립 길이
EVE·NEO 2종
1XWM을 시험한 로봇 몸체
L·B 2종
성능을 비교한 비전 인코더 크기
0 이하
상태가치(state value)가 실패로 잡히는 기준
월드 모델이 있으면 테스트를 돌리고 나서 좋은 것만 골라서 실제 한번 테스트 하면 되니까.
반론 · 충돌
같은 채널 「행동 데이터는 인터넷에 없다 — 이를 뚫으려는 다섯 경로」 편그 글은 1X Technologies를 "레이블 없는 영상에서 행동을 역으로 뽑아내는" 다섯째 경로로 적었다. 이 편에서 확인한 1XWM의 실제 입출력은 반대다 — 행동 시퀀스를 입력으로 넣으면 미래 영상과 성공확률을 낸다. 행동을 영상에서 역산해 출력하는 쪽은 오히려 같은 채널의 Rhoda AI다.
같은 채널 「Rhoda AI는 VLA를 버렸고 Sharpa는 손안 조작만 따로 구웠다」 편Rhoda AI는 비디오 모델이 다음 장면을 그리면 인버스 다이내믹스 모델이 그 차이에서 관절 명령을 거꾸로 계산한다 — 액션이 출력이다. 1XWM은 정책이 낸 액션을 입력으로 받아 미래와 성공확률을 예측한다 — 액션이 입력이다. 같은 "행동+영상" 조합을 다루면서도 방향이 정반대다.
진행자 자신의 유보진행자들은 예측-실제 상관관계가 "높다"고 여러 번 말하면서도 상관계수 같은 구체적 수치는 한 번도 대지 않는다. 서랍 파손처럼 데이터가 적은 몸체에서 나온 오류 사례도 1X 쪽 공개 자료에서 가져온 것인지 진행자가 직접 재현한 것인지 구분하지 않는다.
유튜브 자동 자막 전문을 요약한 카드입니다. 자동 인식이라 회사·모델 이름이 흔들리는 대목이 있어 영상 설명란과 논문으로 맞춰 적었습니다. 숫자는 진행자가 말한 것을 그대로 옮겼고 따로 검증하지 않았습니다. 투자 추천이 아닙니다. 로봇 이름(EVE·NEO)과 모델 이름(Genie 2·Cosmos·GR00T Dream)은 자동 자막이 흔들려 영상 설명란으로 맞춰 적었습니다.