← 수도리무브 — 로보틱스 · 피지컬 AI
데이터 병목

행동 데이터는 인터넷에 없다 — 이를 뚫으려는 다섯 경로

VLA가 LLM처럼 규모로 성능을 얻지 못하는 이유 셋과, 데이터를 모으려는 경로 다섯. 테슬라가 조종자에게 건 신체 조건까지.

sudoremove 박종현2026-03-19공개 웹 에세이sudoremove.com

행동 데이터가 인터넷에 없다는 사실, 실물 로봇을 돌려야 하는 평가 비용, 촉각 센싱과 하드웨어 제조의 미완성이 규모 확대를 막는다고 정리한다. 이를 뚫으려는 수집 경로 다섯을 늘어놓되 어느 쪽도 정답으로 판명되지 않았다고 닫는다.

핵심 포인트

  • 막는 것 하나는 데이터가 없다는 사실이다. 행동 데이터는 인터넷에 존재하지 않는다. 텍스트처럼 이미 쌓여 있는 것을 긁어오는 방식이 통하지 않고 물리적으로 직접 모아야 한다.
  • 막는 것 둘은 평가 비용이다. 실물 로봇을 돌려야 성능을 알 수 있고 하드웨어가 부서질 위험 때문에 자동 벤치마크를 못 돌린다. 개발 반복 속도가 여기서 직접 깎인다.

병목 셋에서 갈라진 다섯 경로

막는 것 셋데이터가 없다 · 평가가 비싸다 · 하드웨어가 덜 됐다텔레오퍼레이션장비를 걸치고로봇을 조종UMI집게를 손에 들고로봇 없이 수집시뮬레이션Isaac GR00T가합성 데이터 생성커뮤니티HuggingFace가하드웨어까지 개방월드모델 + IDM레이블 없는 영상행동을 역산다섯 가운데 무엇도 규모 문제를 푼다고 입증되지 않았다이 글이 닫는 자리다
맨 위가 막는 것이고 다섯 방식이 뚫으려는 방법이다. 방식마다 무엇을 대신 쓰는지가 다르다 — 사람의 시간, 로봇 없는 도구, 시뮬레이터, 오픈소스, 그리고 인터넷에 이미 쌓인 영상이다. 맨 아래 점선이 이 글의 결론인데, 다섯 가운데 어느 것도 아직 입증되지 않았다.
  • 경로 하나는 텔레오퍼레이션이다. 테슬라는 옵티머스 학습용 조종자를 시급 48달러에 뽑았고 키 170~180cm, 하루 7시간 이상 보행, 13kg 운반이라는 신체 조건을 걸었다. VR 장비를 오래 쓰면 피로와 멀미가 와서 조종 시간 자체가 한계다.
  • 경로 둘은 UMI다. 로봇 없이 사람이 들고 다니는 집게로 조작 데이터를 모으고, 그 데이터를 다른 로봇 플랫폼으로 옮긴다.
  • 경로 셋은 시뮬레이션이다. 엔비디아 Isaac GR00T가 합성 데이터를 만든다. 시뮬레이션과 현실의 차이를 메우는 것이 관건이다.
  • 경로 넷은 커뮤니티다. HuggingFace가 하드웨어와 소프트웨어를 오픈소스로 풀고 데이터·모델을 한곳에 모은다. SmolVLA가 그 가능성의 증거로 제시된다.
  • 경로 다섯은 월드모델과 역동역학 모델이다. 1X Technologies가 레이블 없는 영상에서 행동을 역으로 뽑아낸다. 인터넷에 쌓인 사람 행동 영상을 데이터원으로 바꾸려는 시도다.
  • 결론은 미정이다. 다섯 경로 가운데 어느 것도 규모 문제를 푼다고 입증되지 않았다.

LLM과 VLA의 대조

LLMVLA
데이터원인터넷(사실상 무한)실물 로봇 동작(제한)
수집 비용낮음높음
평가자동실물 로봇 필요

주요 숫자

시급 48달러
테슬라 옵티머스 학습용 조종자 임금
170~180cm
조종자 신체 조건 중 키
13kg
조종자에게 요구한 운반 중량
5개
필자가 정리한 데이터 수집 경로 수

인터넷에 없는 데이터.

반론 · 충돌

  • 같은 채널 「Rhoda AI」 편이 다섯 번째 경로를 밀고 나갔다2026년 3월 편의 Rhoda AI는 웹 비디오 300년치로 사전학습하고 로봇 데이터를 11시간만 얹었다고 주장한다. 이 글이 미정으로 남긴 경로가 같은 달에 자금 4억 5천만 달러를 받아 제품이 됐다. 다만 성공률 숫자는 여전히 공개되지 않았다.
  • 조종자 조건은 채용 공고이지 병목의 크기가 아니다시급 48달러와 신체 조건은 한 회사의 채용 문서에서 나온 값이다. 이것으로 산업 전체의 데이터 수집 단가를 추산하면 표본이 하나다.
sudoremove.com 공개 웹 에세이를 요약한 카드입니다. 원문 전문을 다시 싣지 않습니다. 숫자는 필자가 적은 것을 옮겼고 따로 검증하지 않았습니다. 투자 추천이 아닙니다.