VLA가 LLM처럼 규모로 성능을 얻지 못하는 이유 셋과, 데이터를 모으려는 경로 다섯. 테슬라가 조종자에게 건 신체 조건까지.
sudoremove 박종현2026-03-19공개 웹 에세이sudoremove.com
▾
행동 데이터가 인터넷에 없다는 사실, 실물 로봇을 돌려야 하는 평가 비용, 촉각 센싱과 하드웨어 제조의 미완성이 규모 확대를 막는다고 정리한다. 이를 뚫으려는 수집 경로 다섯을 늘어놓되 어느 쪽도 정답으로 판명되지 않았다고 닫는다.
핵심 포인트
막는 것 하나는 데이터가 없다는 사실이다. 행동 데이터는 인터넷에 존재하지 않는다. 텍스트처럼 이미 쌓여 있는 것을 긁어오는 방식이 통하지 않고 물리적으로 직접 모아야 한다.
막는 것 둘은 평가 비용이다. 실물 로봇을 돌려야 성능을 알 수 있고 하드웨어가 부서질 위험 때문에 자동 벤치마크를 못 돌린다. 개발 반복 속도가 여기서 직접 깎인다.
병목 셋에서 갈라진 다섯 경로
맨 위가 막는 것이고 다섯 방식이 뚫으려는 방법이다. 방식마다 무엇을 대신 쓰는지가 다르다 — 사람의 시간, 로봇 없는 도구, 시뮬레이터, 오픈소스, 그리고 인터넷에 이미 쌓인 영상이다. 맨 아래 점선이 이 글의 결론인데, 다섯 가운데 어느 것도 아직 입증되지 않았다.
경로 하나는 텔레오퍼레이션이다. 테슬라는 옵티머스 학습용 조종자를 시급 48달러에 뽑았고 키 170~180cm, 하루 7시간 이상 보행, 13kg 운반이라는 신체 조건을 걸었다. VR 장비를 오래 쓰면 피로와 멀미가 와서 조종 시간 자체가 한계다.
경로 둘은 UMI다. 로봇 없이 사람이 들고 다니는 집게로 조작 데이터를 모으고, 그 데이터를 다른 로봇 플랫폼으로 옮긴다.
경로 셋은 시뮬레이션이다. 엔비디아 Isaac GR00T가 합성 데이터를 만든다. 시뮬레이션과 현실의 차이를 메우는 것이 관건이다.
경로 넷은 커뮤니티다. HuggingFace가 하드웨어와 소프트웨어를 오픈소스로 풀고 데이터·모델을 한곳에 모은다. SmolVLA가 그 가능성의 증거로 제시된다.
경로 다섯은 월드모델과 역동역학 모델이다. 1X Technologies가 레이블 없는 영상에서 행동을 역으로 뽑아낸다. 인터넷에 쌓인 사람 행동 영상을 데이터원으로 바꾸려는 시도다.
결론은 미정이다. 다섯 경로 가운데 어느 것도 규모 문제를 푼다고 입증되지 않았다.
LLM과 VLA의 대조
LLM
VLA
데이터원
인터넷(사실상 무한)
실물 로봇 동작(제한)
수집 비용
낮음
높음
평가
자동
실물 로봇 필요
주요 숫자
시급 48달러
테슬라 옵티머스 학습용 조종자 임금
170~180cm
조종자 신체 조건 중 키
13kg
조종자에게 요구한 운반 중량
5개
필자가 정리한 데이터 수집 경로 수
인터넷에 없는 데이터.
반론 · 충돌
같은 채널 「Rhoda AI」 편이 다섯 번째 경로를 밀고 나갔다2026년 3월 편의 Rhoda AI는 웹 비디오 300년치로 사전학습하고 로봇 데이터를 11시간만 얹었다고 주장한다. 이 글이 미정으로 남긴 경로가 같은 달에 자금 4억 5천만 달러를 받아 제품이 됐다. 다만 성공률 숫자는 여전히 공개되지 않았다.
조종자 조건은 채용 공고이지 병목의 크기가 아니다시급 48달러와 신체 조건은 한 회사의 채용 문서에서 나온 값이다. 이것으로 산업 전체의 데이터 수집 단가를 추산하면 표본이 하나다.
sudoremove.com 공개 웹 에세이를 요약한 카드입니다. 원문 전문을 다시 싣지 않습니다. 숫자는 필자가 적은 것을 옮겼고 따로 검증하지 않았습니다. 투자 추천이 아닙니다.