전환 조건비전 AI가 걸어간 길을 로보틱스가 다시 걷는다
과제별 특화 모델이 통합 모델로 수렴한 전례가 로봇에서 되풀이될 조건 셋. 그리고 지금 어디까지 왔는지를 데이터셋 숫자로.
sudoremove 박종현2026-03-19공개 웹 에세이sudoremove.com
▾ 분류·검출·분할마다 따로 있던 비전 모델이 통합 VLM 하나로 수렴한 경로를 로보틱스가 그대로 밟고 있다고 본다. 그 전환을 떠받치는 조건으로 사전학습 VLM 백본, 교차 embodiment 데이터셋, 스케일링 법칙 셋을 든다.
핵심 포인트
- 특화형과 범용형의 차이가 환경에서 갈린다. 특화형은 통제된 조건에서 성능이 높지만 환경이 조금만 달라져도 무너진다. 범용형은 학습에 없던 상황을 zero-shot(사전 예시 없이)이나 few-shot(예시 몇 개만으로) 처리한다.
같은 모양의 수렴이 두 번
위는 이미 일어난 일이다. 아래가 지금 벌어지는 일이고, 필자는 같은 모양으로 본다. 맨 아래 셋은 아래 화살표를 실제로 밀고 있는 것들이다 — 이 셋이 없으면 수렴은 비유로만 남는다.- 조건 하나는 사전학습 VLM 백본이다. PaliGemma·Qwen-VL·SmolVLM이 인터넷 규모 학습에서 얻은 상식을 이미 갖고 있어, 로봇이 기초부터 배울 필요가 없어졌다.
- 조건 둘은 교차 embodiment 데이터셋이다. 서로 다른 로봇에서 모은 데이터를 함께 쓴다. Open X-Embodiment는 로봇 22종 이상, 과제 527개, 에피소드 100만 건을 넘는다.
- 조건 셋은 스케일링 법칙이다. 모델이 커지고 데이터가 다양해질수록 일반화가 좋아진다는 LLM의 경험칙이 로봇에도 적용될 것으로 본다.
- 일반화 사례가 이미 나와 있다. π0.5는 학습에 없던 환경에 적응하고, GR00T는 서로 다른 하드웨어를 오가며, SmolVLA는 4.5억 파라미터로 범용 수준의 성능을 낸다.
- 당분간의 절충은 파인튜닝이다. 넓은 기반 모델에 과제별 미세조정을 얹어 특화형의 정밀도와 범용형의 유연성을 같이 가져간다. 웹 데이터·시뮬레이션·로봇 데이터를 함께 학습해 미세조정조차 필요 없게 만드는 것이 지향점이다.
교차 embodiment 데이터셋
| 데이터셋 | 로봇 종류 | 과제 수 | 에피소드 |
|---|
| Open X-Embodiment | 22종 이상 | 527 | 100만+ |
| DROID | 7종 | 500+ | 7만 6천 |
| BridgeData V2 | 1종 | 13 | 6만 |
주요 숫자
22종 · 527과제 · 100만+
Open X-Embodiment 규모
7종 · 500+ · 7만 6천
DROID 규모
비전 AI가 걸어간 길.
반론 · 충돌
- 전례가 있다는 것이 되풀이된다는 뜻은 아니다비전 AI의 수렴을 로봇의 미래 지도로 쓰는 것이 이 글의 논법인데, 비전은 인터넷에 이미 쌓인 이미지로 스케일을 얻었다. 같은 채널의 4강이 못 박듯 행동 데이터는 그렇게 쌓여 있지 않다.
- 에피소드 100만 건은 텍스트 규모가 아니다Open X-Embodiment가 이 분야에서 가장 큰 축인데도 100만 건 단위다. LLM이 다룬 토큰 규모와 견주면 스케일링 법칙을 그대로 옮겨 붙일 근거가 아직 얇다.
sudoremove.com 공개 웹 에세이를 요약한 카드입니다. 원문 전문을 다시 싣지 않습니다. 숫자는 필자가 적은 것을 옮겼고 따로 검증하지 않았습니다. 투자 추천이 아닙니다.