뒤섞여 쓰이는 세 단어의 층위를 갈라 놓습니다. 그리고 언어에서 통한 방법이 몸에서는 왜 그대로 안 통하는지.
sudoremove 박종현2026-03-19공개 웹 에세이sudoremove.com
▾
LLM에서 VLM으로, 다시 VLA로 이어지는 계보를 한 줄로 세우고 세 용어의 층위를 나눈다. 언어에서 LLM이 해낸 범용화를 로봇의 몸에서 되풀이하려는 시도인데, 행동 데이터는 인터넷에 없다는 점이 그 경로를 막는다.
핵심 포인트
계보는 한 줄이다. LLM(텍스트)에서 VLM(시각과 언어)으로, 다시 VLA(시각·언어·행동)로 이어진다. 최근에는 촉각을 더한 VTLA까지 나온다.
세 용어의 층위가 다르다. VLA는 시각 인지·언어 지시·모터 동작을 한 모델에 넣은 것, LBM은 사실상 같은 것을 행동 출력 쪽에서 부르는 이름, RFM(Robot Foundation Model)은 그보다 위 개념으로 여러 환경과 여러 과제를 한 모델이 감당한다는 뜻이다.
한 줄로 이어진 계보와, 층위가 다른 이름 셋
위는 무엇을 입력으로 더해 왔는지의 순서다. 아래가 헷갈리는 대목인데, VLA와 LBM은 사실상 같은 것을 입력 쪽과 출력 쪽에서 각각 부른 이름이고, RFM은 그보다 한 칸 위에서 「여러 환경과 여러 과제를 한 모델이 감당한다」는 뜻이다. 계보의 VLA 자리가 아래 그림으로 이어진다.
특화형이 무너지는 지점이 있다. 물체 형태가 매번 달라지는 빨래 개기, 쥐는 힘과 접촉 방식을 상황마다 조절해야 하는 무른 물건 다루기가 그렇다.
범용 로봇이 갖춰야 할 것은 세계 지식이다. 물건은 떨어지고 물은 마르며 사람 말에는 생략된 맥락이 있다는 것을, 로봇이 별도 학습 없이 이미 알고 있어야 한다는 발상이다.
병목은 데이터의 존재 자체다. 로봇이 물건을 집고 문을 열고 빨래를 개는 데이터는 인터넷에 없다. 텍스트를 인터넷 규모로 긁어 성공한 LLM의 경로를 그대로 밟을 수 없는 이유다.
주요 숫자
3단계
LLM에서 VLM을 거쳐 VLA로 이어지는 계보
VTLA
촉각을 더해 최근 나온 네 번째 이름
언어의 LLM을 몸에서 되풀이한다.
반론 · 충돌
층위를 갈라도 회사들은 뒤섞어 쓴다필자가 정리한 구분은 읽는 사람을 위한 정리이고, 제품 발표에서는 같은 모델을 LBM이라고도 RFM이라고도 부른다. 이름으로 기술을 가르려 하면 어긋난다.
같은 채널 「Rhoda AI」 편VLA를 계보의 도착점처럼 세워 두는 이 정리와 달리, 2026년 3월 편에서는 VLA로는 범용성에 못 닿는다며 비디오 생성으로 갈아탄 회사가 나온다. 계보가 한 줄이라는 서술은 다섯 달 만에 방식을 하나 더 받았다.
sudoremove.com 공개 웹 에세이를 요약한 카드입니다. 원문 전문을 다시 싣지 않습니다. 숫자는 필자가 적은 것을 옮겼고 따로 검증하지 않았습니다. 투자 추천이 아닙니다.