← 수도리무브 — 로보틱스 · 피지컬 AI
용어 정의

VLA · LBM · RFM은 같은 말이 아니다

뒤섞여 쓰이는 세 단어의 층위를 갈라 놓습니다. 그리고 언어에서 통한 방법이 몸에서는 왜 그대로 안 통하는지.

sudoremove 박종현2026-03-19공개 웹 에세이sudoremove.com

LLM에서 VLM으로, 다시 VLA로 이어지는 계보를 한 줄로 세우고 세 용어의 층위를 나눈다. 언어에서 LLM이 해낸 범용화를 로봇의 몸에서 되풀이하려는 시도인데, 행동 데이터는 인터넷에 없다는 점이 그 경로를 막는다.

핵심 포인트

  • 계보는 한 줄이다. LLM(텍스트)에서 VLM(시각과 언어)으로, 다시 VLA(시각·언어·행동)로 이어진다. 최근에는 촉각을 더한 VTLA까지 나온다.
  • 세 용어의 층위가 다르다. VLA는 시각 인지·언어 지시·모터 동작을 한 모델에 넣은 것, LBM은 사실상 같은 것을 행동 출력 쪽에서 부르는 이름, RFM(Robot Foundation Model)은 그보다 위 개념으로 여러 환경과 여러 과제를 한 모델이 감당한다는 뜻이다.

한 줄로 이어진 계보와, 층위가 다른 이름 셋

계보는 한 줄이다LLM텍스트VLM시각 + 언어VLA+ 행동VTLA+ 촉각이름 셋의 층위는 다르다RFM — 여러 환경 · 여러 과제를 한 모델이VLA입력 쪽에서 부른 이름LBM출력 쪽에서 부른 이름
위는 무엇을 입력으로 더해 왔는지의 순서다. 아래가 헷갈리는 대목인데, VLA와 LBM은 사실상 같은 것을 입력 쪽과 출력 쪽에서 각각 부른 이름이고, RFM은 그보다 한 칸 위에서 「여러 환경과 여러 과제를 한 모델이 감당한다」는 뜻이다. 계보의 VLA 자리가 아래 그림으로 이어진다.
  • 특화형이 무너지는 지점이 있다. 물체 형태가 매번 달라지는 빨래 개기, 쥐는 힘과 접촉 방식을 상황마다 조절해야 하는 무른 물건 다루기가 그렇다.
  • 범용 로봇이 갖춰야 할 것은 세계 지식이다. 물건은 떨어지고 물은 마르며 사람 말에는 생략된 맥락이 있다는 것을, 로봇이 별도 학습 없이 이미 알고 있어야 한다는 발상이다.
  • 병목은 데이터의 존재 자체다. 로봇이 물건을 집고 문을 열고 빨래를 개는 데이터는 인터넷에 없다. 텍스트를 인터넷 규모로 긁어 성공한 LLM의 경로를 그대로 밟을 수 없는 이유다.

주요 숫자

3단계
LLM에서 VLM을 거쳐 VLA로 이어지는 계보
VTLA
촉각을 더해 최근 나온 네 번째 이름

언어의 LLM을 몸에서 되풀이한다.

반론 · 충돌

  • 층위를 갈라도 회사들은 뒤섞어 쓴다필자가 정리한 구분은 읽는 사람을 위한 정리이고, 제품 발표에서는 같은 모델을 LBM이라고도 RFM이라고도 부른다. 이름으로 기술을 가르려 하면 어긋난다.
  • 같은 채널 「Rhoda AI」 편VLA를 계보의 도착점처럼 세워 두는 이 정리와 달리, 2026년 3월 편에서는 VLA로는 범용성에 못 닿는다며 비디오 생성으로 갈아탄 회사가 나온다. 계보가 한 줄이라는 서술은 다섯 달 만에 방식을 하나 더 받았다.
sudoremove.com 공개 웹 에세이를 요약한 카드입니다. 원문 전문을 다시 싣지 않습니다. 숫자는 필자가 적은 것을 옮겼고 따로 검증하지 않았습니다. 투자 추천이 아닙니다.