← 수도리무브 — 로보틱스 · 피지컬 AI
모델 아키텍처

Rhoda AI는 VLA를 버리고 다음 장면을 그려 행동을 역산한다

스텔스에서 막 나온 회사가 VLA 로는 범용성에 못 닿는다며 갈아탄 구조를 뜯어봅니다. 웹 비디오로 학습한 생성 모델이 다음 프레임을 그리고 그 프레임에서 관절 명령을 역산하는 방식이 무엇을 벌고 무엇을 안 밝혔는지까지.

sudoremove JB · JC2026-03-1623분YouTube

Rhoda AI 는 스텔스에서 막 나온 로봇 회사다. VLA(Vision-Language-Action, 시각·언어·행동 통합 모델)로는 범용성에 못 닿는다고 보고, 웹 비디오로 학습한 생성 모델이 다음 프레임을 예측하면 그 프레임을 역산해 관절 명령을 뽑는 DVA(Direct Video Action)를 택했다. 같은 편에 나오는 Sharpa 는 반대로 VLA 를 쓰되 어려운 구간만 떼어 냈고, 그 카드는 같은 섹션에 따로 있다.

핵심 포인트

두 회사는 무엇이 다른가

둘이 같이 걸린 병목로봇 데이터가 인터넷에 없다Rhoda AI스텔스에서 2026년 3월 등장조달 4억 5천만 달러다음 장면을 상상해행동을 거꾸로 계산논문 없음 · 데모만Sharpa로봇 손을 만드는 회사엔비디아 GTC 2026 부스어려운 동작을 반사로미리 구워 둔다논문 MoDE-VLA
Rhoda AI와 Sharpa는 서로 다른 회사이고 같은 편에 나란히 나온다. 데이터를 모을 길이 막혔다는 사정은 같은데 푸는 자리가 갈린다. Rhoda는 학습 재료를 웹 비디오로 갈아 끼웠고, Sharpa는 사람이 조종하다 실패하는 구간만 기계에 넘겼다. 이 카드는 왼쪽을 편다.
  • 학습량이 한쪽으로 심하게 쏠려 있다. 웹 비디오 300년치로 사전학습한 다음 로봇 데이터는 11시간만 얹었다고 주장한다. 진행자들은 300년이라는 단위 자체가 이상하다고 먼저 짚는다.
  • 다음 프레임을 시간 순서대로 하나씩 예측한다. 보통의 비디오 생성은 정해진 길이의 영상을 양방향으로 만드는데, 이쪽은 지나간 프레임을 KV 캐시로 들고 가면서 LLM의 다음 토큰 예측처럼 다음 장면을 잇는다.
  • 행동은 그 장면에서 거꾸로 계산해 나온다. 비디오 모델은 그림만 그릴 줄 알지 관절은 모른다. IDM(Inverse Dynamics Model, 역동역학 모델 — 지금 장면과 다음 장면 두 장을 받아 그 사이에 있었을 관절 움직임을 거꾸로 계산한다)이 그 차이를 관절 명령으로 옮기고, 두 모델이 번갈아 돌아간다. 지금 실행하는 행동은 앞서 예측해 둔 것이다.

Rhoda는 어디를 갈아 끼웠나

VLA — 지금 보이는 것만 본다지금 이미지 + 말한 장면VLA 모델한 모델이 통째로관절 명령Rhoda DVA — 지나간 장면을 전부 들고 다음 장면을 상상한다지나간 프레임 전부KV 캐시비디오 모델다음 프레임 예측다음 프레임로봇 실행관절 명령IDM관절 값을 역산한다새 프레임이 쌓인다
위 칸이 지금까지의 VLA다. 지금 이미지와 말을 한 모델에 넣어 관절 명령을 바로 낸다. 아래 칸이 Rhoda다. 비디오 모델이 다음 장면을 그리고, IDM이 그 장면에서 행동을 거꾸로 계산한다. 실행한 결과가 프레임으로 다시 쌓여 다음 상상의 재료가 되고, 그 누적분이 야바위를 푸는 기억이다.
  • 야바위 데모가 시각 기억의 증거로 나온다. 컵 아래 물건을 감추고 섞는 작업은 지금 이미지만 보는 VLA로는 원리상 못 푼다. Rhoda 쪽은 지나간 프레임을 전부 들고 있어 어느 컵인지 기억한다.
  • 말을 안 쓰고 영상이 프롬프트 구실을 한다. 사람이 몸으로 한 번 보여 주면 로봇이 따라 한다. LLM의 퓨샷 프롬프팅에서 예시가 하던 일을 영상이 대신하는 셈이다.
  • 정량 지표를 하나도 안 냈다. 모델 파라미터도 초당 프레임 수도 밝히지 않았고 데모만 공개했다. 진행자 한 명은 "그냥 정량적인 거는 이게 다였어"라고 말한다.

주요 숫자

300년 / 11시간
웹 비디오 사전학습량과 로봇 데이터량
4억 5천만 달러
Rhoda AI 조달액
11억 7천만 달러
Rhoda AI 밸류에이션
없음
공개된 정량 지표

이게 정답이 아닐 수도 있죠. 근데 이게 됐다라는 걸 보여줬다는게 나는 굉장히 중요한 거 같아요.

반론 · 충돌

  • 같은 채널 「Action Data Scaling 문제」기초 4강은 데이터를 모으는 경로 다섯을 늘어놓고 어느 것도 스케일 문제를 푼다고 입증되지 않았다고 닫는다. Rhoda의 웹 비디오 사전학습은 그 경로 가운데 월드모델과 역동역학 모델을 쓰는 다섯 번째의 변형인데, 이번 편에서도 성공률 숫자가 나오지 않았다. 경로가 바뀐 것이지 입증이 된 것은 아니다.
  • 미국주식 사관학교 — VLA가 병목을 푸는 중이라는 전제「로봇은 인건비가 아니라 설비투자 예산에서 팔린다」(2026-07-20)는 VLA 모델과 영상 사전학습·시뮬레이션이 물리 데이터 부족을 풀고 있다는 전제 위에서 로봇 시장 규모를 추산한다. Rhoda는 그 전제에 정면으로 선다 — VLA로는 범용성에 못 닿는다며 아예 갈아탔다. 병목이 풀리는 중이라는 진술은 아직 방법이 정해지지 않았다는 뜻이기도 하다.
  • 정량이 없는 데모를 어디까지 받을 것인가야바위도 따라 하기도 데모 영상이다. 파라미터도 초당 프레임도 안 밝혔으니 같은 자로 다른 모델과 견줄 수가 없다. 진행자들도 「됐다는 걸 보여 준 것」까지만 인정한다.
유튜브 자동 자막 전문을 요약한 카드입니다. 자동 인식이라 회사·모델 이름이 흔들리는 대목이 있어 영상 설명란과 논문으로 맞춰 적었습니다. 자막은 Sharpa를 「셰파」와 「샤파」로 번갈아 받아 적고 설명란 목차에도 Sherpa가 한 번 나오는데, 논문 링크 표기를 따라 Sharpa로 통일했습니다. 이 회사가 로봇 손을 만들어 왔다는 것은 이 편이 아니라 같은 채널의 「로봇 손 직접 다 써보고 알려 드림」(2026-06-21)과 「CES 로봇 리뷰」(2026-01-14)에서 다룹니다. 숫자는 진행자가 말한 것을 그대로 옮겼고 따로 검증하지 않았습니다. 투자 추천이 아닙니다. 같은 영상에서 카드 둘이 나왔습니다 — 한 편이 회사 둘을 나란히 다뤄, 방법이 갈리는 자리에서 방식별로 나눠 실었습니다.