스텔스에서 막 나온 회사가 VLA 로는 범용성에 못 닿는다며 갈아탄 구조를 뜯어봅니다. 웹 비디오로 학습한 생성 모델이 다음 프레임을 그리고 그 프레임에서 관절 명령을 역산하는 방식이 무엇을 벌고 무엇을 안 밝혔는지까지.
sudoremove JB · JC2026-03-1623분YouTube
▾
Rhoda AI 는 스텔스에서 막 나온 로봇 회사다. VLA(Vision-Language-Action, 시각·언어·행동 통합 모델)로는 범용성에 못 닿는다고 보고, 웹 비디오로 학습한 생성 모델이 다음 프레임을 예측하면 그 프레임을 역산해 관절 명령을 뽑는 DVA(Direct Video Action)를 택했다. 같은 편에 나오는 Sharpa 는 반대로 VLA 를 쓰되 어려운 구간만 떼어 냈고, 그 카드는 같은 섹션에 따로 있다.
핵심 포인트
두 회사는 무엇이 다른가
Rhoda AI와 Sharpa는 서로 다른 회사이고 같은 편에 나란히 나온다. 데이터를 모을 길이 막혔다는 사정은 같은데 푸는 자리가 갈린다. Rhoda는 학습 재료를 웹 비디오로 갈아 끼웠고, Sharpa는 사람이 조종하다 실패하는 구간만 기계에 넘겼다. 이 카드는 왼쪽을 편다.
학습량이 한쪽으로 심하게 쏠려 있다. 웹 비디오 300년치로 사전학습한 다음 로봇 데이터는 11시간만 얹었다고 주장한다. 진행자들은 300년이라는 단위 자체가 이상하다고 먼저 짚는다.
다음 프레임을 시간 순서대로 하나씩 예측한다. 보통의 비디오 생성은 정해진 길이의 영상을 양방향으로 만드는데, 이쪽은 지나간 프레임을 KV 캐시로 들고 가면서 LLM의 다음 토큰 예측처럼 다음 장면을 잇는다.
행동은 그 장면에서 거꾸로 계산해 나온다. 비디오 모델은 그림만 그릴 줄 알지 관절은 모른다. IDM(Inverse Dynamics Model, 역동역학 모델 — 지금 장면과 다음 장면 두 장을 받아 그 사이에 있었을 관절 움직임을 거꾸로 계산한다)이 그 차이를 관절 명령으로 옮기고, 두 모델이 번갈아 돌아간다. 지금 실행하는 행동은 앞서 예측해 둔 것이다.
Rhoda는 어디를 갈아 끼웠나
위 칸이 지금까지의 VLA다. 지금 이미지와 말을 한 모델에 넣어 관절 명령을 바로 낸다. 아래 칸이 Rhoda다. 비디오 모델이 다음 장면을 그리고, IDM이 그 장면에서 행동을 거꾸로 계산한다. 실행한 결과가 프레임으로 다시 쌓여 다음 상상의 재료가 되고, 그 누적분이 야바위를 푸는 기억이다.
야바위 데모가 시각 기억의 증거로 나온다. 컵 아래 물건을 감추고 섞는 작업은 지금 이미지만 보는 VLA로는 원리상 못 푼다. Rhoda 쪽은 지나간 프레임을 전부 들고 있어 어느 컵인지 기억한다.
말을 안 쓰고 영상이 프롬프트 구실을 한다. 사람이 몸으로 한 번 보여 주면 로봇이 따라 한다. LLM의 퓨샷 프롬프팅에서 예시가 하던 일을 영상이 대신하는 셈이다.
정량 지표를 하나도 안 냈다. 모델 파라미터도 초당 프레임 수도 밝히지 않았고 데모만 공개했다. 진행자 한 명은 "그냥 정량적인 거는 이게 다였어"라고 말한다.
주요 숫자
300년 / 11시간
웹 비디오 사전학습량과 로봇 데이터량
4억 5천만 달러
Rhoda AI 조달액
11억 7천만 달러
Rhoda AI 밸류에이션
없음
공개된 정량 지표
이게 정답이 아닐 수도 있죠. 근데 이게 됐다라는 걸 보여줬다는게 나는 굉장히 중요한 거 같아요.
반론 · 충돌
같은 채널 「Action Data Scaling 문제」기초 4강은 데이터를 모으는 경로 다섯을 늘어놓고 어느 것도 스케일 문제를 푼다고 입증되지 않았다고 닫는다. Rhoda의 웹 비디오 사전학습은 그 경로 가운데 월드모델과 역동역학 모델을 쓰는 다섯 번째의 변형인데, 이번 편에서도 성공률 숫자가 나오지 않았다. 경로가 바뀐 것이지 입증이 된 것은 아니다.
미국주식 사관학교 — VLA가 병목을 푸는 중이라는 전제「로봇은 인건비가 아니라 설비투자 예산에서 팔린다」(2026-07-20)는 VLA 모델과 영상 사전학습·시뮬레이션이 물리 데이터 부족을 풀고 있다는 전제 위에서 로봇 시장 규모를 추산한다. Rhoda는 그 전제에 정면으로 선다 — VLA로는 범용성에 못 닿는다며 아예 갈아탔다. 병목이 풀리는 중이라는 진술은 아직 방법이 정해지지 않았다는 뜻이기도 하다.
정량이 없는 데모를 어디까지 받을 것인가야바위도 따라 하기도 데모 영상이다. 파라미터도 초당 프레임도 안 밝혔으니 같은 자로 다른 모델과 견줄 수가 없다. 진행자들도 「됐다는 걸 보여 준 것」까지만 인정한다.
유튜브 자동 자막 전문을 요약한 카드입니다. 자동 인식이라 회사·모델 이름이 흔들리는 대목이 있어 영상 설명란과 논문으로 맞춰 적었습니다. 자막은 Sharpa를 「셰파」와 「샤파」로 번갈아 받아 적고 설명란 목차에도 Sherpa가 한 번 나오는데, 논문 링크 표기를 따라 Sharpa로 통일했습니다. 이 회사가 로봇 손을 만들어 왔다는 것은 이 편이 아니라 같은 채널의 「로봇 손 직접 다 써보고 알려 드림」(2026-06-21)과 「CES 로봇 리뷰」(2026-01-14)에서 다룹니다. 숫자는 진행자가 말한 것을 그대로 옮겼고 따로 검증하지 않았습니다. 투자 추천이 아닙니다. 같은 영상에서 카드 둘이 나왔습니다 — 한 편이 회사 둘을 나란히 다뤄, 방법이 갈리는 자리에서 방식별로 나눠 실었습니다.