sudoremove — 로보틱스 · 피지컬 AI 해설
이 말을 넓게 쓰면 자율주행과 드론까지 들어와 10년 전 로보틱스와 구분이 안 됩니다. 어디에 선을 그어야 하는지, 그 선을 언제 넘었는지.
▾필자는 Physical AI를 "VLA(Vision-Language-Action, 시각·언어·행동 통합) 모델을 end-to-end로 써서 규칙 기반으로는 불가능했던 범용 물리 작업을 해내는 시스템"으로 좁게 잡자고 주장한다. 넓게 잡으면 이미 10년 전부터 있던 것들과 구분이 사라진다.
핵심 포인트
선을 어디에 긋는가
고전 로보틱스와 Physical AI
| 고전 로보틱스 | Physical AI | |
|---|---|---|
| 구조 | 모듈형(인지·계획·제어 분리) | end-to-end 단일 모델 |
| 동작 규정 | 규칙 기반 | 데이터 기반 |
| 적용 범위 | 도메인 한정 | 범용 |
| 사전 지식 | 없음(직접 설계) | LLM·VLM에서 상속 |
주요 숫자
로보틱스의 ChatGPT 순간이 곧 온다.
반론 · 충돌
뒤섞여 쓰이는 세 단어의 층위를 갈라 놓습니다. 그리고 언어에서 통한 방법이 몸에서는 왜 그대로 안 통하는지.
▾LLM에서 VLM으로, 다시 VLA로 이어지는 계보를 한 줄로 세우고 세 용어의 층위를 나눈다. 언어에서 LLM이 해낸 범용화를 로봇의 몸에서 되풀이하려는 시도인데, 행동 데이터는 인터넷에 없다는 점이 그 경로를 막는다.
핵심 포인트
한 줄로 이어진 계보와, 층위가 다른 이름 셋
주요 숫자
언어의 LLM을 몸에서 되풀이한다.
반론 · 충돌
과제별 특화 모델이 통합 모델로 수렴한 전례가 로봇에서 되풀이될 조건 셋. 그리고 지금 어디까지 왔는지를 데이터셋 숫자로.
▾분류·검출·분할마다 따로 있던 비전 모델이 통합 VLM 하나로 수렴한 경로를 로보틱스가 그대로 밟고 있다고 본다. 그 전환을 떠받치는 조건으로 사전학습 VLM 백본, 교차 embodiment 데이터셋, 스케일링 법칙 셋을 든다.
핵심 포인트
같은 모양의 수렴이 두 번
교차 embodiment 데이터셋
| 데이터셋 | 로봇 종류 | 과제 수 | 에피소드 |
|---|---|---|---|
| Open X-Embodiment | 22종 이상 | 527 | 100만+ |
| DROID | 7종 | 500+ | 7만 6천 |
| BridgeData V2 | 1종 | 13 | 6만 |
주요 숫자
비전 AI가 걸어간 길.
반론 · 충돌
VLA가 LLM처럼 규모로 성능을 얻지 못하는 이유 셋과, 데이터를 모으려는 경로 다섯. 테슬라가 조종자에게 건 신체 조건까지.
▾행동 데이터가 인터넷에 없다는 사실, 실물 로봇을 돌려야 하는 평가 비용, 촉각 센싱과 하드웨어 제조의 미완성이 규모 확대를 막는다고 정리한다. 이를 뚫으려는 수집 경로 다섯을 늘어놓되 어느 쪽도 정답으로 판명되지 않았다고 닫는다.
핵심 포인트
병목 셋에서 갈라진 다섯 경로
LLM과 VLA의 대조
| LLM | VLA | |
|---|---|---|
| 데이터원 | 인터넷(사실상 무한) | 실물 로봇 동작(제한) |
| 수집 비용 | 낮음 | 높음 |
| 평가 | 자동 | 실물 로봇 필요 |
주요 숫자
인터넷에 없는 데이터.
반론 · 충돌
300페이지짜리 AI 연간 보고서를 여덟 가지로 추린 편입니다. LLM(대형 언어모델) 순위에서 중국 모델이 약진한 것, RL(강화학습)로 수학·코딩이 인간 최고수 수준을 넘은 것, 그 다음 자동화 대상으로 물리 노동이 지목되는 이유를 스타게이트급 컴퓨트 투자·소버린 AI 경쟁·고용 시장 변화까지 한 줄로 잇습니다.
▾진행자들이 약 300페이지 AI 연간 보고서에서 여덟 가지를 추린다. 오픈AI가 아직 1위지만 중국 모델(알리바바 Qwen·딥시크·GLM)이 약진해 격차가 좁혀졌고, RL(Reinforcement Learning, 강화학습)로 수학·코딩을 정복한 흐름이 다음은 물리 노동이라는 결론으로 이어진다.
핵심 포인트
다음은 왜 물리 노동인가
주요 숫자
애플은 요즘 뭘 하고 있을까요? 좀 잠잠하네요.
반론 · 충돌
DYNA Robotics가 사람 1인칭 영상 100만 시간(사람으로 환산하면 170년)만으로 사전학습해 로봇 데이터를 한 번도 보지 않고도 로봇 태스크를 제로샷으로 통과시켰다는 스케일링 로우를 뜯는다. 로봇 액션만 학습하면 오히려 나빠지고 사람 영상을 함께 학습해야 좋아지는 이유까지 짚고, 같은 대시보드의 Rhoda AI 「웹 비디오 300년」과 이 「사람 영상 170년」이 실은 다른 것을 세고 있다는 것도 확인한다.
▾DYNA Robotics의 새 로봇 모델 Dyna-2는 WAM(World Action Model, 미래 영상을 상상하며 행동을 뽑는 로봇 모델)이다. 사람 1인칭 영상 100만 시간(사람으로 환산하면 170년)만 사전학습하고 로봇 데이터는 한 번도 학습하지 않은 채 로봇 태스크를 제로샷으로 통과시켰다는 스케일링 법칙(scaling law, 데이터를 늘릴 때 성능이 어떻게 좋아지는지의 규칙성)을 내세운다. 진행자들은 이 「170년」이 같은 채널이 다룬 Rhoda AI의 「웹 비디오 300년」과 다른 것을 센 숫자라는 점부터 짚는다.
핵심 포인트
300년과 170년은 같은 자가 아니다
주요 숫자
1700년 별거 아니잖아요. 1700명이 1년 동안 일하는 데이터잖아요.
반론 · 충돌
「Physical AI를 좁게 정의해야 하는 이유」가 경계선으로 잡은 RT-2(2023년 7월, 시각·언어·행동을 한 모델에 넣은 첫 사례)의 3년 뒤 모습이 이 편입니다. 지금 구글 딥마인드의 실제 배포판은 단일 VLA가 아니라, 상황을 판단하는 임바디드 리즈닝이 행동을 실행하는 VLA를 자연어로 부리는 계층 구조입니다. 무엇이 판단이고 무엇이 반사인지, 어느 데이터를 프리트레이닝에서 일부러 빼는지를 뜯습니다.
▾구글 딥마인드가 Gemini Robotics 2.0을 공개했다. 임바디드 리즈닝(Embodied Reasoning, ER — 시각·언어를 받아 상황을 판단하는 상위 모델)이 VLA(Vision-Language-Action, 시각·언어·행동 통합 모델)를 하니스(harness, 상위 모델이 하위 모델에게 자연어 명령을 내리고 종료 조건까지 감시하는 지휘 구조)하는 3종 모델 체계를 처음 한 자리에서 보여줬다. 베이스 모델은 Gemini Flash 계열을 물려받아 버전마다 바뀌었고, 가장 어려운 과제였던 비닐봉지 묶기는 성공률 44%를 그대로 공개했다.
핵심 포인트
누가 누구에게 시키는가
주요 숫자
여기 로보틱스도 하네스 엔지니어링을 하고 있군요.
반론 · 충돌
앤트로픽의 Physical Intelligence 인수설을 계기로 두 회사가 로보틱스를 다른 자리에서 접근한다는 것을 확인합니다. Physical Intelligence는 π0부터 π0.7까지 로봇 전용 모델을 직접 만들고, 앤트로픽은 로봇 전용 모델 없이 언어모델이 관절값을 직접 내거나 기존 액션모델을 도구로 부릅니다. 두 방법이 낸 수치가 정반대라는 것과, 언어의 역할을 보는 두 진영의 시각이 어디서 만나는지까지 뜯습니다.
▾7월 21일 인수설이 불거진 두 회사, Physical Intelligence와 앤트로픽이 로봇을 다른 자리에서 접근한다. Physical Intelligence는 π0부터 π0.7까지 로봇 전용 VLA(Vision-Language-Action, 시각·언어·행동 통합 모델)를 직접 만들어 왔고, 앤트로픽은 로봇 전용 모델 없이 범용 언어모델이 관절값을 직접 내거나 기존 액션모델을 도구로 부르는 식으로 실험한다. 관절값을 직접 내면 5%, 액션모델을 도구로 부르면 30~42%까지 오른다는 수치가 그 차이를 보여 준다.
핵심 포인트
직접 내느냐, 시켜서 부르느냐
주요 숫자
랭귀지가 세상의 압축인 거죠.
반론 · 충돌
Sunday Robotics가 시리즈 B를 알리며 "더 이상 데모는 안 낸다"고 선을 그은 뒤 내놓은 첫 결과물 ACT-2 프리뷰를 뜯는다. 처음 보는 집에서 빨래 개기를 제로샷 99.1%로 냈다는 주장과 그 근거로 든 프리트레이닝 스케일링 그래프, 그리고 시급 30~60달러를 받는 '메모리 디벨로퍼' 약 1,000명이 데이터를 모으는 방식을 확인한다. 같은 대시보드의 2025-11-25 편이 "로봇 없이 모은다"고 했던 회사가 여덟 달 뒤 어떤 숫자를 공개했는지가 이 카드의 축이다.
▾Sunday Robotics가 "데모는 그만, 이제부터는 솔브(solve, 정해진 범위 안에서 신뢰할 수 있는 성능)만 낸다"며 처음 보는 집에서 빨래 개기 제로샷(zero-shot, 추가 학습 없이 곧바로) 99.1%를 공개했다. 데이터는 시급 30~60달러를 받는 '메모리 디벨로퍼' 약 1,000명이 스킬 캡처 글로브를 끼고 모은다. 후반부는 MIT 교수 Russ Tedrake가 창업한 산업용 로봇 회사 Walden Robotics를 다룬다.
핵심 포인트
사람 천 명이 데이터를 만든다
주요 숫자
프런티어 기술이 왜 다 빨래임?
반론 · 충돌
RLWRLD가 낸 로봇 파운데이션 모델 RLDX-1의 「SOTA 오픈웨이트」라는 말이 실제로 무엇을 가리키는지 구분한다. 가중치·코드·데이터 비율까지 연 범위와, 어블레이션·벤치마크 설계처럼 열지 않은 채로 남은 부분을 나눠서 본다.
▾한국 RLWRLD가 로봇 파운데이션 모델(RFM, Robot Foundation Model) RLDX-1을 공개했다. 모델 가중치 세 종과 인퍼런스·학습·LoRA(Low-Rank Adaptation, 전체 가중치 대신 일부만 값싸게 다시 학습하는 파인튜닝 기법) 코드까지 열었다는 점에서 「SOTA 오픈웨이트」를 내세우지만, 어블레이션 실험과 벤치마크 설계의 공정성은 그 공개 범위 밖에 있다.
핵심 포인트
열린 것과 안 열린 것
주요 숫자
가장 큰 의미는 이런 파운데이션 모델이 우리나라에서 나왔고 일단 오픈소스를 깠다.
반론 · 충돌
스텔스에서 막 나온 회사가 VLA 로는 범용성에 못 닿는다며 갈아탄 구조를 뜯어봅니다. 웹 비디오로 학습한 생성 모델이 다음 프레임을 그리고 그 프레임에서 관절 명령을 역산하는 방식이 무엇을 벌고 무엇을 안 밝혔는지까지.
▾Rhoda AI 는 스텔스에서 막 나온 로봇 회사다. VLA(Vision-Language-Action, 시각·언어·행동 통합 모델)로는 범용성에 못 닿는다고 보고, 웹 비디오로 학습한 생성 모델이 다음 프레임을 예측하면 그 프레임을 역산해 관절 명령을 뽑는 DVA(Direct Video Action)를 택했다. 같은 편에 나오는 Sharpa 는 반대로 VLA 를 쓰되 어려운 구간만 떼어 냈고, 그 카드는 같은 섹션에 따로 있다.
핵심 포인트
두 회사는 무엇이 다른가
Rhoda는 어디를 갈아 끼웠나
주요 숫자
이게 정답이 아닐 수도 있죠. 근데 이게 됐다라는 걸 보여줬다는게 나는 굉장히 중요한 거 같아요.
반론 · 충돌
로봇 손을 만들어 온 회사가 낸 이층 구조를 뜯어봅니다. 사람이 조종해도 실패하는 구간만 강화학습 정책으로 미리 구워 발 페달에 붙였고, 그 효과가 성공률보다 데이터 수율에서 크게 드러납니다.
▾Sharpa 는 로봇 손을 만들어 온 회사다. 엔비디아 GTC 부스에서 사과 깎기를 걸고, 사람이 조종하기 가장 어려운 손안 조작만 강화학습 정책으로 미리 구워 발 페달에 붙였다. 나머지는 모방학습 VLA(Vision-Language-Action, 시각·언어·행동 통합 모델)가 맡는 이층 구조이고, 진행자들은 이것을 위계적 구조로 읽는다.
핵심 포인트
페달이 왜 달렸나
판단과 반사를 나눠 맡긴다
주요 숫자
이게 정답이 아닐 수도 있죠. 근데 이게 됐다라는 걸 보여줬다는게 나는 굉장히 중요한 거 같아요.
반론 · 충돌
엔비디아가 GTC 2026 키노트 열흘 전 로봇 논문 다섯 편을 한꺼번에 냈다. DreamDojo(월드모델), SONIC·EgoScale(VLA), DreamZero·Cosmos Policy(비디오 액션모델)가 각각 어떤 방법으로 사람 영상을 데이터원으로 바꾸는지, 왜 다섯 편 모두 GPU를 대량으로 쓰는지를 회사·모델 이름별로 정리한다.
▾엔비디아가 GTC 2026 키노트를 열흘 앞두고 로봇 논문 다섯 편을 한꺼번에 냈다. 월드모델(world model) DreamDojo, VLA(Vision-Language-Action) SONIC·EgoScale, 비디오 액션모델 DreamZero·Cosmos Policy로 갈린다.
핵심 포인트
같은 재료에서 갈린 세 방식
주요 숫자
지금 이거는 밑밥이에요.
반론 · 충돌
팔만 움직이던 VLA가 균형·접촉까지 걸리는 온몸 제어로 넘어가면서 무엇이 달라지는지 잡는다. Figure AI가 균형을 강화학습이 아니라 이미테이션 러닝으로 푼 System 0을 새로 넣었다는 점, 같은 시기 등장한 Fauna Sprout가 정교한 손 대신 온몸 자유도에 건 이유까지 함께 본다.
▾Figure AI Helix 02는 골반·다리까지 함께 쓰는 온몸 제어(whole-body control, 팔뿐 아니라 몸통·다리·균형까지 한 모델이 함께 다루는 제어)를 자율로 시연했다. 균형을 맡는 System 0을 새로 넣었는데 강화학습이 아니라 이미테이션 러닝(imitation learning, 사람 시연 데이터를 그대로 따라 배우는 방식)으로 학습했다는 점이 눈에 띈다. 같은 시기 등장한 소형 연구용 로봇 Fauna Sprout도 온몸 29자유도로 비슷한 방향을 보여준다.
핵심 포인트
상체만 쓰던 것과 온몸을 쓰는 것
주요 숫자
지금 이 상황에서도 다 밸런스를 맞춘다.
반론 · 충돌
스텔스에서 나온 Sunday Robotics의 로봇 메모를 계기로, 로봇을 원격조작하지 않고 사람 손 데이터로 학습하는 회사(Sunday Robotics·Generalist AI)와 여전히 원격조작 데이터를 쓰는 회사(Physical Intelligence)가 갈리는 지점을 알게 된다. "로봇 데이터 없이"가 어디까지 진짜인지 회사별로 갈라 볼 수 있다.
▾Sunday Robotics(선데이 로보틱스)와 Generalist AI(제너럴리스트)는 로봇을 원격조작(텔레오퍼레이션)하지 않고 사람이 UMI 그리퍼(Universal Manipulation Interface, 사람이 손에 쥐고 움직이면 카메라가 그 동작을 로봇 조작 데이터로 바꿔주는 손잡이형 도구) 방식으로 모은 손동작 데이터를 쓴다. Physical Intelligence는 π*0.6에서도 실제 로봇을 사람이 원격조작하는 방식을 그대로 쓴다.
핵심 포인트
로봇을 쓰느냐 안 쓰느냐
주요 숫자
근데 나는 저게 저렇게 많이 필요한가 싶기도 해.
반론 · 충돌
대시보드 「Physical AI를 좁게 정의해야 하는 이유」는 보스턴 다이내믹스가 MPC(모델 예측 제어)에서 디퓨전 트랜스포머 기반 LBM(Large Behavior Model)으로 넘어간 것을 패러다임 전환의 증거로 추정만 했습니다. 이 편은 그 LBM이 실제로 아틀라스에 올라가 다리와 상체를 함께 움직이는 데모를 보여줍니다. MPC는 사라지지 않고, 텔레오퍼레이션과 추론의 허용 범위를 잡아주는 역할로 남습니다.
▾보스턴 다이내믹스와 토요타 리서치 인스티튜트(TRI)가 함께 만든 LBM(Large Behavior Model, 관찰을 받아 다음 행동을 통째로 생성하는 대형 행동모델)이 아틀라스 로봇에 올라가, 다리와 상체를 하나의 모델이 함께 제어해 물체를 집는 데모를 처음 보였다. 기존 강점인 MPC(Model Predictive Control, 관절·토크·자기충돌 같은 제약 조건 안에서 다음 동작을 실시간으로 최적화해 푸는 제어 방식)는 사라지지 않고, 텔레오퍼레이션(Teleoperation, 사람이 실시간으로 로봇을 원격 조작하는 방식) 입력과 추론 결과가 넘어지지 않는 범위 안에 있도록 걸러주는 역할로 남는다.
핵심 포인트
MPC 는 사라지지 않았다
주요 숫자
뇌가 특이점이지.
반론 · 충돌
여덟 달 뒤 나올 Helix 02(온몸 균형까지 이미테이션 러닝으로 푼 모델)보다 앞선 시점의 Helix를 잡는다. 이때는 물류 한 과제에 상체만 쓰고 있었고, 개선은 프레임·촉각 입력을 늘리고 스테레오 카메라를 다는 인지 쪽에 머물렀다. 같은 편에서 테슬라 옵티머스의 싱글 뉴럴넷 주장과 화성행 계획, 그리고 로봇 액션 데이터를 만드는 두 방식 방법(엔비디아 드림젠의 영상 생성과 HuggingFace SmolVLA의 크라우드소싱)까지 함께 본다.
▾Figure AI가 2025년 6월 7일 공개한 Helix 1시간 데모는 물류 창고에서 종이 택배 바코드를 스캐너 쪽으로 돌려 보내는 과제 하나에 상체만 써서, 실패(약 40분 지점에서 택배를 떨어뜨림)와 복구까지 그대로 담았다. 이 시점 Helix는 골반·다리를 쓰는 온몸 제어는 아직 다루지 않는다. 같은 편에서 테슬라 옵티머스가 단일 신경망 하나로 여러 과제를 프롬프트에 따라 수행한다고 주장한 데모와, 2026년 화성 무인 발사 계획도 함께 짚는다.
핵심 포인트
오래 버티는 것과 넓게 되는 것
주요 숫자
화성 가야 되니까.
반론 · 충돌
휴머노이드 VLA가 그리퍼 위치 7 자유도만 움직이던 시절에서 손가락·손목·머리·몸통 35 자유도를 신경망 하나로 구동하는 시절로 처음 넘어간 순간을 잡는다. Figure AI가 오픈AI와 결별하고 판단(System 2)·반사(System 1)로 나눈 자체 VLA를 처음 공개한 배경까지 함께 본다.
▾Figure AI가 VLA(Vision-Language-Action, 시각·언어·행동 통합 모델)인 Helix를 처음 공개했다. 그리퍼 위치만 다루던 이전 VLA와 달리 손가락 다섯 개·손목·머리·몸통까지 신경망 하나로 구동한 첫 사례이고, 판단을 맡는 System 2와 반사를 맡는 System 1로 나눈 구조를 이 편에서 처음 밝혔다.
핵심 포인트
Helix 가 처음 낸 것
주요 숫자
사람처럼 그 사람의 상체를 되게 정밀하게 지금 구동시키고 있는게 일단 처음으로 되게 신기해요
반론 · 충돌
게임 클립 플랫폼 Medal에서 나온 General Intuition이 왜 자사 월드모델 MIRA를 「그냥 훈련장」이라 부르는지, 그 근거와 이 프레이밍이 영상 품질 자체를 파는 Decart와 어디서 갈리는지 알게 된다. 회사가 현장에서 직접 답한 수치와 끝내 밝히지 않은 수치를 갈라 정리했다.
▾General Intuition(게임 클립 플랫폼 Medal에서 스핀오프한 회사)은 월드모델(world model, 환경의 미래 상태를 예측해 생성하는 모델) MIRA를 공개하면서 "이건 단순히 훈련장이다, 본질은 에이전트다"라고 직접 밝혔다. ICML(International Conference on Machine Learning, 머신러닝 학회) 현장에서 5B 파라미터 모델이 B200 GPU 한 장으로 로켓 리그 4인 시점을 실시간 생성하는 데모를 진행자들이 직접 플레이했다.
핵심 포인트
무엇을 목표로 두느냐
주요 숫자
저 월드 모델을 학습 장으로 쓰려고 하는 거죠. 이거는 단순히 훈련장이다.
반론 · 충돌
엔비디아 GEAR팀이 "VLM 기반 VLA는 근본적으로 틀렸다"며 비디오모델을 밀고, 진행자들은 그 배경에 GPU를 더 파는 유인이 있다고 짚습니다. 같은 시점에 1X Technologies가 그 비디오모델을 평가용이 아니라 로봇 NEO를 실제로 구동하는 데 처음 썼습니다. 로봇 회사가 왜 굳이 12초씩 걸리는 이 방식을 택했는지, 900시간+70시간이라는 적은 데이터로 무엇을 얻었는지를 뜯습니다.
▾엔비디아 GEAR팀의 짐 판(Jim Fan)과 스펜서 항(Spencer Huang)이 "VLM(Vision-Language Model) 기반 VLA(Vision-Language-Action, 시각·언어·행동 통합 모델)는 근본적으로 틀렸을 수 있다"며 비디오모델(영상을 그대로 생성하는 모델) 기반 로봇 정책을 미는데, 진행자들은 그 배경에 비디오모델이 GPU를 훨씬 더 먹는다는 엔비디아의 판매 유인이 있다고 짚는다. 1X Technologies는 이 접근으로 로봇 NEO를 실제 구동하는 데 Redwood AI World Model을 처음 투입했다.
핵심 포인트
영상을 그리고 그 영상에서 행동을 뽑는다
주요 숫자
비디오 모델이다라고 이제 광을 팔기 시작하는 거 같고 GPU를 더 팔기 위해서
반론 · 충돌
월드모델(World Model)이 소라·비오3 같은 비디오 생성모델과 어디서 갈리는지 알게 된다. 1X Technologies의 1X World Model(1XWM)이 로봇 정책이 낸 행동을 입력받아 미래 영상과 성공확률을 함께 내놓아 실물 로봇 평가의 병목을 어떻게 대신하는지, 그리고 데이터가 적은 몸체에서 물리 상식이 어떻게 깨지는지까지.
▾월드모델(World Model, 특정 행동을 입력하면 그 행동이 일으킬 미래 관측을 예측하는 모델)은 소라·비오3 같은 비디오 생성모델과 다르다 — 세밀한 액션을 입력받아 그 액션에 대응하는 미래를 낸다는 점이 갈림점이다. 1X Technologies의 1X World Model(1XWM)은 로봇 정책(policy, 어떤 상황에서 어떤 행동을 할지 정하는 함수)이 낸 행동 시퀀스를 넣으면 미래 1인칭 영상과 그 시나리오의 성공확률(상태가치, state value)을 함께 내놓아, 실물 로봇을 돌리지 않고도 정책을 걸러낸다.
핵심 포인트
실물 로봇 없이 정책을 재는 법
주요 숫자
월드 모델이 있으면 테스트를 돌리고 나서 좋은 것만 골라서 실제 한번 테스트 하면 되니까.
반론 · 충돌
같은 채널의 「Rhoda AI는 VLA를 버렸고 Sharpa는 손안 조작만 따로 구웠다」에서 이름으로만 나왔던 Sharpa가 실은 로봇 손을 만들어 온 회사라는 사실이 이 편에서 드러납니다. 열 종 넘는 손을 직접 써 본 엔지니어가 우지·Sharpa·테솔로·알렉스 넷을 자유도·힘·촉각·가격으로 실측 비교합니다.
▾RealWorld 하드웨어 엔지니어 맥스가 열 종 넘는 로봇 손(덱스터러스 핸드)을 직접 다뤄 본 경험으로 좋은 손의 기준을 자유도(DOF, Degree of Freedom)·핑거팁 포스(손가락 끝 악력)·센싱 세 방식로 정리하고, 우지(Wuji)·Sharpa(샤파)·테솔로(Tesollo)·알렉스(Alex) 네 손을 실측치로 견준다. Sharpa가 로봇 손을 만드는 회사라는 사실, 우지의 내구성 결함, 텐던 구동과 다이렉트 드라이브의 갈림까지 다룬다.
핵심 포인트
손 넷을 같은 자로 잰다
주요 숫자
살아남지 못할 겁니다.
반론 · 충돌
같은 채널이 두 달 뒤(「Rhoda AI는 VLA를 버렸고 Sharpa는 손안 조작만 따로 구웠다」)와 다섯 달 뒤(「Sharpa는 로봇 손 회사였다」)에 다시 다루는 Sharpa를 이 편이 처음 CES 부스에서 마주칩니다. 보스턴 다이나믹스 신형 아틀라스가 손가락을 3자유도에서 4자유도로 바꾼 것, 제미나이 로보틱스 데모를 직접 써 본 경험, 그리고 Sharpa 카드 딜링 영상이 배속 없이 실제 속도로 재생되고 있었다는 확인까지 — 부스에서만 알 수 있는 디테일을 담았습니다.
▾sudoremove 진행자 JB·JC가 CES 2026 로봇 부스를 돌아본 소감을 정리한다. 보스턴 다이나믹스 신형 아틀라스는 손가락을 3자유도에서 4자유도로 바꾸고 구글 딥마인드 제미나이 로보틱스를 판단 모델로 쓰기로 했다. Sharpa는 촉각 기반 카드 딜링 데모로 부스 화제를 모았고 CraftNet이라는 위계형 VTLA(Vision-Tactile-Language-Action, 시각·촉각·언어·행동 통합 모델)와 손 하나 5만 달러라는 가격을 함께 공개했다.
핵심 포인트
부스에서 직접 본 두 대
주요 숫자
촉각이 얼마나 기여했는지를 우리가 사실 잘 모르니까.
반론 · 충돌
몸체는 Figure 03(손바닥 카메라·유도 충전)과 1X 네오(IShowSpeed 원격조작 라이브)로 눈에 띄게 좋아졌는데, 정작 병뚜껑 하나를 따는 데는 왜 아직도 막히는지를 짚는 편입니다. 벌리고 오므리는 동작과 비트는 동작을 동시에 해내는 손이 드물다는 것, 보스턴 다이내믹스가 신뢰도·값·개발 속도 때문에 손가락 3개를 고수한다는 것, 손이 로봇 몸체보다 비쌀 수 있다는 것까지 구체적으로 다룹니다.
▾Figure AI가 손바닥에 카메라를, 발에 유도 충전(전선 접촉 없이 근접만으로 충전하는 방식)을 넣은 새 몸체 Figure 03을 공개하자, 1X Technologies는 유튜버 IShowSpeed가 NEO를 원격조작(텔레오퍼레이션)하는 라이브로 맞선다. 진행자들은 판단(상황을 읽고 다음 동작을 정하는 몫)은 클라우드의 큰 VLM에, 반사(손가락을 실제로 움직이는 동작)는 로컬의 작은 액션 모델에 맡기는 이원 구조를 읽어낸 뒤, 결국 병뚜껑 하나를 따려면 벌리고 오므리는 동작과 비트는 동작을 동시에 해내야 하는데 그런 손은 드물다고 짚는다.
핵심 포인트
손가락 수를 두고 갈리는 판단
주요 숫자
손이 로봇보다 비싼 경우가 진짜 많아요.
반론 · 충돌
엔비디아가 GTC 타이베이에서 발표한 레퍼런스 휴머노이드(유니트리 H2 Plus + Sharpa 손 + Jetson Thor)에 올라탄 한국 로보틱스 회사 넷 — 위로보틱스·레인보우로보틱스·홀리데이로보틱스·디든로보틱스 — 이 저마다 손·상반신·하드웨어·풀스택 가운데 어느 조각을 대는지 갈라 봅니다. 레인보우로보틱스의 세탁기 호스 데모는 하드웨어·손·모델이 세 조직에서 나온 조합이라는 것, 그리고 GTC 등장이 곧 양산 실적은 아니라는 것까지 짚습니다.
▾엔비디아가 GTC 타이베이에서 유니트리 H2 Plus·Sharpa 손·Jetson Thor(엔비디아의 로봇 온보드 컴퓨팅 칩)를 묶은 레퍼런스 휴머노이드를 약 20만 달러에 내놨다. 이 생태계 위에 위로보틱스(WIRobotics)·레인보우로보틱스(Rainbow Robotics)·홀리데이로보틱스(Holiday Robotics)·디든로보틱스(DIDEN Robotics) 넷이 손·상반신·하드웨어·풀스택 가운데 저마다 다른 조각을 대며 올라탔다. 레인보우로보틱스의 세탁기 호스 데모는 하드웨어·손·모델이 세 조직에서 나온 조합이었다.
핵심 포인트
누가 어느 조각을 댔나
주요 숫자
사람이 더 싸다.
반론 · 충돌
비상장 휴머노이드 회사 Figure AI에 개인 투자자가 공개적으로 닿을 수 있는 유일한 길이 로보스트레티지(RoboStrategy, 티커 BOT)라는 포트폴리오 상장사라는 것과, 그 안에 정확히 무엇이 얼마나 담겼는지는 소개하는 진행자들도 확신하지 못한다는 것을 함께 본다. 상장 2주 만에 반토막 난 주가와, Figure AI 자신이 하드웨어도 모델도 공개하지 않아 데모 말고는 판단 근거가 없다는 한계까지 짚는다. 투자 추천이 아니라 통로의 구조를 뜯어보는 카드다.
▾이 영상은 보스턴 다이내믹스·Figure 03 데모 다음에 로보스트레티지(RoboStrategy, 티커 BOT)라는 상장사를 개인이 Figure AI에 닿는 길로 소개한다. 그런데 포트폴리오 구성 비율도, 상장 2주 만의 반토막도, Figure AI 자체의 정보 공개 수준도 진행자들 스스로 확신하지 못하는 채로 남는다. 진행자들은 영상에서 명시적으로 매수 추천이 아니라고 못박는다.
핵심 포인트
통로 하나에 가려진 것들
주요 숫자
매수 추천은 아닙니다.
반론 · 충돌
텔레오퍼레이션(teleoperation, 사람이 실시간으로 로봇을 직접 조종하는 방식) 없이 리모컨으로 TV를 켠 Figure Helix 데모를 보고, 진행자들이 그 "사람 느낌"의 정체를 손가락 정교함이 아니라 하드웨어는 그대로 두고 모델만 좋아진 데서 왔다고 짚는 대목을 잡습니다. 리모컨을 쥐는 데 쓰인 자유도가 Figure AI가 홍보한 22자유도가 아니라 6자유도로 추정된다는 점, 오픈AI GPT 5.4를 코덱스로 열흘 써 본 후기도 함께 담습니다.
▾sudoremove 진행자 JB·JC가 Figure AI Helix의 리모컨·수건 데모를 보고 "사람 느낌"이 어디서 나오는지 짚은 뒤, 오픈AI GPT 5.4를 코덱스로 열흘 써 본 후기와 하이브리드 아키텍처(Transformer와 게이트드 델타넷(Gated Delta Net, 과거 정보는 압축해 요약만 남기고 최근 정보만 자세히 기억하는 순환 신경망 구조)을 섞는 언어모델 설계)가 번지는 흐름을 짧게 훑는다.
핵심 포인트
인상이 어디서 왔는지 갈라 본다
주요 숫자
요새 그 하드웨어는 그대로 모델이 좋으니까 훨씬 더 자연스럽게 애들이 동작을 하더라고.
반론 · 충돌
진행자 둘이 신년에 즉흥으로 던진 열네 개 예측을 무엇을·누가·언제까지라고 했는지로 정리한다. Transformer 대체 구조·RAG 소멸·온디바이스 파인튜닝·추론 시장의 GPU 대 비GPU처럼 정면으로 갈린 항목과, 모라벡의 역설처럼 강하게 합의한 항목을 구분한다. 지금(2026년 8월) 시점에서 이미 판정 재료가 나온 항목은 VLA(Vision-Language-Action, 시각·언어·행동 통합 모델)의 산업 표준화 예측이다.
▾진행자 둘이 신년 잡담으로 열네 개 예측을 즉흥 찬반으로 매긴다. 모라벡의 역설(Moravec's Paradox, 인간에게 쉬운 지각·운동 과제가 AI에게는 어렵다는 관찰) 해결과 Mamba(어텐션 없이 시퀀스를 처리하는 대안 아키텍처)의 장악에는 둘 다 부정으로 합의했지만, Transformer 대체 구조·RAG 소멸·VLA 산업표준화·추론 칩 시장은 정면으로 갈렸다.
핵심 포인트
쉽게 합의한 것과 정면으로 갈린 것
주요 숫자
1년 안에는 안 되고 28년 안에는 가능할 듯.
반론 · 충돌
휴머노이드 회사가 무너지는 지점이 하드웨어가 아니라 자금 조달이라는 것을 케이스케일(K-Scale Labs)의 실패로 확인한다. 1X Technologies의 NEO 예약가 2만 달러가 왜 경쟁 로봇 값의 3분의 1에도 못 미치는지, 유니트리·테슬라만 이 게임에서 예외인 이유까지 함께 본다.
▾K-Scale Labs는 케이봇(K-Bot) 예약판매를 시리즈 투자의 지렛대로 썼지만 VC가 고투마켓(go-to-market, 제품을 시장에 내놓아 파는 방식)을 문제 삼아 투자를 접었고, 예약 취소·환불 메일을 보내고 무너졌다. 1X Technologies는 가정용 로봇 NEO를 2만 달러에 예약판매하는데, 진행자들은 이 값을 텔레오퍼레이션(teleoperation, 사람이 로봇을 원격으로 직접 조종해 궤적을 모으는 방식) 데이터를 모으기 위한 손해 감수형 가격으로 본다.
핵심 포인트
돈이 끊긴 순서
주요 숫자
로봇 하드웨어 회사가 사실 양산을 잘해야 되는 것도 중요하고 자금 조달을 되게 잘해야 되거든요.
반론 · 충돌
CORL·Humanoids 2025가 서울에서 열리기 직전 시점의 국내외 로봇 판세를, 모델 만드는 쪽(RealWorld·Figure AI·Physical Intelligence)과 하드웨어 대는 쪽(로보티즈·Pollen Robotics·Robros)으로 나눠 훑는다. 이때 액추에이터 공급·손가락 폼팩터·촉각 데이터가 아직 안 풀렸다고 짚은 지점이, 한 달 뒤 편에서는 병뚜껑을 못 여는 구체적 사례로, 두 달 뒤 편에서는 K-Scale Labs의 붕괴로 이어진다.
▾CORL(로봇 학습 학회)·Humanoids 2025가 서울에서 열리기 직전, 국내외 로봇 근황을 모델 만드는 쪽과 하드웨어 대는 쪽으로 나눠 정리한 편이다. 로보티즈는 손을 공개하고 공장도 짓는데 손에 들어가는 소형 액추에이터는 주문이 밀려 있고, Figure AI는 부동산 자산운용사 Brookfield와 손잡고 현장 데이터를 모은다. 손가락 개수와 촉각 데이터를 모델에 넣는 법은 이 시점까지도 답이 없다.
핵심 포인트
손이 나오기까지 거치는 자리
주요 숫자
진짜 사람 손이 미쳤어요.
반론 · 충돌
로보시지가 연 국내 최초 바이매뉴얼(양팔) 르로봇 해커톤에서 참가팀이 SO-ARM 키트 조립부터 데이터 수집·학습까지 대회 기간 안에 어디까지 갈 수 있었는지를 봅니다. 우승팀의 비결과 함께, 조립이 왜 힘들었는지·어떤 과제는 왜 안 됐는지도 같이 남깁니다. 8개월 전 첫 해커톤과 비교해 무엇이 표준으로 자리 잡고 무엇이 아직 안 퍼졌는지까지 확인합니다.
▾로보시지가 한성대학교에서 연 국내 최초 바이매뉴얼(양팔) 르로봇(LeRobot, HuggingFace의 오픈소스 로보틱스 라이브러리) 해커톤 현장기다. SO-ARM 키트를 조립해 3색 공 분류·캐러멜 포장·행주 접기 세 과제 데이터를 모아 학습시킨 결과, 05년생 학부 1·2학년 팀이 데이터 품질만으로 우승했지만 행주 접기는 어느 팀도 끝내지 못했다.
핵심 포인트
어디까지 되고 어디서 멈췄나
주요 숫자
이렇게 이제 막 세상에 나온 것들을 다들 써보고 있다는게 참 미래가 밝구나 이런 생각이 들었고요.
반론 · 충돌
논문도 발표도 아니라 CoRL(로봇러닝 학회) 2025 전시부스를 진행자가 직접 돌며 물건을 맡기고 조작해 본 기록입니다. 구글 딥마인드 Gemini Robotics 1.5, 로보티즈·에이로봇의 하드웨어, 유니트리·레인보우로보틱스의 보행 로봇을 한 자리에서 비교한 뒤 「RL은 됐고 VLA는 아직」이라는 인상을 남깁니다. 이 편이 어렴풋이 짚은 「시스템 원투 구조」가 10개월 뒤 같은 채널의 「구글 딥마인드는 임바디드 리즈닝으로 VLA를 하니스해 판단과 반사를 나눴다」에서 어떻게 정식화되는지, 그리고 「픽앤플레이스 수준」이라던 판정이 그때 어디까지 뒤집히는지를 나란히 봅니다.
▾sudoremove 진행자가 CoRL(Conference on Robot Learning, 로봇러닝 학회) 2025 전시부스를 돌며 여러 회사의 로봇을 직접 조작해 본 현장기다. RL(Reinforcement Learning, 강화학습) 기반 보행·조작 데모는 이미 완성도가 높았던 반면 VLA(Vision-Language-Action, 시각·언어·행동 통합 모델) 데모는 픽앤플레이스 수준에 머물렀고, 데이터 수집은 VR·안경·장갑·카메라그리퍼 네 가지로 정리됐다.
핵심 포인트
같은 학회장, 다른 도착점
주요 숫자
반면에 VLA는 아직 멀었습니다. 기껏대야 픽앤 플레이스 정도 되는 수준이에요.
반론 · 충돌
sudoremove 호스트 조준호(JC)가 자율주행 연구 경력을 그대로 VLA(시각·언어·행동 통합 모델)에 겹쳐 낸 네 가지 교훈 — 엔드투엔드 정책, 인덕티브 바이어스, 데이터·평가 확장성, 스페셜리스트→제너럴리스트 순서 — 를 볼 수 있습니다. 로보티즈의 새 오픈소스 팔 OMX와 텔레오퍼레이션 휴머노이드 AI 워커도 함께 나옵니다.
▾로보티즈 사옥에서 열린 피지컬 AI 워크숍 기록이다. 로보티즈의 새 오픈소스 로봇팔 OMX와 원격조작 휴머노이드 AI 워커를 먼저 둘러본 뒤, sudoremove 호스트 조준호(JC)가 자율주행 연구 경력을 바탕으로 VLA(Vision-Language-Action, 시각·언어·행동 입력을 받아 로봇 동작을 출력하는 모델)를 네 가지 교훈으로 정리해 직접 강연한다.
핵심 포인트
자율주행의 순서를 겹쳐 본다
주요 숫자
내가 하다 보면은 이제 로봇이 약간 부서질 것 같아요. 근데 그거 전에 제 몸이 부서질 것 같아요.
반론 · 충돌
AI 로보틱스 코리아(AIRK) 2025 데모룸에서 직접 만진 로봇 손 두 대의 실측 스펙(7자유도·손가락당 2kg)과, HuggingFace 오픈소스 로봇의 특허 이슈를 청중석의 로보티즈(Robotis) 앞에서 발표자 스스로 인정한 대목을 담습니다. 이어지는 강연에서는 테슬라(사람을 고용)·엔비디아(시뮬레이션)와 다른 HuggingFace의 액션 데이터 전략 — 32시간 해커톤에서 5만 개 에피소드를 모은 커뮤니티 스케일링 — 을 정리합니다.
▾sudoremove 대표 박종현이 AI 로보틱스 코리아(AIRK) 2025 데모룸을 돌아본 뒤, HuggingFace의 액션 데이터 스케일링 강연을 했다. 손가락마다 2kg 힘을 내는 7자유도(DOF, Degree of Freedom, 관절이 독립적으로 움직이는 축 수) 로봇 손을 실측했고, HuggingFace의 오픈소스 로봇은 특허 이슈가 있다고 소개자 스스로 밝혔다. 32시간짜리 월드와이드 해커톤에서는 5만 개 에피소드가 올라오고 190개 팀이 과제 성공을 제출했다.
핵심 포인트
문서로 아는 것과 만져야 아는 것
주요 숫자
로봇 데이터, 액션 데이터는 휴먼 인간을 불태워서 만들고 있어요.
반론 · 충돌
같은 진행자 둘이 1년에 걸쳐 낸 영상 네 편을 하나로 묶어, HuggingFace(허깅페이스)의 오픈소스 로봇 플랫폼 LeRobot(르로봇) 한 방식이 개인 실습에서 해커톤을 거쳐 회사의 공식 전략으로 바뀌는 과정을 봅니다. 2025년 5월 집에서 로봇팔을 조립하던 도구가 2025년 6월 서울 해커톤에서 40여 팀의 검증을 받고, 2026년 5월 파리 본사에서는 커뮤니티 데이터가 공식 「데이터 플라이휠」 전략으로 굳는 걸 확인합니다. 다만 모터 펌웨어 불일치 같은 하드웨어 병목은 1년 내내 그대로 남아 있다는 것도 함께 짚습니다.
▾이 카드는 sudoremove 진행자 둘이 HuggingFace(허깅페이스)의 오픈소스 로봇 플랫폼 LeRobot(르로봇)을 다룬 영상 네 편을 하나로 묶는다. 2025년 5월 집에서 로봇팔을 조립하던 실습이, 2025년 6월 진행자들이 직접 호스트를 맡은 서울 해커톤을 거쳐, 2026년 5월 파리 본사 인터뷰에서 회사의 공식 데이터 전략으로 굳는 과정을 좇는다.
핵심 포인트
1년 동안 지나온 자리
주요 숫자
저는 그게 이제 중간 과정이 될 거라고 봅니다.
반론 · 충돌