논문도 발표도 아니라 CoRL(로봇러닝 학회) 2025 전시부스를 진행자가 직접 돌며 물건을 맡기고 조작해 본 기록입니다. 구글 딥마인드 Gemini Robotics 1.5, 로보티즈·에이로봇의 하드웨어, 유니트리·레인보우로보틱스의 보행 로봇을 한 자리에서 비교한 뒤 「RL은 됐고 VLA는 아직」이라는 인상을 남깁니다. 이 편이 어렴풋이 짚은 「시스템 원투 구조」가 10개월 뒤 같은 채널의 「구글 딥마인드는 임바디드 리즈닝으로 VLA를 하니스해 판단과 반사를 나눴다」에서 어떻게 정식화되는지, 그리고 「픽앤플레이스 수준」이라던 판정이 그때 어디까지 뒤집히는지를 나란히 봅니다.
sudoremove JB · JC2025-10-0713분YouTube
▾
sudoremove 진행자가 CoRL(Conference on Robot Learning, 로봇러닝 학회) 2025 전시부스를 돌며 여러 회사의 로봇을 직접 조작해 본 현장기다. RL(Reinforcement Learning, 강화학습) 기반 보행·조작 데모는 이미 완성도가 높았던 반면 VLA(Vision-Language-Action, 시각·언어·행동 통합 모델) 데모는 픽앤플레이스 수준에 머물렀고, 데이터 수집은 VR·안경·장갑·카메라그리퍼 네 가지로 정리됐다.
핵심 포인트
RL과 VLA의 격차가 뚜렷했다. 유니트리·레인보우로보틱스의 강화학습 기반 보행 로봇은 이미 실물로 보기에도 압도적이었던 반면, VLA 데모는 「기껏해야 픽앤플레이스 정도」에 머물렀다고 진행자는 요약한다.
Gemini Robotics 1.5는 두 로봇을 동시에 부렸다. 셀카를 찍으라는 지시에 먼저 폰을 들겠다고 말로 작업을 분해했고, ALOHA(저비용 양팔 원격조작 로봇 플랫폼)와 Franka Robotics 로봇을 동시에 움직여 크로스 임바디먼트(하나의 모델이 다른 몸체에도 그대로 통하는 성질)를 보였다.
같은 학회장, 다른 도착점
두 방식이 같은 해에 서로 다른 데까지 와 있다. 보행은 학회장을 걸어 다닐 만큼 풀린 것으로 취급되는데, 조작은 집어서 옮기는 데서 멈춘다. 다리는 풀렸고 손은 아직이라는 이 페이지의 다른 카드들과 같은 진단이다.
같은 과제라도 파인튜닝 여부가 결과를 정했다. 천 접기 데모에서 파인튜닝된 모델은 빠르고 정확했지만, 파인튜닝하지 않은 Franka Robotics + Gemini Robotics 조합은 느리고 서툴렀다.
로보티즈는 자체 로봇 손에 엔비디아 GR00T를 얹었다. 대상이 사라지면 손을 빼는 반응까지 보였고, 메타 퀘스트로 원격조작됐다.
데이터 수집은 네 가지로 정리됐다. VR 컨트롤러(메타 퀘스트), 에고센트릭(1인칭 시점) 안경, 장갑형 엑소스켈레톤, 카메라를 손에 다는 UMI(Universal Manipulation Interface) 방식이다. 진행자는 원격조작 번거로움이 없는 UMI를 가장 편하다고 꼽았다.
학계와 업계의 시선이 갈렸다. 학계 발표는 촉각·시뮬레이션 같은 먼 미래 문제를 다루는 반면, 업계는 당장 인간 노동을 대체할 방법을 찾는다고 진행자는 정리한다. Physical Intelligence의 pi-0.5 논문도 학회 발표 전 온라인에 이미 공개돼 있었다.
주요 숫자
49K 달러
에이로봇(A.Robot) ALICE M1 가격(약 6,800만 원)
1만 달러
에이로봇이 밝힌 중국 Galaxea AI 대비 가격 차
1시간 → 3~5시간
ALICE M1 완충 후 운용 시간(휠 사용 3시간·미사용 최대 5시간)
9년
진행자가 대학원생 때 이후 다시 학회를 찾기까지 걸린 시간
반면에 VLA는 아직 멀었습니다. 기껏대야 픽앤 플레이스 정도 되는 수준이에요.
반론 · 충돌
같은 채널 「구글 딥마인드는 임바디드 리즈닝으로 VLA를 하니스해 판단과 반사를 나눴다」이 편은 Gemini Robotics 1.5가 「시스템 원투 구조를 충실히 따르고 있다」는 인상만 남기고, VLA 전체를 「기껏해야 픽앤플레이스 정도」로 판정한다. 10개월 뒤 그 카드에서는 이 인상이 임바디드 리즈닝(판단)과 VLA(반사)로 나뉜 정식 하니스 구조로 굳는다. 다만 판정이 완전히 뒤집히지는 않는다 — 가장 어려운 과제인 비닐봉지 묶기의 공개 성공률은 44%로, 픽앤플레이스보다 훨씬 어려운 과제를 다루게 됐어도 여전히 절반에 못 미친다.
공동 진행자 JCVLA(LLM 계열)가 당장 인간 노동을 부분 대체할 것이라는 전망은 진행자 JB 개인의 인상이며, 같은 방송에서 JC는 이 결론에 동의하지 않는다고 밝힌다. 데모를 직접 겪은 두 사람의 해석조차 갈린다.
이 편 자체의 약점 — 벤치마크 없는 부스 인상정량 지표 없이 부스에서 물어본 답변과 데모 인상만으로 「생각보다 큰 데이터 없이도 잘 된다」고 판단했다고 진행자 스스로 전제를 밝힌다. 로보티즈 손 제품명, 안경형 데이터 수집 기기 모두 자막이 흐려 회사 확인 없이 정황으로 추정한 이름이다.
유튜브 자동 자막 전문을 요약한 카드입니다. 자동 인식이라 회사·모델 이름이 흔들리는 대목이 있어 정황과 공개 정보로 맞춰 적었습니다. 숫자는 진행자가 말한 것을 그대로 옮겼고 따로 검증하지 않았습니다. 투자 추천이 아닙니다. 영상 설명란에 챕터·링크가 없어 일부 고유명사(로보티즈 손 제품명, 데이터 수집 안경 기기)는 공개된 정보로 유추해 표기했습니다.