「Physical AI를 좁게 정의해야 하는 이유」가 경계선으로 잡은 RT-2(2023년 7월, 시각·언어·행동을 한 모델에 넣은 첫 사례)의 3년 뒤 모습이 이 편입니다. 지금 구글 딥마인드의 실제 배포판은 단일 VLA가 아니라, 상황을 판단하는 임바디드 리즈닝이 행동을 실행하는 VLA를 자연어로 부리는 계층 구조입니다. 무엇이 판단이고 무엇이 반사인지, 어느 데이터를 프리트레이닝에서 일부러 빼는지를 뜯습니다.
sudoremove JB · JC2026-08-1252분YouTube
▾
구글 딥마인드가 Gemini Robotics 2.0을 공개했다. 임바디드 리즈닝(Embodied Reasoning, ER — 시각·언어를 받아 상황을 판단하는 상위 모델)이 VLA(Vision-Language-Action, 시각·언어·행동 통합 모델)를 하니스(harness, 상위 모델이 하위 모델에게 자연어 명령을 내리고 종료 조건까지 감시하는 지휘 구조)하는 3종 모델 체계를 처음 한 자리에서 보여줬다. 베이스 모델은 Gemini Flash 계열을 물려받아 버전마다 바뀌었고, 가장 어려운 과제였던 비닐봉지 묶기는 성공률 44%를 그대로 공개했다.
핵심 포인트
철학은 뇌는 팔고 몸은 빌리는 것이다. 하드웨어는 만들지 않고 임바디드 리즈닝을 API로 공개해 누구나 붙여 쓰게 하며, 지금 돈은 계기판 눈금 읽기 같은 인스펙션(검사) 과제에서 먼저 번다.
모델은 임바디드 리즈닝·VLA·온디바이스 3종이다. 셋 다 Gemini Flash 계열에서 파인튜닝됐고, 온디바이스는 협업 중인 로봇 회사(트러스티드 파트너)에게만 준다. VLA가 임바디드 리즈닝의 디스틸레이션(더 큰 모델의 능력을 작은 모델로 옮겨 배우는 방식)이라는 것은 1.0 테크리포트 이후로는 회사가 명확히 밝히지 않아 추정으로 남는다.
누가 누구에게 시키는가
세 층이 서로 다른 주기로 돈다. 위는 1초에 한 번 상황을 보고 말로 시키고, 아래는 1초에 쉰 번 관절을 움직인다. 위층이 명령만 내리고 마는 것이 아니라 끝났는지까지 지켜본다는 것이 이 구조의 이름이 된 자리다.
버전은 베이스 모델이 바뀔 때 뛴다. 1.0(2025-03-12, Gemini 2.0 Flash) → ER 1.5(2025-09-25, 2.5 Flash) → ER 1.6(2026-04-14, 3.0 Flash) → 2.0(3.5 Flash) 순으로, 숫자가 오를 때마다 밑에 깔린 재미나이 자체가 바뀌었다.
판단과 반사가 계층으로 갈린다. 임바디드 리즈닝은 1Hz로 VLA에 명령을 내리고, VLA는 속도·자세·손가락 관절 위치를 출력한다. 그 출력을 실제로 몸에 반영해 넘어지지 않게 하는 것은 엣지에 내장된 강화학습 기반 홀바디(전신) 컨트롤 정책이다.
프리트레이닝에 액션 데이터는 일부러 뺀다. 로보틱스팀은 재미나이 플래시의 프리트레이닝에 공간 이해 쪽으로 직접 기여하면서도, 관절 움직임 같은 모션 데이터는 넣으면 오히려 해가 될 수 있다고 밝힌다.
Sharpa 손을 쓰고도 촉각은 거의 안 쓴 것으로 보인다. 비닐봉지 묶기에 쓰인 Sharpa 손은 한 짝 5만 달러(약 7,500만 원)에 촉각 센서가 달려 있지만, 시연에서는 촉각을 안 쓴 것 같다고 진행자들은 짚는다.
정량 수치는 발표 자리를 옮길수록 지워졌다. 서버 5Hz·액션 청크 50Hz(초당 50개)라는 수치가 실리콘밸리 슬라이드에는 있었지만 도쿄에서 줄고 최근 휴먼노이드 서밋에서는 아예 빠졌다.
외국산 휴머노이드 규제에서 구글 딥마인드만 비켜난다. 미국 FCC(연방통신위원회) 규제는 부품 원가 65% 이상이 미국산이어야 통과인데, 하드웨어를 안 파는 구글 딥마인드는 이 기준과 무관하다. 다만 이를 "구글 호재"로 부른 진행자 주장은 방송 중 스스로 정정됐다.
주요 숫자
44%
가장 어려운 과제(비닐봉지 묶기)의 공개 성공률
1Hz / 5Hz / 50Hz
임바디드 리즈닝 명령 주기 / 서버 주기 / 액션 청크 주기
5만 달러
Sharpa 손 한 짝 가격(약 7,500만 원)
65% / 35%
FCC 규제의 미국산·중국산 부품 원가 허용 비율
여기 로보틱스도 하네스 엔지니어링을 하고 있군요.
반론 · 충돌
같은 대시보드 「Physical AI를 좁게 정의해야 하는 이유」그 카드는 RT-2(2023년 7월)를 단일 end-to-end VLA가 규칙 기반 로보틱스를 넘어선 경계선으로 잡는다. 3년 뒤 구글 딥마인드의 실제 배포판은 그 정의와 어긋난다 — 임바디드 리즈닝이 VLA를 자연어로 부리고, VLA 출력을 다시 엣지의 홀바디 컨트롤 정책이 반사로 받아 처리하는 계층 구조다. "하나의 모델이 인지·계획·제어를 다 한다"는 원래 정의의 핵심 문구가 구글 딥마인드의 가장 앞선 사례에는 그대로 들어맞지 않는다.
같은 채널 「Rhoda AI는 VLA를 버렸고 Sharpa는 손안 조작만 따로 구웠다」그 편은 Sharpa의 촉각 센서가 힘·촉각을 잔차로 주입하는 핵심 부품이라고 소개했다. 이번 편에서 구글 딥마인드는 같은 Sharpa 손을 비닐봉지 묶기에 쓰면서도 촉각 입력을 거의 안 쓴 것으로 보인다고 진행자들이 직접 짚는다. 같은 하드웨어가 회사에 따라 절반의 기능만 쓰이는 셈이다.
이 편 자체의 약점 — 방송 중 뒤집힌 주장FCC 규제가 "구글 딥마인드에 호재"라는 주장은 처음 나왔을 때부터 흔들렸다. 하드웨어까지 파는 경쟁사(Figure AI·1X Technologies 등)에게 악재인 것과 구글 딥마인드의 매출이 느는 것은 다른 문제라는 지적이 나오자, 진행자 스스로 "실수 같습니다"라며 물러섰다. 미국 휴머노이드 회사가 부품 원가 65% 기준을 못 맞출 것이라는 판단도 "뇌피셜"이라고 스스로 표시한 추정일 뿐이다.
유튜브 자동 자막 전문을 요약한 카드입니다. 자동 인식이라 회사·모델 이름이 흔들리는 대목이 있어 영상 설명란과 공식 발표로 맞춰 적었습니다. 숫자는 진행자가 말한 것을 그대로 옮겼고 따로 검증하지 않았습니다. 투자 추천이 아닙니다. 영어와 한국어가 섞여 뭉갠 자막 구간은 그대로 인용하지 않고 뜻으로 풀어 적었습니다.