앤트로픽의 Physical Intelligence 인수설을 계기로 두 회사가 로보틱스를 다른 자리에서 접근한다는 것을 확인합니다. Physical Intelligence는 π0부터 π0.7까지 로봇 전용 모델을 직접 만들고, 앤트로픽은 로봇 전용 모델 없이 언어모델이 관절값을 직접 내거나 기존 액션모델을 도구로 부릅니다. 두 방법이 낸 수치가 정반대라는 것과, 언어의 역할을 보는 두 진영의 시각이 어디서 만나는지까지 뜯습니다.
sudoremove JB · JC2026-08-0470분YouTube
▾
7월 21일 인수설이 불거진 두 회사, Physical Intelligence와 앤트로픽이 로봇을 다른 자리에서 접근한다. Physical Intelligence는 π0부터 π0.7까지 로봇 전용 VLA(Vision-Language-Action, 시각·언어·행동 통합 모델)를 직접 만들어 왔고, 앤트로픽은 로봇 전용 모델 없이 범용 언어모델이 관절값을 직접 내거나 기존 액션모델을 도구로 부르는 식으로 실험한다. 관절값을 직접 내면 5%, 액션모델을 도구로 부르면 30~42%까지 오른다는 수치가 그 차이를 보여 준다.
핵심 포인트
인수설의 계기는 Claude Opus 5의 로봇 시연이다. 액션 전용 모델이 아닌 범용 언어모델이 관절값 14개 안팎을 직접 움직여 로봇 과제를 6분 50초 만에 마쳤다는 트윗이 돌았다.
Physical Intelligence는 π0부터 π0.7까지 로봇 전용 액션 모델을 만들어 왔다. π0.6부터는 강화학습으로 얻은 더 나은 정책의 롤아웃을 다시 사전학습 데이터로 되먹이는 데이터 플라이휠을 π0.7에서 완성했다.
직접 내느냐, 시켜서 부르느냐
같은 언어모델인데 로봇에 닿는 경로가 둘이다. 관절값을 직접 뽑으면 5%로 무너지고, 무엇을 할지만 정하고 움직임은 전용 액션모델에 맡기면 낯선 과제에서 30~42%가 나온다. 아래 두 줄이 그 전용 모델의 한계이고, 익숙한 과제와 낯선 과제 사이가 이렇게 벌어진다.
앤트로픽은 로봇 전용 모델 없이 두 가지 제어 방법을 시험했다. 다이렉트(LLM이 관절값을 직접 출력)와 폴리시 슈퍼비전(LLM이 기존 액션모델을 도구처럼 호출)이다.
다이렉트 방식은 시뮬레이터 LIBERO(로봇 조작 과제를 겨루는 시뮬레이션 벤치마크)에서 5%를 냈다. 같은 벤치마크에서 전용 액션모델은 90~95%를 낸다. 파인튜닝 없이 5%가 나온 것을 진행자들은 놀라워한다.
액션모델을 도구로 부르니 결과가 갈렸다. Ai2의 MolmoAct(로봇 조작에 특화된 액션모델)가 86%로 잘하는 익숙한 과제에서는 LLM이 개입할수록 오히려 성능이 떨어졌지만, MolmoAct가 0%인 낯선 과제에서는 30~42%까지 올랐다.
Physical Intelligence의 한 연구원은 언어의 역할을 회의하다가 생각을 바꿨다. 원래는 눈으로 보고 바로 행동하면 되지 언어가 왜 필요하냐는 입장이었는데, Claude 에이전트를 쓰며 언어를 컨텍스트를 채우는 창구로 재해석했다.
휴머노이드 폼팩터는 입사 조건으로 거부할 만큼 반대편이다. 자동차가 말보다 효율적이라 도로가 자동차에 맞춰 새로 깔린 것처럼, 로봇 구조에 맞게 주변이 바뀌는 게 맞다는 논리다.
중국 하드웨어 공급망은 미국 로봇 회사에도 걸쳐 있다. 로봇팔 제조사 프랑카는 중국 자본에 인수됐고, 테슬라 옵티머스 부품도 상당수 중국산이라는 관찰이 나온다.
주요 숫자
5% vs 90~95%
다이렉트 방식과 전용 액션모델의 LIBERO 성공률
86% → 0%
MolmoAct의 익숙한 과제와 낯선 과제 성공률
30~42%
LLM이 MolmoAct를 도구로 불러 낯선 과제에서 낸 성공률
6분 50초
Claude Opus 5가 관절값을 직접 움직여 과제를 마친 시간
랭귀지가 세상의 압축인 거죠.
반론 · 충돌
같은 채널 「Rhoda AI는 VLA를 버렸고 Sharpa는 손안 조작만 따로 구웠다」Rhoda AI는 VLA(Vision-Language-Action, 시각·언어·행동 통합 모델)로는 범용성에 못 닿는다며 아예 웹 비디오 사전학습으로 갈아탔다. 이 편의 Physical Intelligence 연구원도 언어의 필요성을 한때 회의했지만 방향은 반대다 — VLA를 버리는 대신 언어를 컨텍스트를 채우는 창구로 재해석해 VLA 안에 남겼다. 같은 회의에서 출발해 반대 결론에 이른 셈이다.
같은 채널 「Action Data Scaling 문제」기초편은 데이터를 모으는 경로 다섯 가운데 어느 것도 스케일 문제를 푼다고 입증되지 않았다고 닫는다. 이 편에서 앤트로픽이 제시한 「LLM 오케스트레이션으로 새 학습 데이터를 만든다」는 것도 블로그 수준의 제안일 뿐, 실제 로봇에서 검증된 스케일링 곡선은 아직 없다.
이 편 자체의 약점LIBERO는 시뮬레이터 벤치마크이고 이미 오버피팅에 가깝게 풀린 과제라고 진행자들 스스로 짚는다. 앤트로픽 자체 블로그 발표로 동료 심사를 거치지 않았고, 맨 처음 보여준 트윗 데모도 체리픽일 가능성을 인정한다.
유튜브 자동 자막 전문을 요약한 카드입니다. 자동 인식이라 회사·모델 이름이 흔들리는 대목이 있어 영상 설명란과 링크로 맞춰 적었습니다. 숫자는 진행자가 말한 것을 그대로 옮겼고 따로 검증하지 않았습니다. 투자 추천이 아닙니다.