← 수도리무브 — 로보틱스 · 피지컬 AI
휴먼 데이터 스케일링

Dyna-2는 로봇 데이터 없이 사람 영상 170년으로 제로샷 전이를 보였다

DYNA Robotics가 사람 1인칭 영상 100만 시간(사람으로 환산하면 170년)만으로 사전학습해 로봇 데이터를 한 번도 보지 않고도 로봇 태스크를 제로샷으로 통과시켰다는 스케일링 로우를 뜯는다. 로봇 액션만 학습하면 오히려 나빠지고 사람 영상을 함께 학습해야 좋아지는 이유까지 짚고, 같은 대시보드의 Rhoda AI 「웹 비디오 300년」과 이 「사람 영상 170년」이 실은 다른 것을 세고 있다는 것도 확인한다.

sudoremove JB · JC2026-08-1969분YouTube

DYNA Robotics의 새 로봇 모델 Dyna-2는 WAM(World Action Model, 미래 영상을 상상하며 행동을 뽑는 로봇 모델)이다. 사람 1인칭 영상 100만 시간(사람으로 환산하면 170년)만 사전학습하고 로봇 데이터는 한 번도 학습하지 않은 채 로봇 태스크를 제로샷으로 통과시켰다는 스케일링 법칙(scaling law, 데이터를 늘릴 때 성능이 어떻게 좋아지는지의 규칙성)을 내세운다. 진행자들은 이 「170년」이 같은 채널이 다룬 Rhoda AI의 「웹 비디오 300년」과 다른 것을 센 숫자라는 점부터 짚는다.

핵심 포인트

  • 사람 손목을 6DOF(6 Degrees of Freedom, XYZ 위치와 요·피치·롤 회전을 더한 여섯 자유도) 그리퍼로 좌표화한다. 1인칭 영상에서 손목 위치와 엄지·검지 사이 거리를 뽑아 좌표와 쥠 여부로 바꾼다. 머리 카메라가 흔들려도 손목 좌표가 유지되도록 중력 방향까지 따로 보정한다.
  • 로봇 데이터를 한 번도 안 보고도 제로샷이 됐다. 사람 데이터 검증 → 로봇 제로샷 평가 → 로봇 파인튜닝 순으로 검증했고, 로봇 학습 없이도 제로샷 오프라인 평가가 됐다는 것이 이 편의 핵심 주장이다.

300년과 170년은 같은 자가 아니다

인터넷에 이미 쌓인 영상벤더가 카메라로 찍은 영상Rhoda — 웹 비디오 300년로봇 손이 나오지 않는다관절 값이 붙어 있지 않다Dyna-2 — 사람 영상 170년손목을 6DOF 로 좌표화하려고쓸 데를 정하고 찍었다둘 다 「몇 년치」로 말한다단위가 같다고 견줄 수 있는 것은 아니다
두 회사 다 「몇 년치」로 데이터 규모를 말하는데 세는 대상이 다르다. Rhoda 쪽은 인터넷에 이미 있던 영상이라 로봇 손이 나오지 않고, Dyna-2 쪽은 손목 좌표를 뽑으려고 새로 찍은 영상이다. 단위가 같다고 견줄 수 있는 것은 아니다.
  • 파인튜닝 성공률이 20%에서 53%로 올랐다. 사람 데이터 스케일을 늘릴수록 실제 로봇 파인튜닝 성공률이 20%, 28%, 45%, 53%로 올랐다. 진행자들은 53%가 아직 배포 가능한 수준은 아니라고 선을 긋는다.
  • 액션만 쓰면 오히려 나빠진다. 로봇 데이터의 액션만 학습하면 데이터가 늘어도 성능이 떨어지는 구간이 있었고, 로봇 비디오까지 예측(조인트)해도 별 차이가 없었다. 사람 영상을 코트레이닝해야 가장 좋았다.
  • 170년과 300년은 같은 자가 아니다. Dyna-2의 100만 시간은 과제를 하는 사람 1인칭 영상을 벤더가 직접 촬영해 손목 좌표까지 뽑아낸 데이터다. 같은 채널이 다룬 Rhoda AI의 웹 비디오 300년치는 로봇 손이 나오지 않는 일반 인터넷 영상이다. 진행자들도 「170년」의 다음 자릿수(1700년)를 "1700명이 1년 동안 일하는 데이터"라며 스스로 깎아내린다.
  • 인퍼런스 지연 시간은 공개하지 않았다. 원스텝 디스틸레이션(디노이징을 여러 단계 거치지 않고 한 번에 영상을 만드는 방식)으로 영상 생성을 90~300ms까지 줄였다고 주장하지만, Dyna-2 자체의 전체 지연 시간(액션이 나오기까지)은 공개하지 않았다.
  • DYNA-1(VLA)을 이긴 수치도 초기 버전 기준이다. 100만 시간 코퍼스가 모이기 전 초기 WAM이 DYNA-1 VLA(Vision-Language-Action, 시각·언어·행동 통합 모델)를 1.5배, 코트레이닝 버전이 1.12배 앞섰다는 수치로, 완전히 동일한 조건 비교는 아니다.
  • 실제 고객 현장에서는 품질·속도·신뢰성으로 갈렸다. 사내에서는 DYNA-1 VLA도 태스크 완료율이 높았지만, 고객이 요구하는 품질·처리 속도·신뢰성에서는 Dyna-2(WAM)가 나았다고 회사는 밝힌다.

주요 숫자

100만 시간 (170년)
사전학습한 사람 1인칭 영상 분량
20%→53%
데이터가 늘수록 오른 로봇 파인튜닝 성공률
90~300ms
원스텝 디스틸레이션 적용 시 영상 생성 지연(전체 지연 시간은 비공개)
1.5배 / 1.12배
초기 WAM이 DYNA-1 VLA를 앞선 배율(100만 시간 이전 버전)

1700년 별거 아니잖아요. 1700명이 1년 동안 일하는 데이터잖아요.

반론 · 충돌

  • 같은 채널 「Rhoda AI는 VLA를 버렸고 Sharpa는 손안 조작만 따로 구웠다」2026년 3월 편의 Rhoda AI는 웹 비디오 300년치로 사전학습하고 로봇 데이터를 11시간만 얹었다고 주장했다. Dyna-2의 170년은 그 300년과 같은 자로 잴 수 있는 숫자가 아니다. Rhoda의 300년은 로봇 손이 나오지 않는 일반 웹 영상을 긁은 것이고, Dyna-2의 170년(100만 시간)은 사람 1인칭 영상에서 손목을 6DOF로 좌표화하려고 벤더가 직접 촬영한 과제 수행 영상이다. 하나는 인터넷에 이미 있던 것이고 다른 하나는 로봇 손동작에 쓰려고 새로 모은 것이다. 「년」이라는 단위로 맞세우면 둘 다 커 보이지만 세는 대상이 다르다.
  • π0 · Physical Intelligence 진영Dyna-2는 사람 데이터를 스케일업하면 로봇으로 전이된다는 쪽에 걸었지만, 파이(π0)는 반대로 로봇 텔레오퍼레이션 데이터를 효율적으로 모으는 쪽이 더 나을 수 있다는 가설로 움직인다. 진행자들도 사람 데이터가 중요하다는 전제 자체가 당연하지 않다고 이 편 안에서 스스로 짚는다.
  • 이 편 자체의 약점동료 심사를 거친 논문이 아니라 회사가 낸 테크니컬 리포트다. Dyna-2 자체의 인퍼런스 지연 시간은 공개하지 않았고, 파인튜닝 레시피(액션 온리·조인트·코트레이닝) 비교가 컴퓨팅 자원을 동일하게 고정한 실험인지도 확인되지 않는다. 실제 로봇에서 확인된 성공률은 특정 태스크 하나의 53%뿐이다.
유튜브 자동 자막 전문을 요약한 카드입니다. 자동 인식이라 회사·모델 이름이 흔들리는 대목이 있어 영상 설명란과 논문으로 맞춰 적었습니다. 숫자는 진행자가 말한 것을 그대로 옮겼고 따로 검증하지 않았습니다. 투자 추천이 아닙니다. 「170년」·「300년」 같은 환산 단위는 진행자의 표현을 그대로 실었을 뿐 두 영상의 데이터가 같은 성격이라는 뜻이 아닙니다.