게임 클립 플랫폼 Medal에서 나온 General Intuition이 왜 자사 월드모델 MIRA를 「그냥 훈련장」이라 부르는지, 그 근거와 이 프레이밍이 영상 품질 자체를 파는 Decart와 어디서 갈리는지 알게 된다. 회사가 현장에서 직접 답한 수치와 끝내 밝히지 않은 수치를 갈라 정리했다.
sudoremove JB · JC2026-07-2218분YouTube
▾
General Intuition(게임 클립 플랫폼 Medal에서 스핀오프한 회사)은 월드모델(world model, 환경의 미래 상태를 예측해 생성하는 모델) MIRA를 공개하면서 "이건 단순히 훈련장이다, 본질은 에이전트다"라고 직접 밝혔다. ICML(International Conference on Machine Learning, 머신러닝 학회) 현장에서 5B 파라미터 모델이 B200 GPU 한 장으로 로켓 리그 4인 시점을 실시간 생성하는 데모를 진행자들이 직접 플레이했다.
핵심 포인트
OpenAI의 5억 달러 인수 제안을 거절했다. 대신 게임 데이터를 들고 나와 창업했고, 지금 밸류에이션은 23억 달러로 거절한 제안액의 다섯 배를 넘겼다.
MIRA는 한 모델이 4인 시점을 동시에 생성한다. 기존 월드모델이 1인칭 시점 하나만 만드는 것과 달리, 로켓 리그 네 플레이어의 프레임을 한 모델이 함께 만들고 서로의 움직임이 각 뷰에서 일관되게 보인다.
무엇을 목표로 두느냐
같은 월드모델을 두고 목표가 갈린다. 사람 눈에 그럴듯한 영상을 목표로 두면 해상도와 길이를 올리게 되고, 에이전트가 배우는 마당으로 두면 초당 몇 번 반응하느냐가 먼저다. MIRA 가 해상도 대신 20Hz 를 택한 이유가 그것이다.
스펙은 5B 파라미터, B200 GPU 한 장, 20Hz, 컨텍스트 윈도우 4초다. 회사는 별도의 인퍼런스 최적화는 하지 않았다고 밝혔고, 학습 데이터 양은 "유튜브 스케일"이라고만 답했다.
회사가 밝힌 진짜 목표는 월드모델이 아니라 에이전트다. ICML 부스에서 아예 "본질은 에이전트"라고 선언했고, 게임 데이터로 학습한 뒤 현실 세계를 그다음 게임으로 취급하는 프레이밍을 쓴다.
지목한 에이전트는 매니퓰레이션(조작)이 아니라 내비게이션이다. "TV를 꺼"처럼 의미론적 추정이 들어간 엔드투엔드(end-to-end, 중간 단계를 나누지 않고 입력에서 출력까지 한 번에 처리하는 방식) 내비게이션을 지향한다고 답했다.
Decart는 반대로 영상 자체를 실시간으로 판다. 밸류에이션 40억 달러, API 가격은 초당 0.02달러이며, 진행자들은 홍콩 야간 운전 데모에서 충돌 직후 장면이 깨지는 것을 직접 확인했다.
두 회사 모두 짧은 컨텍스트 윈도우의 한계를 공유한다. MIRA는 4초, Decart 데모는 3~4초라 충돌이나 지형 파괴처럼 오래 기억해야 하는 순간에 장면이 이상해진다.
Decart CEO는 23세에 박사 학위를 받았다. 테크니언(이스라엘 공과대학)을 군복무 포함 4년 만에 졸업했고, Andrej Karpathy가 엔젤 투자자로 참여했다.
주요 숫자
5억→23억 달러
General Intuition이 거절한 OpenAI 제안액과 현재 밸류에이션
5B·B200 1장·20Hz·4초
MIRA의 파라미터·GPU·출력 속도·컨텍스트 윈도우
40억 달러
Decart 밸류에이션
초당 0.02달러
Decart 실시간 월드모델 API 가격
저 월드 모델을 학습 장으로 쓰려고 하는 거죠. 이거는 단순히 훈련장이다.
반론 · 충돌
같은 채널 「Rhoda AI는 VLA를 버렸고 Sharpa는 손안 조작만 따로 구웠다」Rhoda AI는 비디오 예측으로 행동을 역산한다 — 영상을 정확하게 예측해내면 그 안에서 행동을 뽑아낼 수 있다는 쪽에 걸었다. General Intuition은 정반대로 말한다. MIRA가 아무리 정교하게 게임 영상을 만들어도 그 자체는 목적이 아니고, 그걸로 따로 훈련시킬 에이전트(내비게이션)가 본질이라고 선을 긋는다. 영상 품질이 곧 행동 품질이라는 전제 자체가 두 편에서 갈린다.
같은 채널 「Dyna-2는 로봇 데이터 없이 사람 영상 170년으로 제로샷 전이를 보였다」Dyna-2의 WAM(World Action Model)은 영상을 만드는 Video DiT와 행동을 만드는 Action DiT가 붙어 있어, 영상 생성 백본 자체가 행동을 뽑는 통로다. General Intuition은 이 구조와 달리 월드모델과 에이전트를 아예 분리한다 — MIRA는 게임을 구동하는 시뮬레이터일 뿐이고, 그 위에서 내비게이션 에이전트를 별도로 훈련한다고 밝혔다. 영상 생성과 행동 생성을 한 백본에 묶을지 떼어 놓을지에서 두 편의 접근이 갈린다.
이 편 자체의 약점ICML 부스에서 진행자가 직접 물어본 답을 그대로 옮긴 것으로, 동료 심사 논문이나 벤치마크 수치는 없다. 학습 데이터 양은 "유튜브 스케일"이라는 말 이상 공개되지 않았고, 데모는 로켓 리그 한 게임에 컨텍스트 4초 수준에 그친다. 화면 시계 불일치, Decart의 충돌 후 장면 붕괴처럼 두 회사 모두 완성도보다 초기 데모에 가깝다.
유튜브 자동 자막 전문을 요약한 카드입니다. 자동 인식이라 회사·모델 이름이 흔들리는 대목이 있어 영상 설명란과 논문으로 맞춰 적었습니다. 숫자는 진행자가 말한 것을 그대로 옮겼고 따로 검증하지 않았습니다. 투자 추천이 아닙니다. Decart CEO 신상(학력·나이)은 영상에서 직접 밝힌 부분만 옮겼습니다.