← 수도리무브 — 로보틱스 · 피지컬 AI
2026년 예측

신년 잡담에서 VLA는 2028년에나 산업 표준이 된다고 봤다

진행자 둘이 신년에 즉흥으로 던진 열네 개 예측을 무엇을·누가·언제까지라고 했는지로 정리한다. Transformer 대체 구조·RAG 소멸·온디바이스 파인튜닝·추론 시장의 GPU 대 비GPU처럼 정면으로 갈린 항목과, 모라벡의 역설처럼 강하게 합의한 항목을 구분한다. 지금(2026년 8월) 시점에서 이미 판정 재료가 나온 항목은 VLA(Vision-Language-Action, 시각·언어·행동 통합 모델)의 산업 표준화 예측이다.

sudoremove JB · JC2026-01-1024분YouTube

진행자 둘이 신년 잡담으로 열네 개 예측을 즉흥 찬반으로 매긴다. 모라벡의 역설(Moravec's Paradox, 인간에게 쉬운 지각·운동 과제가 AI에게는 어렵다는 관찰) 해결과 Mamba(어텐션 없이 시퀀스를 처리하는 대안 아키텍처)의 장악에는 둘 다 부정으로 합의했지만, Transformer 대체 구조·RAG 소멸·VLA 산업표준화·추론 칩 시장은 정면으로 갈렸다.

핵심 포인트

  • 모라벡의 역설은 1년 안에는 절대 안 된다. 로코 챌린지(원격조종 로봇 손 과제)를 직접 해 본 진행자가 손 텔레오퍼레이션과 촉각 시뮬레이션의 난도를 근거로 들었고, 둘 다 동의했다.
  • VLA 엔드투엔드의 산업표준화는 2028년(3년 뒤) 가능할 듯이라 봤다. 한 진행자만 시한을 냈고, 다른 진행자는 「산업 표준」이라는 말 자체가 애매하며 태스크마다 다를 것이라 봤다.

쉽게 합의한 것과 정면으로 갈린 것

2026년 1월예측 열넷을 매겼다2026년 8월지금2028년VLA 산업표준 시한둘 다 아니라고 본 것은 이미 갈렸다 — 모라벡의 역설은 안 풀렸다정면으로 갈린 것은 시한이 와야 갈린다판정은 우리가 하지 않는다. 무엇을 봐야 갈리는지만 적어 둔다
둘 다 아니라고 본 쪽은 합의가 쉬웠다. 값나가는 쪽은 갈린 쪽인데, 거기에 VLA 가 언제 산업 표준이 되느냐가 들어 있다. 2028년이라는 시한을 적어 뒀으니 나중에 갈린다.
  • Mamba 계열의 장악과 스케일링 법칙(scaling law, 데이터·모델·연산을 늘릴 때 성능이 어떻게 좋아지는지의 규칙성) 임계 확인에는 둘 다 「안 될 것」이라 합의했다.
  • Transformer를 능가하는 새 구조가 SOTA를 차지하느냐는 갈렸다. MoE(Mixture of Experts, 여러 전문가 서브네트워크 중 일부만 골라 쓰는 구조)가 트랜스포머의 변형인지 별개 백본인지 정의가 갈려 합의 없이 끝났다.
  • 무한 컨텍스트 윈도우로 RAG(Retrieval-Augmented Generation, 외부 데이터베이스를 검색해 답변에 넣는 방식)가 사라지느냐도 갈렸다. 컨티뉴얼 러닝(continual learning, 모델이 서비스 중에도 계속 학습해 나가는 방식)과 결합한 메모리 모듈 등장을 점친 쪽과, 코드베이스·영상처럼 컨텍스트가 늘 모자란 대상이 남는다고 본 쪽으로 나뉘었다.
  • 추론 시장에서 Groq·세레브라스 같은 비GPU 아키텍처(NPU·LPU)가 이기느냐는 정면 대립이었다. 한쪽은 엔비디아가 서버향 LM 서빙 가성비에서 거의 독식한다고 봤고, 다른 쪽은 스마트폰 CNN이 이미 NPU로 넘어간 선례를 들어 비GPU가 무조건 이긴다고 봤다.
  • 소프트웨어 엔지니어의 코드 구현·디버깅 90% 이상을 AI가 전담하는 상황은 이미 벌어졌다는 데 동의했다. 설계 리뷰까지 코딩 에이전트에게 맡긴 개인 사례가 근거였다.
  • 코딩 에이전트가 VLA 대신 로봇 제어 코드를 직접 짜는 대안도 논의됐지만 스스로 기각했다. 빨래 개기처럼 물체가 예측과 다르게 움직이는 폐쇄루프 태스크에는 이 방식이 안 통한다는 이유였다.

주요 숫자

2028년
VLA 엔드투엔드 산업표준화 예측 시한
5년
반려동물(개·고양이) 번역기 예측 시한
90% 이상
AI가 전담할 것으로 본 코드 구현·디버깅 비중
1년 안
모라벡의 역설 해결이 안 된다고 합의한 시한

1년 안에는 안 되고 28년 안에는 가능할 듯.

반론 · 충돌

  • 두 달 뒤 「GTC 열흘 전 엔비디아가 흘린 논문 다섯 편」 편VLA가 산업 표준이 되려면 하나의 방식으로 수렴해야 하는데, 엔비디아가 GTC 2026 열흘 전 낸 로봇 논문 다섯 편 자체가 이미 월드모델(DreamDojo)·VLA(SONIC·EgoScale)·비디오 액션모델(DreamZero·Cosmos Policy) 셋으로 갈렸다. 2028년 시한을 넘길 필요도 없이, 예측이 나온 지 두 달 만에 같은 회사 안에서도 방식이 셋으로 늘었다는 것을 그 카드가 보여준다.
  • 일곱 달 뒤 「Dyna-2는 로봇 데이터 없이 사람 영상 170년으로 제로샷 전이를 보였다」 편VLA였던 DYNA-1을 만든 회사가 자체적으로 VLA 계열을 완전히 버리고 WAM(World Action Model)으로 갈아탄 사례다. VLA가 엔드투엔드 산업 표준으로 수렴하는 쪽과, 개별 회사가 VLA를 이탈하는 쪽 가운데 어느 흐름이 더 굵은지는 이 카드에서 확인해야 한다.
  • 이 편 자체의 성격진행자 스스로 「가볍게 보세요」라 못 박은 신년 잡담이다. 열네 항목 중 절반 가까이에서 두 진행자 의견이 정면으로 갈렸고, Transformer 대체 구조처럼 정의 자체가 안 갈려 판정을 포기한 항목도 있다. 시한을 구체적으로 낸 항목도 한 명의 즉흥 발언일 뿐, 두 사람이 함께 합의한 시한은 아니다.
유튜브 자동 자막 전문을 요약한 카드입니다. 자동 인식이라 회사·모델 이름이 흔들리는 대목이 있어 영상 설명란과 링크로 맞춰 적었습니다. 숫자는 진행자가 말한 것을 그대로 옮겼고 따로 검증하지 않았습니다. 이 편은 진행자 스스로 「가볍게 보세요」라 밝힌 즉흥 예측이라 확신도가 낮고, 어느 발언이 어느 진행자(JB·JC)의 것인지는 자막만으로 구분되지 않아 「한 진행자」로 통칭했습니다. 투자 추천이 아닙니다.