← Epoch AI — AI 컴퓨트의 돈과 물리 제약
직무 분류 · 자동화 등급 · 예측 방법

벤치마크가 올라도 연구의 어느 부분이 덮였는지는 모른다

AI 타임라인 예측의 주력은 그래프에 선을 긋고 늘이는 일인데, 늘이는 대상이 죄다 재기 쉬운 것이다. 그 선들이 무엇을 못 재는지, 그것을 재려면 무엇이 먼저 있어야 하는지, 그리고 그 첫 판이 어떻게 생겼는지를 본다.

Epoch AI Anson Ho · Jean-Stanislas Denain · Joe Kwon2026-06-17Gradient Updatesepoch.ai

실효 컴퓨트와 과제 길이는 대리지표다. 정작 알고 싶은 것은 AI가 AI 연구를 얼마나 대신하느냐인데, 그걸 재려면 연구가 무슨 과제들로 이루어져 있는지부터 적혀 있어야 한다. 필자들이 6개 범주 60여 과제로 쪼갠 첫 판을 냈다.

핵심 포인트

  • 지금 늘이는 선은 둘이다. 하나는 투입이다 — 실효 컴퓨트를 5년 뒤까지 늘여 AI 연구가 자동화되는 지점을 잡는다. 다른 하나는 과제 길이다 — 숙련된 사람이 얼마나 걸리는 일까지 AI가 해내는지를 재고 늘인다.

지금 늘이는 선 둘은 알고 싶은 것을 비껴간다

AI 타임라인 예측이 실제로 늘이는 선과, 그 선이 못 재는 것투입을 늘인다실효 컴퓨트를 5년 뒤까지 늘여 AI 연구가자동화되는 지점을 잡는다과제 길이를 늘인다숙련된 사람이 얼마나 걸리는 일까지 AI가해내는지를 재고 늘인다얼마면 되는지는 감으로 정한다세계 최고 연구자와 맞먹는 컴퓨트가얼마인지 대는 근거가 없다연구의 복잡성이 빠진다작은 GPT-2 파인튜닝과, 성공 기준도 없이100만 줄을 다루며 프로젝트 다섯을 굴리는일은 다른 일이다정작 알고 싶은 것AI가 AI 연구를 얼마나 대신하나재기 쉬운 것만 늘이면 벤치마크 점수가 올라도 그 향상이 일의 어느 부분을 덮는지 알 수 없다
각 방법이 무엇을 재고 무엇을 못 재는지를 구조로 세웠다. 아래 두 그림이 그 두 선의 실물이다.

투입을 늘인 선 — 실효 컴퓨트

「Situational Awareness」가 늘인 선 — 세로 자는 로그다실효 컴퓨트 (2023년 GPT-4 = 1)10⁻⁶10⁻⁴10⁻²10⁰10²10⁴10⁶201820202022202420262028GPT-4 · 똑똑한 고등학생GPT-3 · 초등학생GPT-2 · 미취학 아동자동화된AI 연구자·엔지니어?2023년까지는 실측이다거기서부터 5년을 늘였다실선은 2023년까지 실측, 점선은 거기서 늘인 5년, 회색 면은 2028년 폭이10⁴배에서 10⁷배 사이라는 뜻이다. 얼마의 컴퓨트가 세계 최고 연구자와맞먹는지를 대는 근거는 이 그림 어디에도 없다
「Situational Awareness」가 그린 외삽이다. GPT-4를 1로 놓으면 2018년이 10⁻⁷ 언저리이고, 2023년까지가 실측이며 거기서 5년을 늘여 2028년에 약 10⁶에 닿는다. 회색 면이 그때의 불확실 구간인데 10⁴에서 10⁷까지 세 자릿수 폭이다. 얼마의 컴퓨트가 세계 최고 연구자와 맞먹는지를 대는 근거는 이 그림 어디에도 없다. 값은 원문 도해(CC-BY)의 축 눈금을 재서 읽었다.
  • 둘 다 못 재는 것이 있다. 세계 최고 연구자와 맞먹는 컴퓨트가 얼마인지는 감으로 정할 수밖에 없고, 과제 길이 벤치마크는 연구의 복잡성을 놓친다. 작은 GPT-2를 파인튜닝하는 것과 성공 기준도 없이 100만 줄을 다루며 프로젝트 다섯을 굴리는 것은 다른 일이다.

과제 길이를 늘인 선 — 초인 코더는 언제 오나

초인 코더가 언제 오나 — AI 2027 이 시간지평을 늘여 뽑은 분포확률밀도0.000.050.100.150.20202520272029203120332035니콜라엘라이엘라이 · AI 2027 저자10%2025년 10월50%2027년 8월90%2039년 8월니콜라10%2025년 10월50%2027년 4월90%2033년 12월점은 50% 자리다두 예보자가 「AI가 초인 코더가 되는 해」에 매긴 확률이다. 가운데값은 2027년으로거의 같은데 90% 자리가 2033년과 2039년으로 여섯 해 벌어진다 — 이 폭이벤치마크가 연구의 복잡성을 못 담는 데서 온다는 것이 이 글의 문제 제기다
AI 2027이 METR 시간지평을 늘여 뽑은 확률분포 둘이다. 두 예보자의 가운데값은 2027년으로 거의 같은데 90% 자리가 2033년과 2039년으로 여섯 해 벌어진다. 이 폭이 벤치마크가 연구의 복잡성을 못 담는 데서 온다는 것이 이 글의 문제 제기다. 분위수는 그림에 인쇄된 값이고 곡선은 축 눈금을 재서 읽었다.
  • 그래서 가로등 밑에서 찾게 된다. 재기 쉬운 것만 늘이면 벤치마크 점수가 올라도 그 향상이 일의 어느 부분을 덮고 어느 부분은 안 건드리는지 알 수 없다.

같은 일을 15개로 쪼개느냐 60개로 쪼개느냐

같은 일을 몇 개의 과제로 쪼개 놓았나AI R&D 전용 목록60개 넘는 과제 · 6개 범주O*NET 「컴퓨터·정보 연구 과학자」15개 과제0204060적혀 있는 과제 수O*NET은 미국 직업 약 1,000개를 담은 표준 데이터셋인데, 이 직업의 첫 과제가「컴퓨터 하드웨어와 소프트웨어를 수반하는 해법을 만들기 위해 문제를 분석한다」다AI 엔지니어가 하는 거의 모든 일이 여기 들어가고, 이것이 O*NET에서 가장 잘게 쪼갠 서술이다
O*NET은 미국 경제 전체를 담으려고 LLM 이전에 설계됐다. 범위를 좁히는 대신 알갱이를 잘게 하자는 것이 이 제안이다. 값은 Epoch AI 원문을 따랐다.

O*NET이 적어 둔 과제 열다섯

O*NET 「컴퓨터·정보 연구 과학자」에 적혀 있는 과제 15개1컴퓨터 하드웨어와 소프트웨어를 수반하는 해법을 만들기 위해 문제를 분석한다2이론적 전문성과 혁신을 적용해 새 기술을 만들거나 적용한다 — 이를테면 컴퓨터를 새용도에 쓰도록 원리를 고쳐 쓴다3업무 우선순위와 목표에 맞게 과제를 배정하거나 일정을 잡는다4관리자·벤더 등과 만나 협조를 구하고 문제를 푼다5컴퓨터와 그 위에서 도는 소프트웨어를 설계한다6사업·과학·공학 등 기술 문제를 논리적으로 분석하고, 컴퓨터가 풀 수 있도록 수학 모형으로세운다7프로젝트 계획과 제안을 평가해 실현 가능성을 따진다8가상현실·인간-컴퓨터 상호작용·로보틱스 같은 다학제 프로젝트에 참여한다9사용자·경영진·벤더·기술자와 상의해 컴퓨팅 수요와 시스템 요구사항을 정한다10조직의 목표·정책·절차를 만들고 해석한다11성과 기준을 만들고, 정해 둔 기준에 비추어 일을 평가한다12네트워크 하드웨어와 소프트웨어를 유지하고, 네트워크 보안 조치를 지휘하며, 사용자가 쓸수 있게 네트워크를 감시한다13부서의 일상 운영을 지휘하고 다른 부서와 프로젝트 활동을 조율한다14인력 배치 결정에 참여하고 부하 직원 교육을 지휘한다15운영 예산을 승인·편성·감시·조정한다첫 줄이 이 데이터셋에서 가장 잘게 쪼갠 서술이다 — AI 엔지니어가 하는 거의 모든 일이 여기 든다O*NET 은 미국 경제의 직업 약 1,000개를 담은 표준 데이터셋인데, 알갱이가 이만큼 굵다
「컴퓨터·정보 연구 과학자」 직업에 적힌 과제 전부다. 첫 줄이 「컴퓨터 하드웨어와 소프트웨어를 수반하는 해법을 만들기 위해 문제를 분석한다」인데, AI 엔지니어가 하는 거의 모든 일이 여기 들어간다. 그런데 이것이 O*NET에서 가장 잘게 쪼갠 서술이다. 원문 화면의 목록을 그대로 옮기고 글자만 한국어로 바꿨다.
  • 경제학에는 표준 도구가 있다. O*NET은 미국 직업 약 1,000개와 각 직업의 과제·기술을 담은 데이터셋이고, 경제학자들이 LLM 영향 범위나 GDP 효과를 따질 때 쓴다.
  • 그런데 알갱이가 굵다. 「컴퓨터·정보 연구 과학자」의 첫 과제가 「컴퓨터 하드웨어와 소프트웨어를 수반하는 해법을 만들기 위해 문제를 분석한다」다. AI 엔지니어가 하는 거의 모든 일이 여기 들어가는데, 이것이 O*NET에서 가장 잘게 쪼갠 서술이다.

연구 흐름을 여섯 범주로 나눴다

AI R&D 전용 O*NET 의 6개 범주 — 실험 하나가 도는 한 바퀴1234561. 정한다 DECIDE새 어텐션 변형 MLA 를 표준MHA 와 견주는 실험을하기로 정한다2. 설계한다 DESIGN실험 계획을 쓴다 — 10B모델·100B 토큰, MLA 대MHA 를 4K·32K 문맥 MMLU로3. 만든다 BUILD트레이너에 MLA 코드를 쓴다— 잠재 투영을 넣고어텐션을 고쳐 FSDP 와붙인다4. 돌린다 RUN100B 토큰으로 학습 둘을띄우고 손실·그래드놈대시보드를 지켜본다5. 분석한다 ANALYZE시드 5개에 걸쳐 MLA 와MHA 를 견주고 MLA 가나은지 판정한다6. 알린다 COMMUNICATE주요 발견과 시사점(예:벤치마크 점수에 준 영향)을정리한 메모를 다른 팀에쓴다결정에서 시작해 알리는 데서 끝나고, 알린 결과가 다음 결정으로 돌아온다이 여섯 아래에 하위 범주가 있고, 그 아래에 60개 넘는 과제가 적힌다
결정에서 시작해 알리는 데서 끝나고, 알린 결과가 다음 결정으로 돌아온다. 여섯 아래에 하위 범주가 있고 그 아래에 60개 넘는 과제가 적힌다. 원문 도해는 도넛 여섯 조각인데 그 위에 한국어를 눕히면 안 읽혀 좌우 고리로 폈다 — 범주 이름과 예시는 원문 그대로다.

범주 하나는 입력과 출력을 갖고 아래로 갈린다

6개 범주 가운데 4번 「Run」을 예로 든 짜임입력받침 구조와 인프라를 갖춘 벤치마크출력최종 결과 한 벌4. Run — 돌린다학습을 돌리고 시스템을 배포하는 자리4.1 실행 감시학습·강화학습·평가 실행을지켜보다가 문제가 생기면정상 궤도로 되돌린다4.2 하드웨어 인프라 운영큰 클러스터를 건강하고 잘쓰이고 빨리 복구되게유지한다4.3 추론 신뢰성엔지니어링 — 운영 서빙을안정적이고 성능 있고 복구가능하게 유지한다이 아래에 과제가 하나씩 적히고, 과제마다 지금 AI가 얼마나 대신하는지를 0~5로 매긴다
6개 범주 가운데 4번 「Run」을 예로 든 짜임이다. 하위 범주 아래에 과제가 하나씩 적히고, 과제마다 자동화 등급이 붙는다. 구조는 Epoch AI 원문을 따랐다.
  • 범위를 좁히면 잘게 쪼갤 수 있다. 프런티어 랩 연구 흐름을 6개 범주로 나누고 그 아래 60개 넘는 과제를 적었다. 예를 들어 4번 범주 「Run」은 실행 감시, 하드웨어 인프라 운영, 추론 신뢰성 엔지니어링 셋으로 갈린다.

과제 목록은 실제로 이렇게 생겼다

과제 목록 한 쪽 — 6개 범주 가운데 4번 아래 하위 범주 하나4. 돌린다 RUN입력 — 만들어 둔 학습 잡, 평가 묶음, 또는 돌아가는 시스템출력 — 끝난 실행, 그리고 잡아내 고친 실패4.1 실행 감시학습·강화학습·평가 실행을 돌아가는 중에 지켜보고, 문제가 나타나면 잡아 정상 궤도로 되돌린다입력 — 돌아가는 학습·RL·평가 잡과 그 실시간 계측출력 — 성공으로 끝난 실행, 또는 정상 상태로 되돌리는 개입등급과제4실행을 띄운다 — 학습·RL·평가예: 정해 둔 스펙으로 다음 사전학습 실행을 띄우고 첫 수백 스텝이 정상인지 확인한다3실행이 나아가는 동안 문제를 살핀다손실 급등·조용한 정확성 버그·발산·보상 해킹을 본다2원인을 진단하고 되돌리는 수를 쓴다예: 급등을 최근에 들어온 저품질·손상 샤드까지 되짚어 마지막 성한 체크포인트로되돌린다왼쪽 숫자는 지금 AI 가 그 과제를 얼마나 대신하는지를 매긴 0~5 등급이다 — 4 는 이끈다,3 은 협업한다, 2 는 거든다. 필자들이 매긴 값이고 주관적이라고 먼저 적어 두었다
제안 문서에서 4.1 실행 감시 한 쪽을 옮긴 것이다. 과제마다 왼쪽에 지금 AI가 얼마나 대신하는지를 매긴 0~5 등급이 붙는다 — 여기서는 4·3·2다. 4는 이끌고 3은 협업하고 2는 거든다. 원문 쪽의 짜임을 그대로 옮겼다.
  • 과제마다 0~5로 매긴다. 3까지는 사람이 판단하고 이어 붙인다 — 2가 「거든다」, 3이 「협업한다」다. 4부터 사람의 자리가 감독과 승인으로 물러나고, 5는 사람이 거의 관여하지 않는 「자율이다」다.

등급은 사람이 무엇을 하고 있느냐로 갈린다

과제마다 지금 AI가 얼마나 대신하는지를 매긴 자0안 쓴다AI가 보태는 것이 없다1미미하다검색·브레인스토밍·글다듬기에 가끔 편할 뿐 일하는 방식도 하는 사람도 안 바뀐다2거든다일부에서 속도나 질이 뚜렷이 나아지지만 사람이 몰고 전부 검토한다3협업한다사람이 가까이 지시하는 가운데 AI가 큰 덩어리를 하고 판단과 이어 붙이기는 사람이한다4이끈다큰 요청 하나로 대부분을 끝까지 하고 사람은 감독·교정·승인한다5자율이다사람이 거의 또는 전혀 관여하지 않고 끝까지 간다필자들이 매긴 값이고 주관적이라고 먼저 적는다. 이 자가 좋아지면 자동화된 과제 비율을시간에 따라 늘여 볼 수 있다는 것이 이 작업의 목적이다
0에서 5로 갈수록 사람이 하는 일이 줄어든다. 3까지는 사람이 판단하고 이어 붙이는데, 4부터 사람의 자리가 감독과 승인으로 물러난다. 필자들은 이 등급이 주관적이라고 먼저 적는다. 값은 Epoch AI 원문 표를 따랐다.
  • 필자들이 한계를 먼저 적는다. 등급은 주관적이고, 완벽한 과제 목록이 있어도 각 과제에서 AI 성능을 따로 재야 한다. 「이것만 있으면 된다」고 말하는 것이 아니라 기존 증거에 하나를 더하자는 제안이다.

사전학습과 사후학습 두 칸으로는 안 담긴다

기대 — 두 칸이면 끝난다초기화 모델배포 모델사전학습사후학습실제 — 어느 하나도 그 두 칸에 얌전히 들어가지 않는다초기화 모델모델 X초기화 모델데이터 품질을채점하도록 파인튜닝한다체크포인트 #0사전학습 데이터를 거른다사전학습SFT + RL체크포인트 #1계속 사전학습SFTRL체크포인트 #3RL체크포인트 #2RL 검증자로 쓴다합성 SFT 데이터를 만든다교사교사 체크포인트 #3 에서증류한다RL 도메인 ARL 도메인 B가중치 병합배포 모델실선은 학습 단계, 점선은 다른 모델이 만들어 준 것을 끌어다 쓰는 자리다「실험 코드 쓰기」 같은 과제가 이 여러 자리에 되풀이돼서, 사전학습·사후학습으로가르는 분류는 접었다
위가 흔히 말하는 두 칸이고 아래가 실제다. 초기화 모델에서 갈라져 나온 체크포인트가 넷이고, 한쪽에서는 다른 모델이 만든 데이터로 파인튜닝하고 다른 쪽에서는 교사 체크포인트에서 증류한다. 「실험 코드 쓰기」 같은 과제가 이 여러 자리에 되풀이되는 것이 사전학습·사후학습으로 분류하는 안을 접은 까닭이다. 구조는 Epoch AI 원문 도해(CC-BY)를 따랐다.

주요 숫자

6개 범주 · 60여 과제
이번에 낸 분류의 크기
0~5
과제별 자동화 정도 등급
약 1,000개
O*NET이 담은 미국 직업 수
15개
O*NET 해당 직업의 과제 수

"the trends they extrapolate share a common weakness: they lean heavily on easy-to-measure things, not what we directly care about" (그들이 늘이는 추세들은 같은 약점을 갖는다 — 우리가 정작 관심 있는 것이 아니라 재기 쉬운 것에 크게 기댄다)

반론 · 충돌

  • 목록을 만드는 일과 재는 일은 다르다필자들도 적듯이, 완벽한 과제 목록이 있어도 각 과제에서 AI 성능을 따로 재야 한다. 지금 붙어 있는 0~5 등급은 세 사람이 매긴 값이고 측정값은 아니다.
  • 과제 목록 자체가 움직인다AI끼리 소통하는 길이 생기면 「핵심 내용을 정리한 메모를 쓴다」 같은 과제는 자동화될 필요 자체가 없어진다. 분모가 바뀌는 자에서 비율을 늘여 보는 것이 무슨 뜻인지는 이 글이 정리하지 않는다.
  • 같은 대시보드의 채용공고 편과 겹쳐 읽어야 한다채용공고 편은 실제 회사들이 지금 어떤 직무를 뽑고 있는지를 보여 준다. 이 글의 과제 목록은 문헌 검토와 브레인스토밍에서 나왔다. 둘을 맞대 보면 목록에 빠진 자리가 드러날 텐데, 어느 글도 그 대조를 하지는 않는다.
Epoch AI의 공개 리서치 글(Gradient Updates)을 요약한 카드입니다. 원문 전문을 다시 싣지 않습니다. 도해는 원문 그림(CC-BY, Epoch AI)의 구조와 값을 그대로 두고 한국어로 다시 그린 것입니다. 숫자는 필자가 공시·보도를 인용해 적은 것을 옮겼고 우리가 따로 검증하지 않았습니다. 투자 추천이 아닙니다.