AI 타임라인 예측의 주력은 그래프에 선을 긋고 늘이는 일인데, 늘이는 대상이 죄다 재기 쉬운 것이다. 그 선들이 무엇을 못 재는지, 그것을 재려면 무엇이 먼저 있어야 하는지, 그리고 그 첫 판이 어떻게 생겼는지를 본다.
Epoch AI Anson Ho · Jean-Stanislas Denain · Joe Kwon2026-06-17Gradient Updatesepoch.ai
▾
실효 컴퓨트와 과제 길이는 대리지표다. 정작 알고 싶은 것은 AI가 AI 연구를 얼마나 대신하느냐인데, 그걸 재려면 연구가 무슨 과제들로 이루어져 있는지부터 적혀 있어야 한다. 필자들이 6개 범주 60여 과제로 쪼갠 첫 판을 냈다.
핵심 포인트
지금 늘이는 선은 둘이다. 하나는 투입이다 — 실효 컴퓨트를 5년 뒤까지 늘여 AI 연구가 자동화되는 지점을 잡는다. 다른 하나는 과제 길이다 — 숙련된 사람이 얼마나 걸리는 일까지 AI가 해내는지를 재고 늘인다.
지금 늘이는 선 둘은 알고 싶은 것을 비껴간다
각 방법이 무엇을 재고 무엇을 못 재는지를 구조로 세웠다. 아래 두 그림이 그 두 선의 실물이다.
투입을 늘인 선 — 실효 컴퓨트
「Situational Awareness」가 그린 외삽이다. GPT-4를 1로 놓으면 2018년이 10⁻⁷ 언저리이고, 2023년까지가 실측이며 거기서 5년을 늘여 2028년에 약 10⁶에 닿는다. 회색 면이 그때의 불확실 구간인데 10⁴에서 10⁷까지 세 자릿수 폭이다. 얼마의 컴퓨트가 세계 최고 연구자와 맞먹는지를 대는 근거는 이 그림 어디에도 없다. 값은 원문 도해(CC-BY)의 축 눈금을 재서 읽었다.
둘 다 못 재는 것이 있다. 세계 최고 연구자와 맞먹는 컴퓨트가 얼마인지는 감으로 정할 수밖에 없고, 과제 길이 벤치마크는 연구의 복잡성을 놓친다. 작은 GPT-2를 파인튜닝하는 것과 성공 기준도 없이 100만 줄을 다루며 프로젝트 다섯을 굴리는 것은 다른 일이다.
과제 길이를 늘인 선 — 초인 코더는 언제 오나
AI 2027이 METR 시간지평을 늘여 뽑은 확률분포 둘이다. 두 예보자의 가운데값은 2027년으로 거의 같은데 90% 자리가 2033년과 2039년으로 여섯 해 벌어진다. 이 폭이 벤치마크가 연구의 복잡성을 못 담는 데서 온다는 것이 이 글의 문제 제기다. 분위수는 그림에 인쇄된 값이고 곡선은 축 눈금을 재서 읽었다.
그래서 가로등 밑에서 찾게 된다. 재기 쉬운 것만 늘이면 벤치마크 점수가 올라도 그 향상이 일의 어느 부분을 덮고 어느 부분은 안 건드리는지 알 수 없다.
같은 일을 15개로 쪼개느냐 60개로 쪼개느냐
O*NET은 미국 경제 전체를 담으려고 LLM 이전에 설계됐다. 범위를 좁히는 대신 알갱이를 잘게 하자는 것이 이 제안이다. 값은 Epoch AI 원문을 따랐다.
O*NET이 적어 둔 과제 열다섯
「컴퓨터·정보 연구 과학자」 직업에 적힌 과제 전부다. 첫 줄이 「컴퓨터 하드웨어와 소프트웨어를 수반하는 해법을 만들기 위해 문제를 분석한다」인데, AI 엔지니어가 하는 거의 모든 일이 여기 들어간다. 그런데 이것이 O*NET에서 가장 잘게 쪼갠 서술이다. 원문 화면의 목록을 그대로 옮기고 글자만 한국어로 바꿨다.
경제학에는 표준 도구가 있다. O*NET은 미국 직업 약 1,000개와 각 직업의 과제·기술을 담은 데이터셋이고, 경제학자들이 LLM 영향 범위나 GDP 효과를 따질 때 쓴다.
그런데 알갱이가 굵다. 「컴퓨터·정보 연구 과학자」의 첫 과제가 「컴퓨터 하드웨어와 소프트웨어를 수반하는 해법을 만들기 위해 문제를 분석한다」다. AI 엔지니어가 하는 거의 모든 일이 여기 들어가는데, 이것이 O*NET에서 가장 잘게 쪼갠 서술이다.
연구 흐름을 여섯 범주로 나눴다
결정에서 시작해 알리는 데서 끝나고, 알린 결과가 다음 결정으로 돌아온다. 여섯 아래에 하위 범주가 있고 그 아래에 60개 넘는 과제가 적힌다. 원문 도해는 도넛 여섯 조각인데 그 위에 한국어를 눕히면 안 읽혀 좌우 고리로 폈다 — 범주 이름과 예시는 원문 그대로다.
범주 하나는 입력과 출력을 갖고 아래로 갈린다
6개 범주 가운데 4번 「Run」을 예로 든 짜임이다. 하위 범주 아래에 과제가 하나씩 적히고, 과제마다 자동화 등급이 붙는다. 구조는 Epoch AI 원문을 따랐다.
범위를 좁히면 잘게 쪼갤 수 있다. 프런티어 랩 연구 흐름을 6개 범주로 나누고 그 아래 60개 넘는 과제를 적었다. 예를 들어 4번 범주 「Run」은 실행 감시, 하드웨어 인프라 운영, 추론 신뢰성 엔지니어링 셋으로 갈린다.
과제 목록은 실제로 이렇게 생겼다
제안 문서에서 4.1 실행 감시 한 쪽을 옮긴 것이다. 과제마다 왼쪽에 지금 AI가 얼마나 대신하는지를 매긴 0~5 등급이 붙는다 — 여기서는 4·3·2다. 4는 이끌고 3은 협업하고 2는 거든다. 원문 쪽의 짜임을 그대로 옮겼다.
과제마다 0~5로 매긴다. 3까지는 사람이 판단하고 이어 붙인다 — 2가 「거든다」, 3이 「협업한다」다. 4부터 사람의 자리가 감독과 승인으로 물러나고, 5는 사람이 거의 관여하지 않는 「자율이다」다.
등급은 사람이 무엇을 하고 있느냐로 갈린다
0에서 5로 갈수록 사람이 하는 일이 줄어든다. 3까지는 사람이 판단하고 이어 붙이는데, 4부터 사람의 자리가 감독과 승인으로 물러난다. 필자들은 이 등급이 주관적이라고 먼저 적는다. 값은 Epoch AI 원문 표를 따랐다.
필자들이 한계를 먼저 적는다. 등급은 주관적이고, 완벽한 과제 목록이 있어도 각 과제에서 AI 성능을 따로 재야 한다. 「이것만 있으면 된다」고 말하는 것이 아니라 기존 증거에 하나를 더하자는 제안이다.
사전학습과 사후학습 두 칸으로는 안 담긴다
위가 흔히 말하는 두 칸이고 아래가 실제다. 초기화 모델에서 갈라져 나온 체크포인트가 넷이고, 한쪽에서는 다른 모델이 만든 데이터로 파인튜닝하고 다른 쪽에서는 교사 체크포인트에서 증류한다. 「실험 코드 쓰기」 같은 과제가 이 여러 자리에 되풀이되는 것이 사전학습·사후학습으로 분류하는 안을 접은 까닭이다. 구조는 Epoch AI 원문 도해(CC-BY)를 따랐다.
주요 숫자
6개 범주 · 60여 과제
이번에 낸 분류의 크기
0~5
과제별 자동화 정도 등급
약 1,000개
O*NET이 담은 미국 직업 수
15개
O*NET 해당 직업의 과제 수
"the trends they extrapolate share a common weakness: they lean heavily on easy-to-measure things, not what we directly care about" (그들이 늘이는 추세들은 같은 약점을 갖는다 — 우리가 정작 관심 있는 것이 아니라 재기 쉬운 것에 크게 기댄다)
반론 · 충돌
목록을 만드는 일과 재는 일은 다르다필자들도 적듯이, 완벽한 과제 목록이 있어도 각 과제에서 AI 성능을 따로 재야 한다. 지금 붙어 있는 0~5 등급은 세 사람이 매긴 값이고 측정값은 아니다.
과제 목록 자체가 움직인다AI끼리 소통하는 길이 생기면 「핵심 내용을 정리한 메모를 쓴다」 같은 과제는 자동화될 필요 자체가 없어진다. 분모가 바뀌는 자에서 비율을 늘여 보는 것이 무슨 뜻인지는 이 글이 정리하지 않는다.
같은 대시보드의 채용공고 편과 겹쳐 읽어야 한다채용공고 편은 실제 회사들이 지금 어떤 직무를 뽑고 있는지를 보여 준다. 이 글의 과제 목록은 문헌 검토와 브레인스토밍에서 나왔다. 둘을 맞대 보면 목록에 빠진 자리가 드러날 텐데, 어느 글도 그 대조를 하지는 않는다.
Epoch AI의 공개 리서치 글(Gradient Updates)을 요약한 카드입니다. 원문 전문을 다시 싣지 않습니다. 도해는 원문 그림(CC-BY, Epoch AI)의 구조와 값을 그대로 두고 한국어로 다시 그린 것입니다. 숫자는 필자가 공시·보도를 인용해 적은 것을 옮겼고 우리가 따로 검증하지 않았습니다. 투자 추천이 아닙니다.