Epoch가 왜 그 벤치마크들을 만드는지를 물음 아홉으로 정리한 글이다. 어떤 물음이 경제적 영향에 걸려 있고 어떤 물음이 능력의 근본 동인에 걸려 있는지, 물음마다 지금 어떤 자가 그것을 겨냥하고 있는지가 이름으로 붙는다.
Epoch AI Greg Burnham2026-08-14Gradient Updatesepoch.ai
▾
앞의 넷은 경제적 영향에, 뒤의 다섯은 능력의 근본 동인에 걸려 있다. 물음마다 지금 그것을 겨냥하는 벤치마크가 무엇인지 붙는데, 그 목록이 곧 이 조직이 무엇을 모르고 있다고 보는지의 목록이다.
핵심 포인트
① AI가 내 일을 할 수 있나. 좁게 정의된 과제에서 지저분하고 열린 직무로 넘어갈 수 있느냐다. Epoch 설문에서 사람들은 일에 AI를 쓸 때 아직 대부분 과제의 일부에만 쓴다. 이것이 바뀌면 노동시장 충격도 모델 개발사의 매출 성장도 달라진다.
아홉이 두 갈래로 갈린다
왼쪽 넷은 경제적 영향에, 오른쪽 다섯은 능력의 근본 동인에 걸려 있다. 원문에 도해가 없어 본문 서술로 새로 그렸다.
② 영향이 클 영역에서 진전이 있나. 「챗GPT 순간」과 「클로드 코드 순간」 다음이 무엇일지에 걸어 보는 것이다. 후보는 사이버보안, 컴퓨터 사용, 그리고 물리 산업이다 — 숙련도가 낮은 기술자를 데리고 공장 바닥의 고장 난 기계를 고치도록 안내할 수 있나.
벤치마크가 재는 일이 넓어지고 있다
아래에서 위로 갈수록 열린 직무에 가깝다. 필자는 앞으로 이런 종류가 훨씬 많아지되, 전통적 벤치마크보다 되풀이되는 사례 연구 형태일 것으로 본다. 원문에 도해가 없어 본문 서술로 새로 그렸다.
③ 선두와 후발의 격차가 영역마다 일정한가. 오픈웨이트 대 클로즈드웨이트, 미국 대 중국, 미국 선두 대 준선두 모두에 걸린다. 극단이 벤치맥싱이다 — 벤치마크가 재려던 능력은 뒤처지는데 점수만 높게 나오도록 맞추는 것.
④ 왜 점수가 다 상관되나. 이름상 다른 영역끼리도 벤치마크 점수가 크게 상관되기 때문에 Epoch 역량지수(ECI)가 성립한다. 회사들이 넓게 개선을 보이려 애쓸 뿐인지, 사람의 IQ처럼 밑에 깔린 일반 능력 인자가 있는지가 갈림길이다.
점수가 같이 오르는 이유가 둘 중 어느 쪽이냐
설명 A라면 더 깊은 이유가 없고, 설명 B라면 밑에 깔린 인자가 하나 있는 것이다. 어느 쪽이냐에 따라 ECI가 빨라졌다는 관찰을 어떻게 읽을지가 달라진다. 단서 둘이 아래 상자에 있는데 둘 다 확정은 아니다. 원문에 도해가 없어 본문 서술로 새로 그렸다.
⑤ AI가 AI 연구를 할 수 있나. 재귀적 자기개선이라는 고전적 물음이고, 벤치마크 묶음이 갖춰지면 지능 폭발의 선행 지표가 된다. 현실성과 비용 둘이 어렵다.
AI 연구를 재는 일만 특히 어렵다
가장 중요한 연구가 밖에서 안 보이는 곳에서 일어나고, 현실적인 규모로 재려면 GPU가 많이 든다. 그래서 이 물음은 가장 중요한데 가장 재기 어렵다. 원문에 도해가 없어 본문 서술로 새로 그렸다.
⑥ 그때그때 배울 수 있나. 가중치를 안 고치고 문맥만 다루면서 되풀이로 나아질 수 있느냐다. Epoch의 EBR-bench는 캠페인형 보드게임을 되풀이 시키는데, AI는 처음부터 못하지는 않지만 되풀이해도 학습 곡선이 거의 안 보인다.
⑦ 추론을 늘리면 얼마나 돌아오나. 실험은 잘해야 로그 형태의 개선을 보여서, 필요한 규모가 많은 과제에 비현실적일 수 있다. 늘리는 최적 방법을 모른다는 것과 답이 영역마다 다를 수 있다는 것이 걸림돌이다.
⑧⑨ 일반화와 새 생각. AI는 사후학습됐을 리 없어 보이는 비공개 게임 퍼즐에서도 나아졌고 저자원 언어에서도 거의 비슷하게 한다. 다만 수학에서 나온 통찰은 「사람이 낼 수 있고 실제로 곧잘 내는 종류」라는 것이 필자가 전하는 수학자들의 평이다.
주요 숫자
9개
이 글이 세운 물음 수
4 대 5
경제적 영향 · 근본 동인으로 갈린 수
거의 0
EBR-bench에서 되풀이로 나온 향상
로그 형태
추론을 늘렸을 때 잘해야 나오는 개선
"My favorite, though, bites every bullet: Andon Café is a real cafe owned and operated by an AI agent." (그래도 내가 가장 좋아하는 것은 모든 어려움을 정면으로 받는다 — Andon Café는 AI 에이전트가 소유하고 운영하는 진짜 카페다)
반론 · 충돌
물음 목록은 답이 아니다이 글은 무엇을 재야 하는지를 정리할 뿐, 어느 물음도 답하지 않는다. 카드에 실린 숫자도 거의 없다 — 있는 것은 EBR-bench에서 학습 곡선이 거의 안 보였다는 관찰 정도다.
④번 물음이 나머지를 흔든다ECI가 무엇을 재는지 모르는 채로 ECI 추세를 근거로 가속을 말하고 있다. 그것이 밑에 깔린 일반 능력이 아니라 회사들의 출시 관행이 만든 상관이라면, 같은 추세가 다른 뜻이 된다.
같은 대시보드의 사이버 편·직무 목록 편과 겹쳐 읽어야 한다②번이 사이버보안을 후보로 꼽은 자리를 사이버 편이 실제 값으로 채우고, ⑤번의 어려움을 직무 목록 편이 다른 각도에서 다룬다. 이 글은 그 두 작업이 어디에 놓이는지를 알려 주는 지도에 가깝다.
Epoch AI의 공개 리서치 글(Gradient Updates)을 요약한 카드입니다. 원문 전문을 다시 싣지 않습니다. 이 편은 원문에 도해가 없어, 본문 서술을 한국어 도해로 새로 그렸습니다. 숫자는 필자가 공시·보도를 인용해 적은 것을 옮겼고 우리가 따로 검증하지 않았습니다. 투자 추천이 아닙니다.