← Epoch AI — AI 컴퓨트의 돈과 물리 제약
벤치마크 · 역량지수 · 평가 설계

벤치마크로 답하려는 물음이 무엇인지부터 적어 둔다

Epoch가 왜 그 벤치마크들을 만드는지를 물음 아홉으로 정리한 글이다. 어떤 물음이 경제적 영향에 걸려 있고 어떤 물음이 능력의 근본 동인에 걸려 있는지, 물음마다 지금 어떤 자가 그것을 겨냥하고 있는지가 이름으로 붙는다.

Epoch AI Greg Burnham2026-08-14Gradient Updatesepoch.ai

앞의 넷은 경제적 영향에, 뒤의 다섯은 능력의 근본 동인에 걸려 있다. 물음마다 지금 그것을 겨냥하는 벤치마크가 무엇인지 붙는데, 그 목록이 곧 이 조직이 무엇을 모르고 있다고 보는지의 목록이다.

핵심 포인트

  • ① AI가 내 일을 할 수 있나. 좁게 정의된 과제에서 지저분하고 열린 직무로 넘어갈 수 있느냐다. Epoch 설문에서 사람들은 일에 AI를 쓸 때 아직 대부분 과제의 일부에만 쓴다. 이것이 바뀌면 노동시장 충격도 모델 개발사의 매출 성장도 달라진다.

아홉이 두 갈래로 갈린다

앞의 넷은 경제적 영향에, 뒤의 다섯은 능력의 근본 동인에 걸려 있다경제적 영향① AI가 내 일을 할 수 있나② 영향이 클 영역에서 진전이 있나③ 선두와 후발의 격차가 일정한가④ 왜 점수가 다 상관되나능력의 근본 동인⑤ AI가 AI 연구를 할 수 있나⑥ 그때그때 배울 수 있나⑦ 추론을 늘리면 얼마나 돌아오나⑧ 강화학습이 얼마나 일반화되나⑨ 새 생각을 낼 수 있나Epoch의 벤치마크 작업이 무엇을 답하려고 하는지를 필자가 직접 적은 목록이다
왼쪽 넷은 경제적 영향에, 오른쪽 다섯은 능력의 근본 동인에 걸려 있다. 원문에 도해가 없어 본문 서술로 새로 그렸다.
  • ② 영향이 클 영역에서 진전이 있나. 「챗GPT 순간」과 「클로드 코드 순간」 다음이 무엇일지에 걸어 보는 것이다. 후보는 사이버보안, 컴퓨터 사용, 그리고 물리 산업이다 — 숙련도가 낮은 기술자를 데리고 공장 바닥의 고장 난 기계를 고치도록 안내할 수 있나.

벤치마크가 재는 일이 넓어지고 있다

벤치마크가 재는 일이 얼마나 넓어졌나Andon CaféAI 에이전트가 소유하고 운영하는 진짜 카페다필자가 가장 좋아하는 것으로 꼽는다Remote Labor Index프리랜싱 플랫폼의 실제 프로젝트를 가져와 사람이 AI 산출물과 사람 기준작을견준다MirrorCode큰 소프트웨어 패키지를 처음부터 구현하게 한다 · 다만 매우 구조화된 환경이다지금까지의 대부분버그 고치기, 수학 풀기, 보고서 쓰기 같은 좁게 정의된 과제열린 직무좁은 과제Epoch 설문에서 사람들은 일에 AI를 쓸 때 아직 대부분 과제의 일부에만 쓴다이것이 바뀌면 노동시장 충격도 모델 개발사의 매출 성장도 달라진다
아래에서 위로 갈수록 열린 직무에 가깝다. 필자는 앞으로 이런 종류가 훨씬 많아지되, 전통적 벤치마크보다 되풀이되는 사례 연구 형태일 것으로 본다. 원문에 도해가 없어 본문 서술로 새로 그렸다.
  • ③ 선두와 후발의 격차가 영역마다 일정한가. 오픈웨이트 대 클로즈드웨이트, 미국 대 중국, 미국 선두 대 준선두 모두에 걸린다. 극단이 벤치맥싱이다 — 벤치마크가 재려던 능력은 뒤처지는데 점수만 높게 나오도록 맞추는 것.
  • ④ 왜 점수가 다 상관되나. 이름상 다른 영역끼리도 벤치마크 점수가 크게 상관되기 때문에 Epoch 역량지수(ECI)가 성립한다. 회사들이 넓게 개선을 보이려 애쓸 뿐인지, 사람의 IQ처럼 밑에 깔린 일반 능력 인자가 있는지가 갈림길이다.

점수가 같이 오르는 이유가 둘 중 어느 쪽이냐

이름상 다른 영역끼리도 벤치마크 점수가 크게 상관된다 — 왜?설명 A · 깊은 이유가 없다회사들이 모든 출시에서 넓은 영역의 개선을보이려 애쓸 뿐이고, 그 작업은 영역마다독립적이다설명 B · 밑에 깔린 인자가 있다사람의 IQ처럼 일반 능력 인자가 하나 있어서그것이 한꺼번에 올라간다설명 B라면 그 인자가 무엇인가 — 단서 둘포화되기 전까지 METR 시간지평의 로그값이 ECI와 크게 상관됐다또는 ECI 상승의 상당 부분이 일관된 추론을 유지하는 최대 문맥 길이에서 온다ECI 증가 추세는 AI 능력 성장이 빨라졌는지를 잡는 데 쓸모가 있다. 그 인자가실제 영향으로 곧장 옮겨지는 양이라고 말할 수 있으면, 가속을 해석하기 더 쉬워진다
설명 A라면 더 깊은 이유가 없고, 설명 B라면 밑에 깔린 인자가 하나 있는 것이다. 어느 쪽이냐에 따라 ECI가 빨라졌다는 관찰을 어떻게 읽을지가 달라진다. 단서 둘이 아래 상자에 있는데 둘 다 확정은 아니다. 원문에 도해가 없어 본문 서술로 새로 그렸다.
  • ⑤ AI가 AI 연구를 할 수 있나. 재귀적 자기개선이라는 고전적 물음이고, 벤치마크 묶음이 갖춰지면 지능 폭발의 선행 지표가 된다. 현실성과 비용 둘이 어렵다.

AI 연구를 재는 일만 특히 어렵다

⑤번 물음이 특히 어려운 이유현실성가장 중요한 AI 연구는 프런티어 회사 안에서일어나고, 밖에서는 잘 안 보인다비용현실적인 규모로 하려면 GPU가 많이 든다그만한 자원을 벤치마크용으로 대는 것은규모에 따라 비싸거나 아예 불가능하다그래서 벤치마크 묶음이 갖춰지면 얻는 것AI 연구개발 자동화의 선행 지표가 된다 — 어떤 형태의 자동화는 폭주하는 능력 성장, 곧 지능폭발로 이어진다는 것이 이 물음이 고전이 된 이유다
가장 중요한 연구가 밖에서 안 보이는 곳에서 일어나고, 현실적인 규모로 재려면 GPU가 많이 든다. 그래서 이 물음은 가장 중요한데 가장 재기 어렵다. 원문에 도해가 없어 본문 서술로 새로 그렸다.
  • ⑥ 그때그때 배울 수 있나. 가중치를 안 고치고 문맥만 다루면서 되풀이로 나아질 수 있느냐다. Epoch의 EBR-bench는 캠페인형 보드게임을 되풀이 시키는데, AI는 처음부터 못하지는 않지만 되풀이해도 학습 곡선이 거의 안 보인다.
  • ⑦ 추론을 늘리면 얼마나 돌아오나. 실험은 잘해야 로그 형태의 개선을 보여서, 필요한 규모가 많은 과제에 비현실적일 수 있다. 늘리는 최적 방법을 모른다는 것과 답이 영역마다 다를 수 있다는 것이 걸림돌이다.
  • ⑧⑨ 일반화와 새 생각. AI는 사후학습됐을 리 없어 보이는 비공개 게임 퍼즐에서도 나아졌고 저자원 언어에서도 거의 비슷하게 한다. 다만 수학에서 나온 통찰은 「사람이 낼 수 있고 실제로 곧잘 내는 종류」라는 것이 필자가 전하는 수학자들의 평이다.

주요 숫자

9개
이 글이 세운 물음 수
4 대 5
경제적 영향 · 근본 동인으로 갈린 수
거의 0
EBR-bench에서 되풀이로 나온 향상
로그 형태
추론을 늘렸을 때 잘해야 나오는 개선

"My favorite, though, bites every bullet: Andon Café is a real cafe owned and operated by an AI agent." (그래도 내가 가장 좋아하는 것은 모든 어려움을 정면으로 받는다 — Andon Café는 AI 에이전트가 소유하고 운영하는 진짜 카페다)

반론 · 충돌

  • 물음 목록은 답이 아니다이 글은 무엇을 재야 하는지를 정리할 뿐, 어느 물음도 답하지 않는다. 카드에 실린 숫자도 거의 없다 — 있는 것은 EBR-bench에서 학습 곡선이 거의 안 보였다는 관찰 정도다.
  • ④번 물음이 나머지를 흔든다ECI가 무엇을 재는지 모르는 채로 ECI 추세를 근거로 가속을 말하고 있다. 그것이 밑에 깔린 일반 능력이 아니라 회사들의 출시 관행이 만든 상관이라면, 같은 추세가 다른 뜻이 된다.
  • 같은 대시보드의 사이버 편·직무 목록 편과 겹쳐 읽어야 한다②번이 사이버보안을 후보로 꼽은 자리를 사이버 편이 실제 값으로 채우고, ⑤번의 어려움을 직무 목록 편이 다른 각도에서 다룬다. 이 글은 그 두 작업이 어디에 놓이는지를 알려 주는 지도에 가깝다.
Epoch AI의 공개 리서치 글(Gradient Updates)을 요약한 카드입니다. 원문 전문을 다시 싣지 않습니다. 이 편은 원문에 도해가 없어, 본문 서술을 한국어 도해로 새로 그렸습니다. 숫자는 필자가 공시·보도를 인용해 적은 것을 옮겼고 우리가 따로 검증하지 않았습니다. 투자 추천이 아닙니다.