← Epoch AI — AI 컴퓨트의 돈과 물리 제약
추론 · 토큰 공급 · 컴퓨트 크런치

지금 깔린 칩으로 낼 수 있는 토큰은 초당 5억~200억 개다

수요는 못 맞혀도 공급은 셀 수 있다. 세계에 깔린 블랙웰 칩으로 초당 몇 토큰을 낼 수 있는지를 프리필·디코드 단계부터 계산해 실측으로 보정하고, 그 공급이 연 3.4배로 늘 때 수요가 연 10배로 늘면 어디가 먼저 막히는지를 따라간다.

Epoch AI Luke Emberson · Jaime Sevilla2026-05-25Gradient Updatesepoch.ai

세계 블랙웰 칩 전체로 Kimi K2.6급 모델을 돌리면 문맥 길이에 따라 초당 5억에서 200억 출력 토큰을 낼 수 있다. 이 공급은 해마다 3.4배로 늘지만 수요 대리지표들은 연 10배로 늘고 있다. 긴 문맥을 쓰는 에이전트 작업부터 값이 오른다는 것이 필자들의 결론이다.

핵심 포인트

  • 추론은 두 단계다. 프리필(prefill)에서 입력 토큰을 한꺼번에 처리해 KV 캐시(앞선 토큰의 키와 값을 저장해 두는 곳)를 채우고, 디코드(decode)에서 출력 토큰을 하나씩 만든다. 두 단계는 붙잡히는 자원이 서로 다르다.
  • 프리필은 연산이, 디코드는 대역폭이 막는다. GB200 NVL72 한 대에서 8,000:1,000 요청을 돌리면 프리필 연산은 배치 크기 B당 1B밀리초인데 데이터 이동은 1밀리초 안팎이다. 디코드는 반대로 데이터 이동이 868 + 0.5B밀리초로 연산 0.3B밀리초를 압도한다.

프리필은 연산이, 디코드는 대역폭이 붙잡는다

GB200 NVL72 한 대에 8,000:1,000 요청을 올렸을 때. 두 판의 세로 자가 다르다프리필배치 크기 B (0 → 1000)밀리초(최대 1000)연산데이터 이동디코드배치 크기 B (0 → 1000)밀리초(최대 1400)연산데이터 이동프리필 — 연산 1B, 데이터 이동 0.9 + 0.0005B디코드 — 연산 0.3B, 데이터 이동 868 + 0.5B초록이 그 단계를 붙잡는 쪽이다
가로축이 배치 크기, 세로축이 한 사이클에 걸리는 시간이다. 두 판의 세로 자가 다르다 — 왼쪽은 최대 1000밀리초, 오른쪽은 1400밀리초다. 프리필에서는 연산 선이 배치 크기를 따라 곧게 오르는데 데이터 이동은 바닥에 붙어 있고, 디코드에서는 데이터 이동이 868밀리초에서 시작해 연산을 압도한다. 원문 식을 그대로 그린 것이고 값은 Epoch AI 원문 도해(CC-BY)를 따랐다.
  • 노는 자원을 다음 요청이 쓴다. 디코드가 대역폭에 묶여 있는 동안 연산이 놀고 있으니 그 틈에 다음 요청의 프리필을 밀어 넣는다. 청크 프리필(chunked prefill)이라 부르고, 한 사이클 시간이 두 단계 연산 합과 데이터 이동 합 가운데 큰 쪽이 된다.

노는 연산을 다음 요청의 프리필이 채운다

칸은 순서를 보이는 자리이고 길이는 시간 비율이 아니다프리필디코드노는 자리그냥 돌릴 때연산대역폭청크 프리필을 쓸 때연산대역폭노는 연산을 다음 요청의 프리필이 채운다
위가 그냥 돌릴 때, 아래가 청크 프리필을 쓸 때다. 그냥 돌리면 프리필 동안 대역폭이 놀고 디코드 동안 연산이 논다. 청크 프리필은 그 노는 연산에 다음 요청의 프리필을 밀어 넣는다. 칸은 순서를 보이는 자리이고 길이는 시간 비율이 아니다 — 원문에 단계별 시간 비율이 없어 칸을 같은 너비로 뒀다. 구조는 Epoch AI 원문 도해(CC-BY)를 따랐다.
  • 배치를 키워도 어느 지점부터는 소용없다. 8,000:1,000에서는 한 대당 동시 사용자 약 870명에서 연산 한계에 닿고, 그 뒤로는 처리량이 안 늘고 사용자별 응답 속도만 느려진다. 문맥이 25,000토큰이면 그 한계가 130명으로 줄어든다.
  • 추측 디코딩이 배수로 얹힌다. 작은 초안 모델이 여러 토큰을 앞질러 제안하고 본 모델이 한 번에 검증한다. 같은 배치 크기에서 디코드 처리량이 3배가 되고, 프리필에는 도움이 안 되니 전체로는 1.6~2배다.
  • 이론값은 실측으로 깎는다. SemiAnalysis InferenceX의 Kimi K2.5 실험 111건에 맞춰 연산 효율 65%, 대역폭 효율 30%, 토큰당 지연 5밀리초를 얻었다. 이 보정으로 한 대 처리량이 초당 64만 토큰에서 40만 토큰으로 내려간다.

이론값은 낙관적이라 실측으로 3분의 1을 깎는다

SemiAnalysis InferenceX의 Kimi K2.5·K2.6 실험 111건과 견준 것B200B300GB200H200보정 전10²10²10³10³10⁴10⁴보정 후10²10²10³10³10⁴10⁴가로가 실제 처리량, 세로가 모형이 내놓은 처리량이다(둘 다 초당 토큰).점선 위에 놓이면 둘이 같다는 뜻이다보정 전에는 점이 죄다 점선 위쪽에 있다 — 모형이 낙관적이다.연산 효율 65%, 대역폭 효율 30%, 토큰당 지연 5밀리초를 넣으면 점들이 점선에 붙는다점이 겹쳐 그려져 있어 111건이 다 갈라지지는 않는다 —여기 찍힌 것은 왼쪽 47곳, 오른쪽 36곳이다
가로가 실제 처리량, 세로가 모형이 내놓은 처리량이다. 점선 위에 놓이면 둘이 같다는 뜻인데 보정 전에는 점이 죄다 점선 위쪽에 있다 — 모형이 낙관적이다. 연산 효율 65%, 대역폭 효율 30%, 토큰당 지연 5밀리초를 넣으면 점들이 점선에 붙는다. 대역폭 효율이 낮은 것은 이 모형이 칩 사이 통신을 따로 세지 않고 여기에 묻어 두기 때문이다. 점 자리는 원문 도해(CC-BY)에서 뽑았고, 겹쳐 그려진 점이 있어 111건이 다 갈라지지는 않는다.
  • 세계 공급은 초당 5억에서 200억이다. 문맥이 8,000토큰이면 200억이고 128,000토큰이면 5억으로 떨어진다. 구글이 모든 플랫폼에서 처리하는 양이 출력 기준 초당 약 1억 3천만 토큰이니 지금 수요는 이 안에 넉넉히 들어온다.

공급은 해마다 3.4배로 는다

세계 블랙웰 전체가 Kimi K2.6을 돌린다고 놓았을 때1억100억1조100조초당 출력 토큰202620292032입력 8,000토큰 — 2026년 초당 200억 토큰에서 시작입력 25,000토큰 — 2026년 초당 60억 토큰에서 시작입력 128,000토큰 — 2026년 초당 5억 토큰에서 시작세로 자는 로그다 — 곧은 선이 해마다 같은 배수라는 뜻이고, 이 기울기가 3.4배다
세로 자가 로그라서 곧은 선이 해마다 같은 배수를 뜻한다. 연산 능력이 연 3.4배, 메모리 대역폭이 연 4.1배로 느는데 길게 보면 느린 쪽인 연산이 전체를 결정한다. 짧은 기간에는 대역폭이 병목이라 4.1배에 가까울 수 있고, 그 차이는 긴 문맥 요청에서 크게 나타난다. 값은 Epoch AI 원문 도해(CC-BY)를 따랐다.
  • 문제는 증가 속도 차이다. 공급은 연 3.4배로 느는데 수요 대리지표는 연 10배다. 세계 개발자 3천만 명 가운데 매일 AI를 쓰는 47%가 메타·애플만큼 쓴다면 초당 2억~40억 토큰이 필요하고, 128,000토큰 문맥에서는 지금 칩으로 감당이 안 된다.

주요 숫자

5억 ~ 200억 토큰/초
문맥 길이에 따른 세계 공급
64만 → 40만 토큰/초
보정 전후 GB200 NVL72 한 대
3.4배 vs 10배
공급 증가율 vs 수요 대리지표 증가율
2억 ~ 40억 토큰/초
개발자 수요를 넓혀 잡은 범위

"If the demand for AI is outpacing the capacity to serve large models, the predictable consequence is that the price of tokens from large models will rise." (수요가 큰 모델을 돌릴 능력을 앞지르면, 예상되는 결과는 큰 모델 토큰의 값이 오르는 것이다)

반론 · 충돌

  • 공급은 정밀하고 수요는 어림이다공급 쪽은 칩 수와 사양과 실측 111건으로 좁혀 놓았는데, 수요 쪽은 대리지표 몇 개를 개발자 3천만 명으로 확대한 값이다. 그래서 두 곡선의 교차 시점을 이 글로 정할 수는 없다.
  • 모델 하나를 골라 놓고 센 값이다오픈웨이트 모델 가운데 가장 잘하는 Kimi K2.6을 세계 전체에 올린다고 놓았다. 실제 수요는 훨씬 작은 모델이 많이 받아 내고 있고, 필자들도 지금 토큰 증가를 떠받친 것이 효율 개선이라고 적는다. 모델 크기 구성이 바뀌면 공급 숫자가 통째로 달라진다.
  • 같은 대시보드의 분배 편과 겹쳐 읽어야 한다분배 편은 프런티어 랩이 세계 컴퓨트의 절반도 안 쓴다고 했다. 이 글의 크런치는 그 여유분이 있는 상태에서도 가장 큰 모델의 긴 문맥에서는 이미 온다는 이야기라, 두 결론은 서로 어긋나지 않고 층이 다르다.
Epoch AI의 공개 리서치 글(Gradient Updates)을 요약한 카드입니다. 원문 전문을 다시 싣지 않습니다. 도해는 원문 그림(CC-BY, Epoch AI)의 구조와 값을 그대로 두고 한국어로 다시 그린 것입니다. 숫자는 필자가 공시·보도를 인용해 적은 것을 옮겼고 우리가 따로 검증하지 않았습니다. 투자 추천이 아닙니다.