이번 Semi Doped 회차는 AI 추론에서 메모리가 어디까지 밀렸는지를 처음부터 끝까지 붙든다. 진행자 Vik Sekar(이하 진행자V)가 WEKA 최고 AI 책임자 Val Bercovici 를 다시 불렀다. 이 글은 제품 소개를 걷어 내고, 두 사람의 대화에서 업계에 보이는 것을 읽는다.
NVLink 레인 128 대 PCI 레인 32
Val 은 저장장치를 메모리 계층 어디에 끼울지부터 다시 세웠다. 보통은 NAND 보다 빠르고 DRAM 보다는 느린 자리에 넣는데, NVLink 같은 망을 최대 속도로 쓸 수 있으면 DRAM 보다 빨라진다. 근거는 배선 수다. Nvidia 서버의 스케일업 구간에는 NVLink 쪽 레인이 128개쯤인데, 마더보드에서 CPU 가 DRAM 으로 가는 PCI 레인은 32개다— 128은 Val 이 기억으로 든 수다. Val 은 PCI 를 두고 "병목이지 가속기가 아니다"라고 잘랐다.
그런데도 이 사실이 설계에 안 들어온다. Val 이 자주 본다고 한 장면은 시스템 설계자와 개발자가 "마더보드에서 닿는 것보다 빠른 것은 없다"를 전제로 데이터베이스 계층과 응용 지연 프로파일을 통째로 짜는 것이다. 그래도 Val 의 계산은 같다. NVLink 에서 최대 속도만 나오면 DRAM 보다 빠르고, 직관에 어긋나지만 산수가 맞는다.
업계가 여기서 읽을 것은 부품 이름이 아니다. 무엇이 병목인지가 부품표가 아니라 배선도에서 정해진다. 짜낼 여지가 남았는지는 어느 통로로 얼마를 보낼 수 있느냐가 정한다. WEKA 는 대역폭이 어디서 오든 가리지 않는다고 했다. CPO(칩 옆에 광 부품을 붙이는 방식), 구글의 Taurus 망, Mellanox 의 CX7·CX8·CX9 를 나란히 놓고, 설계자가 원하는 대역폭만 잡아 주면 된다고 했다.
Val 이 근거로 든 사건은 둘이다. 하나는 Nvidia 가 지난 12월 Groq 를 200억 달러에 인수하면서 창업자·엔지니어 대부분을 데려간 일이고, 다른 하나는 Cerebras 의 상장 성공이다. 둘 다 추론 인프라 시장이 Nvidia 가 GPU 로 쥔 학습 시장과 다르다는 신호로 읽었다.
가장 또렷한 예로는 구글을 들었다. TPU 는 1세대부터 7세대까지 학습과 추론에 같이 쓰였는데, 몇 달 전 발표한 8세대에서는 학습용 TPU 8 과 추론용 TPU 8i 를 아예 따로 내놨다. 진행자V 는 추론에 정답 하나가 없다고 정리했다. 전부 SRAM 으로 돌릴 수도, HBM 과 SRAM 을 섞을 수도 있고, SambaNova 는 셋을 다 쓴다.
WEKA 가 스스로를 스토리지 회사에서 데이터·메모리 인프라 회사로 다시 부르는 이유도 여기 있다. 추론은 첫 단계인 프리필에서 연산을 많이 쓰고, 토큰을 하나씩 뱉는 디코드 구간에서는 메모리에 심하게 묶인다. 그래서 AMG(증강 메모리 그리드)는 WEKA 스토리지를 한 대도 안 깔고 추론 전용으로만 쓸 수 있다고 했다.
실제 부하가 어떤 모양인지부터 짚고 가야 한다. SemiAnalysis 가 준비 중인 Inference X 갱신판에는 입력 시퀀스 길이를 예전 한계인 8K 가 아니라 수십만 토큰으로 잡는다. 코딩 에이전트가 남기는 트레이스의 중앙값이 이미 20~30만 토큰이다.
KV 캐시 — 단위는 90% 줄고 총량은 100배
압축 이야기는 그 위에서 성립한다. 아무 최적화도 안 걸면 10만 토큰에 KV 캐시 50GB 가 들었는데, DeepSeek V4 쪽 최적화를 얹으면 5GB 로 내려간다. 단위로는 90% 를 줄인 것인데 총량은 오히려 늘었다. 컨텍스트가 10배로 커지고 동시 세션이 10~100배가 되면서, Val 의 표현으로 단위 소비가 100배 줄 때마다 소비량은 1만 배로 뛴다. 남는 것이 순 100배다.
이번에는 다르다는 말이 여기서도 안 통한다고 Val 은 봤다. KV 캐시 압축에 큰 혁신이 나올 때마다 제번스 역설이 다시 걸린다. 그가 든 조건은 셋이다. ① 컨텍스트는 100만에서 안 멈추고 올해가 가기 전에 200만·500만·1000만까지 간다 ② 에이전트가 붙드는 시간이 몇 시간에서 며칠로 늘고 곧 몇 주짜리가 흔해지며, 아예 끝나지 않는 용례도 있다 ③ 병렬 하위 작업이 늘고 영상·음성·이미지 프레임까지 들어온다.
Dynamo 의 메모리 네 층
먼저 메모리 계층을 봐야 한다. Nvidia Dynamo 팀이 정리한 네 층은 ① G1 HBM ② G2 CPU 쪽 DRAM ③ G3 서버 안의 로컬 스토리지 ④ G4 NFS 나 S3 같은 원격 스토리지다. 지연과 대역폭이 자릿수로 벌어져서 사이가 그랜드캐니언처럼 끊긴다. 사람 눈은 최소 초당 35~50 토큰을 요구하고, 에이전트 스웜은 기계 속도로 초당 수천 토큰을 뽑아 간다. 그래서 KV 캐시 계층에 스토리지를 넣고 잰 벤치마크 대부분이 현실을 못 담는다.
과금 항목으로 넘어가면 무게가 한쪽에 쏠린다. 지금 토큰 물량의 80~90% 가 에이전트 스웜이고 대화 세션은 인프라 관점에서 거의 무의미하다. 에이전트가 쓰는 토큰은 대부분 캐시 읽기라, 캐시 읽기 가격만 이야기하면 된다고 Val 은 잘랐다. DeepSeek V4 가 바꾼 것이 정확히 그 항목이다. 백만 토큰당 캐시 읽기 가격에 소수점 뒤로 0 을 두 개 더 붙인 셈인데, 이 가격은 중국에서 돌릴 때만 나온다. 전기가 아주 싼 몽골 데이터센터라는 소문이 있고, 여기에 V4 Flash·Pro 를 3FS 파일 시스템과 붙인 방식이 얹힌다. VentureBeat 계산으로는 같은 모델을 싱가포르·미국·유럽에서 호스팅한 것과 견줘 캐시 읽기가 87배 싸다.
캐시 적중률 둘 — 논리와 실제
그러면 캐시 적중률은 어디서 확인하나. Val 은 둘을 나눴다. ① 에이전트 대시보드에 뜨는 값은 논리 적중률이고, 내 토큰이 재사용될 수 있는 비율이라 보통 95% 근처로 높다 ② 사업자가 실제로 맞히는 비율은 그쪽이 가진 메모리 계층에 달렸다. GPU 에 붙는 HBM 도 서버 DRAM 도 정해진 양뿐이고, 스토리지 계층을 붙여 KV 를 내리면 응답 목표가 무너져서 인기 모델 운영에는 잘 안 쓴다.
Val 이 기댈 곳으로 든 것은 가격이다. SWE-bench 처럼 모두가 그 점수에 맞춰 학습시키는 지표는 이미 의미를 잃었고, 업체가 자기 KV 오프로딩 솔루션을 재는 벤치마크도 마찬가지라고 했다. "손익과 가격, 투명하게 공개된 가격이 궁극의 벤치마크다. 내 생각은 그렇다". 여기서 Val 이 본 것은 오픈웨이트 추론 사업자의 마진 기회다. 보조금이 붙은 가격을 그대로 따라갈 수는 없어도, 슬라이딩 윈도 어텐션이나 하이브리드 압축 어텐션(HCA) 같은 기법은 가져다 쓸 수 있다.
학습과 추론은 NAND 에 요구하는 것이 다르다. 학습에서는 데이터를 드물게 쓰고 자주 읽으니 용량 위주의 QLC 가 맞았는데, 추론은 NAND 가 스토리지보다 메모리처럼 굴기를 요구한다. 메모리는 쓰기와 읽기 비율을 따지지 않는다. 수명 문제가 없다고 전제하기 때문인데, NAND 는 그렇지 않다. Val 이 아깝다고 한 것이 인텔과 마이크론의 Optane 이다. 오늘 추론이 Optane 의 킬러 앱인데 그 물건은 이미 없어졌다.
빈자리를 메우려는 것이 SLC 다. 쓰기를 충분히 다듬지 못하면 수명이 긴 SLC 로 받아 두고 나중에 QLC 로 내리는데, 복잡성과 지연이 따라붙는다. WEKA 의 선택은 다르다. 수만 개 드라이브와 수십만 개 큐에 걸쳐 쓰기를 분산해 NVMe 를 DRAM 캐시 라인처럼 다룬다. 다만 그는 이것이 WEKA 의 방식임을 분명히 하면서 업계에는 SLC 가 필요하다고 했고, Nvidia 도 CMX(컨텍스트 메모리 확장)용 SLC 수요가 늘 것으로 본다고 전했다.
여유분 — 1페타바이트 사서 300~500테라바이트
값을 내는 자리는 여유분이다. SLC 를 못 쓰고 TLC 나 QLC 로 버텨야 하면 드라이브가 망가지지 않게 여유 용량을 크게 잡아야 한다. 1페타바이트를 사서 전기까지 넣고도 실제로 쓰는 것은 300~500테라바이트다. NVMe 와 NAND 로 메모리 흉내를 내는 일에 부드러운 구석이 없다고 했다.
GPU 옆에 바로 붙이는 HBF(고대역폭 플래시)도 같은 이유로 SLC 를 쓰게 될 것으로 봤다. SK 하이닉스는 버스나 망을 거치지 않고 GPU 패키지에 직접 붙이길 원한다고 공개했는데, 아직 확약한 GPU 업체는 없고 Val 은 2028년쯤을 봤다. 문제는 붙여 버리면 못 바꾼다는 점이다. 완화책은 하나가 아니다. 여유분 확보, NVMe 패브릭에서의 쓰기 분산, MoE 안에서의 토큰 라우팅이 함께 간다. 퀄컴이 Modular 를 사고 Nvidia 가 Groq 에서 구글 TPU 팀 출신 컴파일러 인력을 데려온 것을 Val 이 이 맥락에 놓은 이유다. 모델을 HBM 과 HBF 계층에 맞춰 다시 컴파일하게 되면 DRAM 계층을 통째로 건너뛸 수도 있다고 WEKA 엔지니어링에서는 본다.
CXL 은 반대로 못 들어갔다. Val 은 10년 전에는 지지자였는데 지금은 아니라고 했다. NVLink 식 스케일업 망이 메모리 용도까지 흡수하면서 CXL 이 자랄 천장을 만들었다. 버스를 하나 더 두면 설계와 디버깅, 유지와 전력이 다 따라붙는다. 근거로 든 것은 부재다. Blackwell 에도 Vera Rubin 에도 AMD Helios 에도 예고된 Feynman 에도 없고, Supermicro·Dell 표준 제품에도 없다. SemiAnalysis 보도로 Nvidia 가 Vera Rubin 의 부품 구성에서 DRAM 을 절반으로 줄였는데, Val 은 DRAM 이 너무 비싸졌다는 뜻이자 CMX 제품들이 깔리면 추론에서 DRAM 이 덜 필요해진다고 Nvidia 가 본다는 뜻으로 읽었다.
소프트웨어 원가가 무엇으로 바뀌나
마지막에 Val 이 내놓은 예측은 사업 모델 이야기다. 소프트웨어가 컴파일하고 실행하는 물건에서 컴파일하고 실행하고 추론까지 하는 물건이 됐다. 그러면 한계비용이 사라지지 않는다. 클라우드 인스턴스와 데이터베이스, 가상머신과 컨테이너는 사용자 여럿에 나눠 태울 수 있었는데 토큰 원가는 그렇게 안 된다.
Val 이 SaaS 아포칼립스가 진짜라고 보는 근거가 이것이다. 가격 모델을 아무리 새로 짜도 운영비 자체가 토큰 소비로 바뀌었고, OpenRouter 의 토큰 물량은 주마다 계속 오른다. 그가 본 출구는 하나다. 토큰 스택을 더 많이 소유하는 것인데, 추론 사업자에게 계속 맡기거나 뉴클라우드나 토큰 공장과 합쳐 그 비싼 생성 단계를 안으로 들이거나 둘 중 하나다. Val 이 던진 물음은 이렇다. "현금 흐름이 지금 같다면, SaaS 거인들이 뉴클라우드를 먼저 인수할까 아니면 뉴클라우드가 SaaS 거인을 먼저 인수할까".
이미 하나가 넘어갔다. Val 은 원래 Workday 나 monday.com 같은 회사가 중견 뉴클라우드와 합칠 것으로 예측했는데, 먼저 쓰러진 도미노는 xAI 의 Cursor 인수였다. 결국 대부분의 SaaS 와 대부분의 뉴클라우드가 합치는 일은 피하기 어렵다고 봤다.
업계가 여기서 읽을 것은 이 회차의 앞뒤가 한 줄로 이어진다는 점이다. 캐시 읽기 값이 87배까지 벌어지는 시장에서 그 값을 남이 정하게 두면, 소프트웨어 회사의 이익률도 남이 정한다. 그래서 메모리 계층 이야기와 인수 이야기가 같은 대화 안에 들어온다.
말하지 않은 것은 넷이다. ① DRAM 보다 빠르다고 할 때의 조건. 최대 속도를 실제 운영에서 얼마나 유지하는지, 어떤 구성에서 잰 값인지는 나오지 않는다. ② 지연. 대역폭 이야기는 계속 나오는데 왕복 지연을 잰 수치는 한 번도 안 나온다. 스토리지 계층이 응답 목표를 무너뜨린다는 판단의 근거가 되는 값이 그것이다. ③ AMG 를 붙였을 때 실효 캐시 적중률이 얼마로 올라가는지. Val 은 가격이 궁극의 벤치마크라고 하면서도 WEKA 자신의 수치는 앞으로 더 밝히겠다고만 했다. ④ 87배가 무엇으로 만들어졌는지. 전기 요금인지 3FS 통합인지 보조금인지가 나뉘지 않은 채 한 숫자로 묶여 있다.
판단이 바뀌는 조건은 셋이다. ① DeepSeek 가 3FS 쪽 개선을 공개하면 87배 중 얼마가 기술이고 얼마가 전기 요금인지 나뉜다. 기술 비중이 크면 중국 밖 사업자도 따라갈 수 있고, 4절의 마진 기회는 짧게 끝난다. ② GPU 업체 하나가 HBF 를 패키지에 넣겠다고 확약하면 5절의 계산이 바뀐다. 못 바꾸는 부품에 수명 위험을 얹는 선택이라, 그때는 SLC 수요가 Nvidia 예측보다 커진다. ③ 컨텍스트가 200만·500만으로 가는 속도가 예상보다 느리면 3절의 100배 산수가 헐거워진다. 이 회차의 수요 전망이 전부 그 곱셈에 얹혀 있기 때문이다.