← 회차 목록

에이전트 토큰 비용이 오르자 사람은 싼 모델로 옮기고 추론 칩은 메모리를 섞어 칩을 줄인다

2026-04-10 · Austin Lyons · Vik Sekar
원문 https://www.youtube.com/watch?v=rFf8ABolyi0 · 요약본 저장소
진행 Austin Lyons (Chipstrat) · Vik Sekar (Vik's Newsletter) — Semi Doped 공동 진행. 게스트 없음
⚖ 전략 판전략 컨설턴트 출신 애널리스트의 해설 · claude-opus 가 씀
에이전트가 늘 켜져 있으면 요금제도 CPU 수요도 칩 구성도 같은 방향으로 다시 짜인다

이 회차는 진행자 한 사람의 요금 고지서에서 시작해 인텔 시가총액 3천억 달러로 끝난다. 진행은 둘이다. Chipstrat의 Austin Lyons(이하 진행자A)와 Vik's Newsletter의 Vik Sekar(이하 진행자V)가 게스트 없이 한 회차를 채웠다. 잡담처럼 흐르지만 앞뒤가 한 줄로 이어져 있어서, 이 글은 그 줄을 따라 업계에 보이는 것을 추린다.

1 구독 요금제가 끊기자 요금 구조가 드러났다

4월 8일 Anthropic이 메일을 보냈다. 구독 요금제로 OpenClaw 같은 에이전트 껍데기를 돌리던 것을 앞으로 막을 테니 다른 사용자처럼 API 크레딧을 사라는 내용이었다. 진행자V가 그 대상이었다. 월 200달러짜리 요금제에 Opus를 붙여 코딩을 시키고, 비서 노릇을 시키고, 팟캐스트와 뉴스레터에 쓸 자료를 계속 긁어 오게 하고 있었다.

진행자A가 그 자리에서 셈을 세워 보였다. 월 200달러를 내면 실제로는 얼마어치인지 모르는 토큰이 딸려 왔고, 아마 천 달러어치쯤을 이백 달러에 받고 있었을 것이다. 사람이 손으로 쓸 때는 그 천 달러를 다 쓸 일이 없어서 아무 문제가 없었다. 기계가 하루 종일 돌기 시작하자 다 써 버리는 사람이 생겼다. 그래서 통보의 내용은 사람을 막는 것이 아니었다. "당신 인간은 계속 써도 됩니다. 다만 당신의 OpenClaw가 당신인 척 로그인할 수는 없습니다".

토큰을 얻는 세 길과 그 값

얻는 길 값 그래서 정액 구독 월 200달러 기계가 돌자 막혔다 API 종량 5분에 5~7달러 월 2만 달러였을 수도 정액 무제한 주 7달러 최전선이 아닌 모델
월 200달러 정액은 사람이 손으로 쓸 때를 전제로 짜여 있었다. API 종량은 진행자V 가 잠깐 돌려 본 값이고, 월 2만 달러는 진행자A 가 그 속도로 환산한 어림이다. 주 7달러는 Fireworks AI 의 fire pass 다.

토큰 요금을 대 보면 차이가 크다. 진행자V가 API로 잠깐 돌려 보니 5분에 5~7달러가 나갔다. 진행자A는 그 속도를 분당 1달러로 환산하면서, 그동안 월 2만 달러어치를 쓰고 있었을지도 모른다고 했다. 정액제 하나가 끊긴 사건으로 보이지만, 사람 한 명의 손놀림을 전제로 짜여 있던 값은 늘 켜진 기계 앞에서 그대로 서지 못한다.

2 정액 무제한이라는 상품과 기계를 사서 갖는 길

진행자V는 더 싼 API로 가지 않았다. Fireworks AI의 fire pass는 주당 7달러에 Kimi K2.5 Turbo를 사실상 무제한으로 준다. 본인 표현으로 자기 지능도 최전선이 아니니 모델도 그 수준에 맞추겠다고 했다. 아침에 깨우면 그 주의 할 일을 훑어 세 가지를 먼저 끝내라고 일러 주는 비서, 그것이 주 7달러로 얻는 것이다. "내가 필요한 지능을 실제보다 높게 잡고 있었다".

진행자A는 여기서 모델 등급 대신 요금 꼴을 봤다. 진행자V가 반가워한 대목은 싸다는 것보다 고정 금액에 무제한이라는 구조였고, 그건 토큰 생성기를 하나 사서 책상에 두는 것과 닮았다. DGX Spark 같은 물건이 곧바로 떠오르지만, 연산이 충분한지 메모리가 충분한지는 따로 따져야 한다. 정리하면 하나다. 사람들이 에이전트에 쓴 만큼 내는 방식을 그리 좋아하지 않는다.

실제로 사는 길도 진행자V가 재 봤다. ① Gemma의 310억 파라미터 모델은 램 30기가쯤을 요구하고, 사양을 올린 Mac mini면 닿는다. ② 더 작은 E4B·E2B도 쓸 만해 보인다. ③ OpenRouter에 20~25달러를 넣고 Xiaomi Mimo V2 Pro를 써 봤는데, 이 모델은 OpenRouter의 기술 분야에서 토큰 사용량 1위였다. 비용 회수 셈도 붙였다. 기계값이 5천 달러쯤이라 치고(본인도 1만인지 5천인지 헷갈렸다) 5년 쓰는 동안 생산성으로 그만큼을 만들면 본전이다.

빌려 쓸 때와 사서 가질 때

빌려 쓴다 매달 나간다 사서 갖는다 5천 달러 5년 쓴다 되팔면 회수 300달러에 사서 530달러에 팔았다 빌려 쓸 때는 없는 항
기계값은 본인도 1만인지 5천인지 헷갈렸다. 되판 값은 진행자V 가 실제로 겪은 그래픽 카드다. 메모리 값이 오르는 중이라 1년 쓰고 같은 값에 팔 수도 있다고 봤다.

기계를 사서 갖는 길에는 되팔 때의 값이 하나 더 붙는다. 진행자A가 든 예가 중고차인데, 코로나 시기에는 산 값보다 비싸게 팔리기도 했다. 이유는 공급 부족이었다. 진행자V는 300달러에 산 그래픽 카드를 530달러에 팔았다. 그래서 나온 농담이 진지한 관측이 된다. 메모리를 잔뜩 넣은 기계는 지금 사서 1년 쓰고 같은 값에 팔 수도 있다, 메모리 가격이 오르고 있으니까.

3 인텔 주가가 여섯 달 만에 세 배가 된 이유 두 가지

인텔 시가총액이 3천억 달러를 넘었다. 여섯 달 전의 세 배이고, 4월 한 달에만 50% 올랐다. 주가는 30달러대에서 60달러가 됐다. 20년 동안 옆으로 누워 있다가 내리막을 걷고 나서 갑자기 올라온 모양이다.

진행자V는 이유를 둘로 들었다. ① Terafab 발표. 앞선 회차에서 진행자A가 일론 머스크의 Terafab이 인텔에 칩 주문을 넣는 그림을 짚었고, 1테라와트가 아니라 그 10~20%만 되어도 대형 고객 하나가 생기는 것이라고 했다. 인텔에 절실했던 것이 바로 그런 고객이다. ② 인텔과 구글의 제온 다년 계약.

그런데 진행자A는 자기 말에 스스로 유보를 달았다. Terafab 건은 인텔에게 가장 좋은 경우를 가정한 추측이고 발표문에 세부가 거의 없다. 연구개발을 거들어 주는 정도일 수도 있다. 다만 인텔이 하려는 사업이 파운드리인 이상, 가장 단순한 설명은 칩을 만들어 주거나 패키징을 해 주는 것이다.

구글 계약은 읽어 보니 기대와 달랐다. 처음에는 AI용 CPU 랙 이야기인 줄 알았는데, 발표문에서 언급된 제품은 구글 Cloud Next에서 2년 전에 내놓은 C4·N4 머신이고 그 안에 든 것은 에메랄드 래피즈였다. 곧 구세대인 인텔 7 공정 CPU를 더 사겠다는 내용이다. 진행자A의 반응이 솔직하다. 처음의 흥분이 가라앉았고, 이것은 AI 이야기라기보다 구글의 클라우드 부문이 서버용 CPU를 더 사겠다는 것이다. 그래도 의미는 남는다. 인텔이 급여를 주고 파운드리 투자금을 마련하는 돈은 CPU 판매에서 나온다.

4 에이전트가 늘리는 것은 GPU 수요만이 아니다

IPU 가 CPU 에서 떼어 가는 것 셋

호스트 CPU 스토리지 네트워킹 보안 IPU 가 맡는다 CPU 에는 코어와 연산을 더 채운다 구글과 인텔이 함께 설계한 칩
구글과 인텔이 함께 설계한다. AWS 의 Nitro 나 DPU 와 같은 발상이라고 진행자A 가 짚었다. 언제 얼마나 배치되는지는 전사에 없다.

같은 발표에 IPU가 들어 있었다. 인프라 처리 장치(infrastructure processing unit), 곧 스토리지·네트워킹·보안 처리를 호스트 CPU에서 떼어 내 맡는 별도 칩이고 구글과 인텔이 함께 설계한다. 잡일을 덜어 내면 CPU 안에 코어와 연산을 더 채울 수 있다. 진행자V는 여기서 코어 하나의 성능이든 코어 수든 CPU를 최대한 짜내는 일이 여전히 중요하다고 봤다.

진행자A는 같은 물건을 다른 이름으로 알아봤다. AWS Nitro이고 DPU다. 그는 네트워크와 관련된 일은 네트워크 안에서 끝내야 한다고 오래 생각해 왔다. 권한 확인 같은 것까지 포함해 CPU까지 올라오지 못하게 막는다.

CPU 수요 자체를 보는 눈도 이 회차에서 한 번 넓어진다. AI 때문에 CPU가 더 필요하다고 할 때 보통 떠올리는 것은 GPU 클러스터의 헤드 노드를 늘리는 일이다. 에이전트가 늘 켜져 있으면 다른 수요가 하나 더 생긴다. 진행자V의 비서가 아침마다 깨어나 어딘가의 평범한 클라우드 CPU를 두드리고 자료를 긁는다. 그래서 SaaS를 돌리는 데이터홀에도 CPU가 더 들어간다. 1절의 요금 이야기와 여기가 같은 사건의 앞뒤다.

5 ARM이 데이터센터를 다 가져간다는 말의 실제 무게

어딘가에서 나온 주장이 있다. 데이터센터나 AI 용도로 배치되는 CPU의 90%가 ARM 기반이 될 것이라는 이야기다. 진행자V는 그렇게 되지 않는다고 봤다. x86은 계속 쓰이고, 한쪽이 다른 쪽을 몰아낼 이유가 없다. 구글의 Axion을 예로 들면서, 그것은 첨단 CPU는 아니고 전력 효율이 좋아 클라우드 배치에 잘 맞는 물건이며 제온이 갖고 있는 힘과는 성격이 다르다고 했다.

진행자A는 반대편 논거를 먼저 세우고 무너뜨린다. ARM에 낙관적인 사람이라면 이제 포팅이 쉬워졌다고 말할 것이다. LLM이 코드를 옮겨 주니 소프트웨어를 쓰는 일이 거의 공짜에 가까워졌고, 메타도 공개 자리에서 그렇게 말했다. 그런데 ARM의 Mohamed Awad와 나눈 대화에서 나온 이야기가 다르다. 기업이 오래된 시스템에서 새 시스템으로 옮길 때 힘든 부분은 기술 난이도가 아니다. 옛 업무 흐름을 통째로 들고 가야 하고, 옮기다 보면 그 흐름 자체를 다시 짜야 한다는 것을 깨닫는다. 그런 일은 몇 년이 걸리고 사람이 많이 든다.

그래서 진행자A는 업계 밖 독자에게 사양 비교를 조심하라고 일러 둔다. IT 부서 담당자는 사양이 좋다고 바꾸지 않는다. 기회비용을 따지고, 솔직히 말하면 그 골치 아픈 이전 작업을 내가 떠맡을 것인가라는 개인의 유인도 따진다. 진행자V는 자기 말도 한 번 좁혔다. 두 명령어 집합이 서로 바꿔 쓸 수 있다는 뜻은 아니고, 워크로드마다 나눠 얹으면서 하드웨어로는 한 데이터센터 안에 같이 있을 수 있다는 뜻이다.

6 결정론적 데이터 경로가 칩 수를 줄인다

인텔과 SambaNova가 새 추론 구조를 발표했다. 제온 CPU에 SambaNova의 RDU(재구성 가능 데이터 장치 — 작업에 맞춰 내부 데이터 경로를 다시 짜는 칩)를 붙이는 구성이고, 디코드(토큰을 하나씩 생성하는 구간)를 RDU가 맡는다. 진행자V는 이것을 Vera CPU에 Groq LPU를 붙이는 그림에 견줬다. 기능으로 보면 비슷하고 구조로 보면 전혀 다르다.

메모리를 한 종류로 두나, 섞나

Groq LPU SambaNova RDU SRAM 뿐 SRAM HBM DRAM 연산과 메모리가 물리적으로 붙는다 오갈 경로를 미리 정해 둔다 수천 개 256개 메모리를 섞은 쪽 같은 일을 하는 칩 수
섞으면 데이터가 어디서 오는지 예측이 어려워지는데, 계층마다 지연을 알고 경로를 작업 전에 정해 두는 것이 이쪽의 답이다. 256개와 수천 개는 전사의 값이고, 랙으로는 열 개가 한 개가 된다.

핵심 차이는 메모리다. Groq은 전부 SRAM이다. RDU에는 SRAM도 있고 HBM도 있고 DRAM도 있다. 여러 종류를 섞으면 보통 어디서 데이터가 오는지 예측이 어려워지는데, SambaNova는 반대로 갔다. 메모리 계층마다 지연이 얼마인지 알고 있으니 데이터가 오갈 경로를 작업 전에 미리 정해 둔다. HBM에서 이것, SRAM에서 저것, DRAM에서 나머지를 정해진 시각에 가져오는 식이다. 그 결과가 칩 수로 나온다. 256개로 Groq LPU 수천 개가 해야 하는 일을 한다.

진행자A는 여기서 늘릴 수 있느냐를 봤다. 캐시 계층이 여럿이면 캐시 미스가 생기고 예측이 어긋난다. LLM 추론은 가중치와 KV 캐시(이미 처리한 토큰의 중간 계산을 재사용하려고 쥐고 있는 데이터)를 옮기는 일이 거의 전부이니 예측 가능성이 크게 작용한다. Groq의 약점은 연산과 메모리가 물리적으로 붙어 있다는 데 있다. 메모리를 늘리려면 연산도 같이 늘려야 하고, 그래서 칩이 아주 많이 필요하다. 메모리 설계를 달리 하면 랙 열 개 대신 한 개로 끝난다. 진행자V의 표현으로는 그 늘어나지 않는 성질이 Groq의 아킬레스건이다.

다만 두 사람 다 유보를 달았다. 진행자V는 Groq의 VLIW(매우 긴 명령어 — 컴파일러가 클록 단위까지 실행 순서를 미리 박아 넣는 방식)가 클록 단위로 결정론적이라는 것은 알지만, SambaNova가 그보다 얼마나 더 결정론적인지는 모른다고 했다. 진행자A도 자기가 들은 것은 메모리 종류를 가로지르는 관리 쪽이었다면서, 직접 물어보자고 했다.

이름은 여섯인데 자리는 몇인가

Groq Cerebras SambaNova Etched Mad Max Talos 손익분기에 닿을 물량 그만한 물량을 움직일 고객 다섯 여섯 서버에서 못 뜨면 소비자용으로 조합 수를 정하는 자리
여섯은 이 회차에 이름이 나온 곳이다. 칩 하나를 만드는 비용이 커서 손익분기 물량이 필요하고, 그만한 물량을 움직일 고객은 다섯이나 여섯이다. 누가 남는지는 이 회차도 모른다고 했다.

여러 업체의 칩을 섞는 구성이 늘면 그다음 물음은 소프트웨어다. Nvidia에는 Dynamo가 있는데 인텔은 무엇을 내놓는가, 모두가 하나의 조율 계층으로 모일 것인가. 그리고 승자 수에 관한 진행자A의 셈이 냉정하다. 칩 하나를 만드는 비용이 워낙 커서 손익분기에 닿을 물량이 필요하고, 그만한 물량을 움직일 고객은 다섯이나 여섯쯤이다. 그러니 조합도 몇 가지에서 끝난다. Groq·Cerebras·SambaNova·Etched·Mad Max·Talos 중 누가 남는지는 아직 모른다. 진행자V가 붙인 출구는 소비자용이다. 서버에서 못 뜬 설계 자산은 더 싼 제품으로 내려가고, Talos 같은 하드코딩 LLM 칩이 말대꾸하는 어린이 장난감에 들어가는 미래도 있다.

7 이 회차가 말하지 않은 것

네 가지가 빠져 있다. ① Terafab 주문의 실체가 없다. 진행자A 스스로 인텔 발표에 세부가 없어서 추측이라고 못 박았다. ② 구글 계약에서 IPU가 언제 얼마나 배치되는지, 어느 공정으로 만드는지가 없다. IPU를 두고 나눈 대화는 개념 설명에 머문다. ③ SambaNova의 결정론이 Groq의 VLIW보다 실제로 나은지를 둘 다 모른다. 256개면 된다는 수치도 진행자V가 전한 것이고 이 회차에서 검증되지 않았다. ④ 시가총액이 세 배가 됐다는 이야기에 실적 숫자가 하나도 붙지 않았다.

무엇이 나오면 판단이 바뀌는지도 넷이다. ① Terafab이 인텔에 넣은 주문의 성격과 규모가 공개되면 3절이 통째로 다시 서거나 무너진다. 연구개발 협력으로 판명되면 시가총액 세 배의 근거 절반이 사라진다. ② 구글이 사는 제온이 구세대를 벗어나 신세대로 옮겨 가면 4절의 CPU 수요 이야기가 훨씬 강해진다. ③ SambaNova RDU와 Groq LPU를 같은 잣대로 잰 수치가 나오면 6절의 칩 수 견줌이 확인되거나 뒤집힌다. ④ 정액 무제한 상품을 파는 Fireworks AI가 그 값을 유지하는지가 남는다. 진행자A가 회차 안에서 이미 물었다. 이 업체도 손해를 보고 있는 것 아닌가, 아니면 더 싼 모델이라 괜찮은 것인가. 앞의 요금제 하나가 이미 그렇게 끊겼다.

받은 글을 문장 그대로 싣는다. 원본 insights/semidoped/2026-04-10-intel-openclaw-strategy.md · 페르소나 전략 컨설턴트 출신 애널리스트