이번 Semi Doped 회차는 Grok bot 이라는 에이전트 앱 하나로 시작해서 서버 CPU 시장 이야기로 끝난다. 진행자 둘, Austin Lyons(이하 진행자A)와 Vik Sekar(이하 진행자V)가 붙든 물음은 하나다. 보통 사람도 에이전트를 쉽게 돌리게 되면, 그 일은 어느 칩 위에서 벌어질까. 이 글은 제품 평가는 걷어 내고, 그 대화에서 업계에 보이는 것을 읽는다.
진행자V는 회차를 열면서 먼저 선을 그었다. "내 생각엔 중요한 건 Grok bot 이 제품으로 무엇이냐가 아니라, 그 밑에 깔린 연산 기반에 무엇을 뜻하느냐, 특히 CPU 에 무엇을 뜻하느냐다". 실제로 제품 이야기는 첫머리에 잠깐 나오고, 나머지 시간은 전부 그 아래 하드웨어 이야기다.
무엇이 없어졌는지 알려면 그 전에 사람들이 무엇을 하고 있었는지부터 봐야 한다. 진행자V는 지난겨울 Mac Mini 가 불티나게 팔리던 때를 떠올렸다. 사람들은 왜 샀을까. 메모리 때문에? 거기 든 NPU(신경망 전용 연산기) 때문에? CPU 때문에? 진행자V가 보기엔 셋 다 아니다. 쓰던 노트북에 에이전트를 붙이면 의료 기록까지 든 컴퓨터를 통째로 맡기는 꼴이 된다. 그래서 에이전트만 돌릴 기계를 따로 한 대 산 것이다. 사람들이 산 것은 성능이 아니라 「내 컴퓨터와 떼어 놓기」였다.
문제는 그 기계를 계속 켜 두는 일이다. 진행자V가 꼽은 걸림돌은 셋이다. ① 정전이나 전원장치 고장으로 꺼진다 ② 집 인터넷이 끊기면 밖에서 접속할 수 없다 ③ 여행 중에 쓰려면 VPN 을 따로 세워야 한다. 진행자V는 어머니에게 Mac Mini 와 Tailscale, 무정전 전원장치, 예비 회선까지 갖추라고 설명하는 장면을 상상해 보였다. 어머니의 대답은 뻔하다. "나는 못 쓰겠다. 에이전트 컴퓨터는 네가 가져라. 나는 쓰던 노트북 쓸란다". 진행자A도 거들었다. "99% 의 사람에게는 결국 쉬운 버튼이 있느냐의 문제다".
Grok bot 이 없앤 것이 바로 이 셋이다. 내려받은 앱은 껍데기일 뿐이다. 실제로는 클라우드 어딘가에서 가상머신 한 대가 돌아가고, 도구 로그인도 보안도 그 안에서 처리된다. 설치할 때 캘린더·드라이브·Canva·Figma 같은 연동을 고르면 그대로 붙는다. 값은 한 달에 200달러다. 업계가 여기서 읽을 것은 성능 경쟁이 아니다. 에이전트를 쓰기 어렵게 만든 것은 하드웨어가 아니라 잡일이었다. 그 잡일을 대신해 주는 순간 사용자는 늘어난다.
에이전트가 사는 자리 셋
진행자A가 대화 중간에 경우 셋을 나란히 놓았다. ① 노트북에서 에이전트를 돌리면 잡일은 내 노트북 CPU 가 하고, 추론만 클라우드 GPU 에 맡긴다 ② Mac Mini 를 따로 두면 그 잡일이 책상 위 두 번째 CPU 로 옮겨 가지만, 여전히 내 기계다 ③ Grok bot 처럼 클라우드에 가상머신을 띄우면 CPU 도 GPU 도 남의 데이터센터에 있고, 나한테는 결과만 내려온다.
셋 다 GPU 는 클라우드에 있다. 다른 것은 CPU 가 어디 있느냐 하나뿐인데, 그 하나가 매출이 어느 회사로 가는지를 통째로 바꾼다. ①②에서는 소비자용 칩과 완제품이 팔리고, ③에서는 서버 CPU 와 데이터센터 임대가 팔린다. 이 대목은 진행자가 한 말이 아니라 이 글이 이어서 읽은 것이다. 진행자A는 마지막에 둘을 견줬다. Mac Mini 시절에도 토큰 요청이 늘어 호스트 노드 CPU 는 팔렸다. 하지만 에이전트의 잡일은 책상 위에서 벌어졌다. 쉬운 버튼을 누르는 방식이 되면 그 잡일까지 데이터센터로 넘어간다.
내 가상머신은 어디서 돌까. 진행자V가 직접 답했다. 아마 범용 CPU 위에서 운영체제 하나를 돌리는 작은 컴퓨터일 것이고, 그 컴퓨터가 지니어스(GPU)와 호스트 노드가 있는 건물 전체에 접근한다고 했다. 그러니 가장 먼저 늘어나는 수요는 특수한 칩이 아니다. 평범한 범용 서버 CPU 다.
천재 하나, 조수 둘
진행자A가 세운 비유가 이 회차의 뼈대다. GPU 는 모든 분야에 박사 학위가 있는 천재다. 천재가 무엇을 할지 정하고 나면 실제 작업 대부분은 조수들에게 넘겨도 되니, CPU 가 조수다. 진행자V는 여기서 조수를 둘로 나눈다.
첫째는 호스트 노드 CPU 다. 하는 일은 하나, 천재가 멈추지 않게 다음 서류철을 계속 갖다 바치는 것이다. 천재가 노는 시간이 곧 손실이기 때문이다. 그래서 코어 수보다 코어 하나의 속도가 중요하고, GPU 와 같은 방에 있어야 한다. 진행자A는 칩과 칩을 직접 잇는 코히어런트 방식(둘이 같은 메모리를 그대로 들여다보는 연결)의 예로 Grace Blackwell 을 들었고, 진행자V는 거기에 C2C 프로토콜을 보탰다. 진행자V의 그림에서 HBM(고대역폭 메모리)은 천재 책상 옆의 종이 더미이고, 메모리 일관성이란 조수가 그 더미를 같이 볼 수 있는 상태다. 진행자A의 정리는 짧다. "호스트 CPU 는 할 일이 하나다. GPU 를 계속 먹이는 것".
둘째가 새로 생긴 자리다. 이 이야기는 진행자A가 꺼냈다. 챗봇 시대에는 첫째만 있으면 됐다. 이제는 천재가 코드를 뱉으면 그걸 컴파일해 봐야 하고, "50곳에서 정보를 가져와라, SEC 공시를 뒤지고 웹을 뒤져라" 같은 지시도 나온다. 이 일을 호스트 CPU 가 받으면 그 순간 GPU 를 먹이던 손이 멈춘다. 그때 천재가 노는 것이 최악이라고 진행자V는 말했다. 그래서 이렇게 넘치는 일만 맡는 랙이 따로 필요하고, 거기 붙은 이름이 에이전틱 CPU 다. 진행자V는 마케팅 용어일 거라 했고, 진행자A는 최근에 생긴 말이라고 했다. 물리적으로는 같은 칩이어도 되고, 천재와 계속 이야기하지 않으니 코히어런시도 없어도 된다는 것이 진행자V의 정리다.
진행자V는 코어 128개짜리 CPU 를 사무실 평면도에 비유했다. 네 코어씩 묶어 재무팀·리서치팀·시설팀으로 칸을 나누면, 호스트 노드가 "재무팀, 어젯밤 공시 긁어 와" 하고 부르고 그 네 코어가 다녀와서 보고한다. 그러면 칸을 몇 개 만들지, 칸마다 몇 명을 넣을지가 설계 문제가 된다. AMD 의 256코어나 인텔의 288코어 제품이면 팀을 크게 짤 수 있다. 다만 사람은 유능해야 한다고 진행자V는 덧붙였다. 인턴 여덟 명과 경력자 여덟 명은 다르니, 코어 하나의 성능도 버릴 수 없다.
진행자A는 반대쪽 물음을 얹었다. 호스트용 칩은 88코어쯤에 아주 빠르다. 그런데 같은 칩을 에이전틱 자리에 옮기면, 빠른 사람 88명이 맞는지 아니면 128명·256명·288명·512명이 맞는지를 다시 물어야 한다. 작업의 성격 때문이다. 웹에서 무언가 가져오는 데 2~3초가 걸리고 그동안은 기다릴 뿐이라면, 코어가 느려도 상관없다. 진행자V는 "이제 직원 한 명당 비용 문제"라고 줄였다.
그래서 결론은 「정답 없음」이다. 데이터센터를 랙으로 채울 때 코어가 많고 느린 칩 랙과 코어가 적고 빠른 칩 랙을 섞지 못할 이유가 없다고 진행자V는 말했다. 그리고 이렇게 닫았다. "내 생각엔 맞는 CPU 하나 같은 건 없다. 전부 맞는 CPU 다. 코어당 비용과 총소유비용, 그리고 그것들을 어떻게 같이 쓰느냐의 문제다". 인텔이 올여름 에이전틱 AI 용으로 P랙과 E랙을 나눠 내놓은 것도 같은 판단이라고 진행자A는 짚었다. 진행자V는 타이완에서 만난 인텔 발표자가 워크로드마다 어떤 구성이 맞는지 권해 주더라고 전했다.
파는 회사에는 이것이 무슨 뜻일까. 여기서부터는 이 글의 읽기다. 사양 한 줄로 우열이 갈리던 시절에는 카탈로그가 곧 영업이었다. 맞는 칩이 워크로드마다 다르면, 파는 물건이 칩에서 「구성 제안」으로 바뀐다. 진행자A가 하이퍼스케일러와 일반 기업을 갈라 본 것도 이 축이다. 하이퍼스케일러는 메모리 최적화처럼 워크로드를 정해 놓고 거기 맞는 모양을 골라 사고, 일반 기업은 두루 쓸 만한 것을 산다.
랙은 넷인데 지휘하는 층이 비었다
진행자V가 곁가지로 꺼낸 Cerebras 의 랙 단위 제품 발표가 여기서 축이 된다. 웨이퍼 하나가 곧 칩이던 회사가 이제 연산의 단위를 랙으로 말한다. 그러면 데이터센터에 성격이 다른 랙이 나란히 선다. GPU 랙, Cerebras 랙, 인텔 P코어 랙, E코어 랙.
진행자V는 천재도 셋으로 나눴다. ① 아주 빠른데 기억을 못 하는 천재 ② HBM 을 많이 달아 맥락을 넓게 쥐지만 그만큼 빠르지는 않은 천재 ③ 느리게 오래 생각하고 나중에 답을 들고 오는 천재. 셋째 천재를 찾는 수요가 실제로 있다는 근거로 그는 과학과 의학 문제, 그리고 날씨를 들었다. 날씨 자체가 느리니 추론이 느려도 괜찮다. 진행자A는 야간 배치 작업을 보탰다. 그런 일이라면 P코어 묶음 위에서 LLM 을 돌려도 된다.
여기서 빈자리가 드러난다. 빠른 천재와 보통 천재와 CPU 에 걸쳐 일을 나눠 주는 소프트웨어가 지금 있느냐고 진행자A가 물었다. 진행자V는 Nvidia Dynamo 가 있지만 그것은 천재를 잘 굴리는 층이지 그 위층이 아니라고 선을 그었다. 후보로 Modular 를 들었지만 Modular 도 아직 천재를 굴리는 층에 가까운 것 같다고 했고, 진행자A는 Mojo 로 CPU 와 GPU 를 한 언어로 짤 수 있다는 것까지만 알고 조율 기능은 잘 모르겠다고 했다. 진행자V가 그린 최종 모습은 AMD 랙과 Nvidia 랙을 한 데이터센터에서 섞어 쓰고, 그 위에서 CPU 와 GPU 사이의 데이터 이동까지 관장하는 층이다. 그런 층이 있는지 없는지는 둘 다 모른다고 했다. 진행자A는 5월쯤으로 기억하는 대화에서 만난 Gimlet Labs 가 그 자리에서 일한다고 전했다. 신생 GPU 임대 사업자가 서로 다른 하드웨어에 일감을 잘 나눠 원가를 낮출 수 있느냐가 그들의 물음이었다.
진행자V는 사용자층이 넓어진다는 데 무게를 뒀다. 토큰을 아껴 쓰는 기술 애호가만이 아니라 AI 를 쓸 생각이 없던 사람들까지 들어오면, 그 한 사람 한 사람에게 가상머신이 하나씩 배정된다. 그 가상머신마다 에이전트 10개·50개·100개가 돌면서 CPU 와 GPU 를 부른다. 진행자A가 이것을 수로 옮겼다. "1천만 명이 이걸 한다는 게 말도 안 되는 수는 아닐 것 같다. 그러면 클라우드에서 코어 1천만 개 위에 가상머신 1천만 개가 돈다. 거기에 가상머신마다 에이전트를 100개씩 띄우면 갑자기 코어 10억 개가 필요해진다".
코어 10억 개의 곱셈
산수의 항은 셋이고, 항마다 조건이 다르다. ① 사용자 수는 쉬운 버튼이 정말 쉬운지에 달렸는데, 월 200달러라는 값이 지금은 그 앞을 막고 있다. ② 사람당 가상머신 하나는 제품이 그렇게 만들어져서 성립하는 것이지 법칙이 아니다. ③ 에이전트 100개가 코어 100개를 뜻하려면 에이전트 하나가 코어 하나를 붙들고 있어야 한다. 그런데 진행자A가 든 예는 웹 응답을 2~3초 기다리며 앉아 있을 뿐인 작업이었다. 기다리는 일이라면 코어 하나에 에이전트 여럿을 얹을 수 있으니, 셋째 항이 가장 헐겁다.
그래도 방향은 남는다. 이 회차가 정말로 말하는 것은 코어 10억 개라는 수가 아니다. 에이전트가 늘면 GPU 말고 다른 하드웨어도 같이 는다는 것, 그리고 지금 당장 느는 것은 에이전틱 CPU 라는 이름이 붙은 칩이 아니라 가상머신을 얹는 범용 서버 CPU 라는 것이다. 진행자V가 인텔의 2월 실적 발표를 끌어온 이유가 이것이다. 에이전트가 세상에 나온 것이 작년 12월인데 그 짧은 사이에 CPU 수요가 몰렸고, 인텔조차 그런 게 올 줄 몰랐다고 했다.
이 회차가 말하지 않은 것은 넷이다. ① 실제 비중. 진행자A가 회차를 닫으며 남긴 물음이 그대로다. 이 일들이 에이전틱 CPU 라고 이름 붙은 것 위에서 얼마나 돌고 범용 기계의 가상머신에서 얼마나 도는지 모르니, Anthropic 이나 OpenAI 가 알려 주면 좋겠다고 했다. ② 에이전트 하나가 코어를 얼마나 오래 붙들고 있는지 잰 값이 없다. ③ 조율 소프트웨어가 이미 있는지 없는지를 둘 다 확인하지 못했다. ④ 가격과 원가. 월 200달러가 어떻게 나온 값인지, 그 안에서 CPU 에 얼마가 가고 토큰에 얼마가 가는지는 이 회차에 없다.
판단이 바뀌는 조건은 셋이다. ① 제품 구조가 가상머신에서 컨테이너나 요청 단위 실행으로 옮겨 가면, 사람당 코어 하나라는 전제가 무너지고 6절의 산수를 통째로 다시 세워야 한다. ② 인텔의 P랙·E랙이 실제로 얼마나 팔리는지가 4절의 「정답 없음」이 시장에서도 맞는지를 정한다. 지금은 파는 회사가 그렇게 말한 단계다. ③ 조율 층을 누가 쥐느냐가 정해지면 5절의 빈자리가 사라진다. 그 층을 GPU 공급자가 내놓으면 여러 종류의 랙을 섞을 이유가 줄고, 독립 소프트웨어 회사가 내놓으면 3절에서 갈라 놓은 CPU 두 종류가 실제로 따로 팔릴 근거가 생긴다.