이번 Semi Doped 회차는 퀄컴 투자자 행사 하나를 처음부터 끝까지 파고든다. 진행자 Austin Lyons(이하 진행자A)는 뉴욕 현장에 있었고 Vik Sekar(이하 진행자V)는 유튜브 중계로 같은 발표를 봤다. 두 사람의 물음은 손전화로 큰 회사가 데이터센터에서 돈을 벌 수 있느냐에서 시작해, 늦게 들어오는 회사가 무엇을 걸어야 고객이 쳐다보느냐, 그리고 퀄컴이 건 그것이 만들어지는 물건이냐로 옮겨 간다.
손전화 쪽과 그 밖 쪽의 자리 바꿈
발표의 핵심은 CFO 자료의 도넛 세 개였다. 2025 회계연도에는 손전화가 매출의 3분의 2, 자동차와 IoT가 3분의 1이었다. 2027년 목표는 대략 반반이고 여기서부터 데이터센터가 들어온다. 2029 회계연도에는 자동차·IoT·데이터센터가 3분의 2, 손전화가 3분의 1이 된다. 퀄컴 회계연도는 9월 마지막 일요일에 시작하니 2027 회계연도는 달력으로 2026년 안에 들어간다. 반반이 되는 시점이 발표를 들을 때 느껴지는 것보다 한 해 가깝다.
진행자A가 이 숫자의 무게를 짚었다. 회사 이름부터가 Quality Communications인데, 데이터센터와 자동차에서 벌 돈이 통신 회사로 살아온 역사 전체를 합친 것보다 커질 수 있다는 것이 이번 발표의 주장이다.
들어갈 수 있느냐는 물음에 진행자V는 못 할 이유가 없다고 답했다. CPU와 NPU가 있고, Alphawave 인수로 구리와 광 SerDes, PCIe Gen 6, CXL, 800기가·1.6테라 이더넷, HBM·DRAM IP, UCIe 칩렛 IP가 한꺼번에 들어왔다. 수십억 대를 손전화 시장에 내보낸 경험도 있으니 OpenAI나 Anthropic이 이제부터 칩 회사라고 선언하는 것과는 출발선이 다르다.
다만 진행자A가 요건 넷을 세웠다. IP, 인재, 제조 역량, 기술적 차별점이다. 앞의 셋은 있고 모자란 것은 인수로 메웠는데 넷째가 남는다. 싸다는 것도, 남들이 마침 물건이 없다는 것도 오래가지 않는다. 예가 AMD의 Instinct다. 칩에 붙이는 HBM 용량을 다르게 정한 결정 하나로, Instinct 여덟 장이면 되는 작업에 Nvidia GPU는 열여섯 장이 필요한 구간이 생겼다. Groq와 Cerebras도 부작용을 여럿 감수하는 설계로 응답이 빨라야 하는 작업에서 GPU를 이겼다.
랙 하나로 채우던 것이 일별로 갈린다
발표 전체를 꿴 말은 분해된 추론이었다고 진행자V는 정리했다. 예전에는 Blackwell GPU와 Vera CPU가 든 Nvidia 랙으로 데이터센터를 채워야 했다. 지금은 CPU만 넣은 랙을 따로 세우고, 지연이 짧아야 하는 디코드는 Cerebras나 Groq LPU 랙에 맡기고, 메모리 대역폭이 넓은 퀄컴 추론 칩 랙을 하나 더 세워 디코드만 시키면서 프리필은 계속 Nvidia GPU에 남길 수 있다.
진행자A는 여기서 후발 주자의 전략이 나온다고 봤다. 추론이 프리필과 디코드로 나뉘면 늦게 온 회사가 디코드 하나만 겨냥해 아주 다른 물건을 만들 수 있다. AI ASIC 스타트업이 그렇게 발을 걸쳤다. 그래서 퀄컴이 지금 노려야 하는 판매는 흰 랙으로 가득 찬 자기 데이터센터가 아니라, Nvidia GPU로 이미 채워진 남의 데이터센터에 랙 몇 개를 밀어 넣는 일이다. 데이터센터 브랜드 이름은 Dragonfly다.
옆에 붙일 것인가, 위에 얹을 것인가
이번 발표의 주인공은 HBC(고대역폭 컴퓨트)였다. 진행자V가 원리부터 설명했다. Cerebras나 Groq LPU가 쓰는 SRAM은 대역폭이 초당 100테라바이트 언저리인데 HBM은 그 10분의 1인 초당 8테라바이트쯤이다. HBM 스택은 GPU나 XPU 옆에 앉아 2,000개쯤 되는 레인으로 연결되고 그 연결에는 TSMC CoWoS 같은 고급 패키징 기판이 든다.
옆에 붙이는 방식에는 상한이 있다. 다이의 한 변, 이른바 쇼어라인에 낼 수 있는 레인 수가 정해져 있다. 위에 올리면 칩의 면 전체가 접점이 되어 레인이 수만 개, 많게는 10만 개까지 늘어난다. 레인이 100배면 대역폭도 100배라는 것이 퀄컴의 계산이다. 진행자A는 부엌에 빗댔다. 가중치와 활성값과 KV 캐시가 디코드 내내 GPU 옆 HBM을 오가니, 냉장고를 차고에 두고 재료를 하나씩 가지러 다니는 셈이다.
메모리 밑에 무엇이 앉나 — 읽기 둘
문제는 메모리 밑에 무엇이 앉느냐인데 두 진행자의 읽기가 서로 달랐다. 진행자A는 메모리를 XPU 위에 직접 얹은 것이 아니라, 메모리 아래에 별도 로직 칩을 두고 그 칩을 XPU 옆에 붙인 구조로 봤다. 그 로직 칩이 추론에서 늘 도는 소프트맥스 같은 원시 연산을 대신 처리한다는 읽기다. 뜨거운 XPU 위에 메모리를 얹지 않아 열 문제를 피하면서 대역폭을 많이 먹는 조각만 메모리 바로 밑에서 처리할 수 있다.
진행자V는 다르게 봤다. 고급 패키징이 더 이상 필요 없고 표준 피치 패키지면 된다고 발표에서 말했으니, 아래 로직은 행렬 곱을 다 하는 온전한 XPU여야 한다는 것이다. d-Matrix가 이미 그렇게 한다고 그는 짚었다. Raptor는 DRAM 다이 아래에서 연산을 전부 하는 칩이다. 옆에 그려진 SoC는 손전화나 자동차 SoC처럼 행렬 곱 말고 다른 일을 맡을 것이라고 봤다. 누가 맞는지에 따라 퀄컴이 메모리 회사와 TSMC 사이에서 무엇을 맡길지가 달라진다.
층을 올리면 층당 용량이 뒤집힌다
발표에서 CoWoS가 필요 없어졌다고 한 대목을 진행자V는 그대로 받아들이지 않았다. "그들은 패키징 문제를 정말로 푼 것이 아니다. 다른 자리로 옮겼을 뿐이다". 진행자A가 그 자리를 짚었다. XPU 옆에서 XPU 위로 옮겼는데 위가 더 어렵다.
무엇이 어려운지는 크기에서 나온다. 메모리 밑에 앉는 XPU는 레티클 크기의 큰 다이다. 850제곱밀리미터쯤, 아무튼 800제곱밀리미터는 넘는다. 그 위에 얹을 DRAM 다이가 얼마나 커야 하는지, 열이 오르내리는 동안 평탄도를 어떻게 유지할지가 남는다. 범프가 뜯겨 나가지 않으려면 위아래가 함께 데워지고 함께 식어야 한다. 발표 그림에 LPDDR 스택이 여러 개 그려졌지만 Raptor 1세대도 메모리 한 층일 것이라고 진행자A는 봤다.
층을 올리는 순간 용량 계산도 뒤집힌다. 진행자A가 설명한 대목이다. LPDDR을 쓰는 이유는 층당 용량이 HBM보다 크다는 것인데, LPDDR 위에 LPDDR을 쌓으면 그 순간 사실상 HBM이 된다. HBM의 층당 밀도가 낮은 것은 관통 실리콘 비아 때문이다. 비아를 뚫으면 둘레 일정 거리에 메모리 셀을 놓지 못하는 금지 구역이 생긴다. 한 층만 쓰면 밀도가 나오지만 두 층부터는 층당 용량이 절반쯤으로 떨어져, 넷은 쌓아야 쓸모가 생긴다. "아무도 이야기하지 않는 복잡한 대목이 여기 있다".
진행자V는 산업이 이미 비슷한 문제를 풀고 있지 않느냐고 물었다. HBM4나 HBM4E도 커스텀 로직 베이스 다이 위에 메모리를 쌓는다. 진행자A의 답은 크기와 발열량이 다르다는 것이었다. HBM 아래의 로직 다이는 GPU 다이만큼 크지 않고 행렬 곱을 끝없이 도는 XPU만큼 일하지도 않는다. 투자자 행사라 기술 속으로 들어가지 않았으니 전용 행사든 논문이든 Hot Chips 발표든 답이 나왔으면 한다고 두 사람은 함께 바랐다.
가속기 로드맵 — HBC 는 2027년부터
가속기 로드맵은 이렇다. AI 100은 오래전 물건이고 AI 200은 2026년 샘플이지만 HBC가 없다. HBC 1세대가 들어가는 것은 2027년의 AI 250, 2세대는 2028 회계연도의 AI 300이다. AI 300에는 UALink나 E-sun 같은 스케일업 패브릭과 구리·광 스케일아웃이 붙고, 스케일업 CPO는 그 뒤라 했으니 2029년쯤이 되겠다고 진행자A는 옮겼다.
첫째가 인터커넥트다. 진행자V는 Nvidia가 Mellanox를 사서 시스템 회사로 넘어간 일을 놓고 퀄컴의 Mellanox가 무엇이냐고 물었고 답을 Alphawave로 봤다. Alphawave는 SerDes와 IO를 라이선스하거나 아예 커스텀 XPU를 대신 만드는 사업까지 했다. 그래서 퀄컴이 가져온 것에는 하이퍼스케일러와 맺어 둔 고객 관계와 로드맵도 들어 있다. 이름을 밝히지 않은 커스텀 실리콘 고객이 둘 있다고 했고, 발표 자리에 Satya Nadella와 Mark Zuckerberg가 나왔으니 Meta와 Microsoft가 함께 일한다는 뜻이라고 그는 읽었다. CFO는 2028년 총매출 50억 달러 가운데 10억 달러를 말했고, 하이퍼스케일러 각각에서 10억 달러씩 20억 달러가 이미 정해져 있다고 진행자V는 기억했다.
둘째가 소프트웨어다. 최근 발표된 Modular 인수를 진행자V는 랙 단위 해법의 필수 조각으로 봤다. Mojo가 CUDA 자리에, 모델 서빙을 맡는 MAX가 Triton이나 TRT-LLM 자리에, KV 캐시 오프로딩을 다루는 클라우드 제품이 Nvidia Dynamo 자리에 있다. 이 층으로 여러 회사의 하드웨어를 한 해법 안에 섞어 쓰는 것이 그들이 말하는 다중 실리콘 토큰 공장이다. 진행자A는 좋은 결정이라고 봤다. 어디서나 돌린다는 약속은 늘 있었지만 높은 추상 층에서 번역하니 최적화가 안 됐는데, Chris Lattner와 그 팀은 Clang과 LLVM과 Swift를 만든 이력에 MLIR까지 있어 스택 아래까지 내려가 걸 수 있다.
셋째가 CPU다. C1000은 코어당 5기가헤르츠에 코어 250개 이상, PCIe Gen 7과 LPDDR을 쓰고 에이전틱용과 범용과 AI 헤드 노드용 세 가지로 나온다. Mark Zuckerberg가 영상으로 나와 Meta가 C1000을 넣겠다고 했고 다세대 공급 합의도 있다. 다만 객석의 질문이 아팠다. 지금 에이전틱 AI용 CPU가 모자란데 제품은 2028년이니 그때도 좋은 CPU냐는 것이었다. Alphawave의 Tony Pialis는 퀄컴에 최고의 엔지니어가 있어 언제 나오든 최고일 것이라 답했고 진행자V는 걸러 듣겠다고 했다. 진행자A의 정리는 더 냉정하다. 지금 오는 파도를 놓치고 있으니 CPU 공급이 넉넉해진 뒤에는 성능이나 전력이나 원가로 다퉈야 한다.
진행자A는 행사장에서 CEO Cristiano Amon과 CFO Akash에게 직접 물었다. HBC는 HBM을 덜 쓰고 DDR을 더 쓰는데 DDR은 HBM보다 웨이퍼를 덜 먹는다. 한쪽으로는 구성이 HBM에서 DDR로 되돌아가고 다른 한쪽으로는 엣지에 훨씬 많은 메모리를 넣을 길이 생긴다. 2028년부터 2030년까지 메모리 시장을 어떻게 봐야 하느냐는 물음이었다. Amon의 답은 HBM이 없어지지 않는다는 것이었고, 워크스테이션부터 노트북과 자동차까지 온프레미스에서 LPDDR 수요가 늘어난다는 점을 흥미로운 대목으로 들었다고 한다.
엣지에서 무엇을 하려는지는 발표에도 있었다. 소프트웨어 정의 차량이라 부르던 것을 이제 AI 정의 차량이라 부른다. 차가 주차장에서 QR 코드를 알아보고 결제까지 하며 시간이 다 되면 스스로 연장하는 예를 들었고 이미 배치됐다고 했다. 진행자A는 한 가지를 보탰다. 지금도 많은 차가 토큰을 만들지만 그 연산은 ADAS와 자율주행에 묶여 있어 다른 데 쓸 수 없다.
두 사람이 본 장기 목적지는 로봇이었고 퀄컴은 그것을 2040년의 1조 달러 기회라고 말했다. 필요한 것을 진행자A가 꼽았다. 배터리로 도니 전력에 묶인 CPU, 가속기, 메모리, 연결성, 소프트웨어 스택이다. 지금 엣지에 없는 것이 값싸고 용량 크고 대역폭 넓은 메모리인데, 오늘의 최전선 모델급을 서너 해 뒤 엣지에 얹을 수 있다면 이야기가 달라진다.
그래서 이 회차는 회사 평가가 아니라 메모리 수요 이야기로 끝난다. 진행자A가 마지막에 남긴 문장이 그것이다. "근접 메모리 연산 때문에 HBM이 죽었다는 말에 넘어가지 마라. 더 많은 메모리다". 연산 가까이에 메모리를 더 붙이는 설계가 자리를 잡으면 HBM은 그대로 필요하고 DRAM은 더 필요해진다. 데이터센터에 로봇과 자동차까지 세면 웨이퍼는 더 든다.
말하지 않은 것은 넷이다. ① 메모리 밑에 무엇이 앉는지. 두 진행자의 읽기가 서로 달랐고 근거는 발표 그림 하나뿐이었다. ② HBC의 실제 대역폭. 레인이 100배면 대역폭도 100배라는 것은 원리 계산이고 제품 수치는 없다. ③ 총소유비용. LPDDR을 얹은 물건이 HBM을 붙인 GPU보다 특정 작업에서 싼지는 다뤄지지 않았는데, 진행자A가 세운 요건이 바로 그 차별점이었다. ④ 2029 회계연도 3분의 2 안에서 데이터센터와 자동차와 IoT가 각각 얼마인지는 나누지 않았다.
판단이 바뀌는 조건은 셋이다. ① 기술 자료다. 논문이든 Hot Chips 발표든 두 사람이 요구한 것이 나오면 3절의 읽기 차이가 정리되고 4절의 열과 평탄도 물음도 답을 얻는다. ② 2027년 AI 250의 실물이다. HBC 1세대가 몇 층을 쌓고 표준 패키징으로 끝나는지가 4절의 관통 비아 산수를 확인해 준다. ③ 고객이다. 커스텀 실리콘 고객 둘이 누구인지, Meta가 C1000을 언제 넣는지가 5절의 50억 달러 숫자가 서는지를 정한다.