← 회차 목록

Arm이 자체 CPU 칩을 파는 이유는 전력 효율이 아니라 코어 수 4배 주장이다

2026-03-27 · Austin Lyons · Vik Sekar
원문 https://www.youtube.com/watch?v=Npi-TLWCz3o · 요약본 저장소
진행 Austin Lyons (Chipstrat) · Vik Sekar (Vik's Newsletter) — Semi Doped 공동 진행. 게스트 없음
⚖ 전략 판전략 컨설턴트 출신 애널리스트의 해설 · claude-opus 가 씀
발표된 수는 코어 4배와 압축 6배로 갈렸지만 실제 물량을 정한 것은 D램 줄 서기 하나다

글로벌파운드리가 타워세미컨덕터에 특허소송을 냈고, 구글 리서치 블로그가 KV 캐시 압축 기법 하나를 다시 꺼냈고, Arm이 35년 만에 자기 이름을 붙인 CPU 칩을 팔겠다고 했다. Semi Doped 진행자 둘, Austin Lyons(이하 진행자A)와 Vik Sekar(이하 진행자V)가 55분 동안 이 셋을 훑었다. 화제는 달라도 걸리는 곳은 같다. 발표된 수 하나가 무엇을 세는 것인지 확인되기 전에 시장이 먼저 움직이고, 그 수가 실제 물량으로 바뀌는 자리에는 아무도 세지 않던 병목이 서 있다.

1 무엇을 다투는지 모르는 채로 5%가 빠졌다

전사에는 방송 시작 10분 전에 휴대폰에 뜬 보도자료를 그대로 읽는 대목이 나온다. 글로벌파운드리가 타워세미컨덕터를 상대로 미국 국제무역위원회와 텍사스 서부지방법원에 소송을 냈고, 스마트폰·자동차·항공우주·통신 인프라에 쓰이는 특허 11건을 침해당했다고 주장한다. 처음 떠올린 것은 광학이나 레이저였다가, 두 회사가 함께 쓰는 RFSOI(고주파용 실리콘온인슐레이터 공정) 기술로 짐작이 옮겨 갔다. 최근 메모리 가격 때문에 휴대폰이 안 팔린다는 점을 거론하며 그것도 쟁점일 수 있다고 했다가 "그냥 모르겠다"고 물러서는 대목도 그대로 남아 있다.

그런데도 주가는 이미 움직였다. 방송 중 확인한 타워세미컨덕터 주가는 그 시점 5% 아래였다. 전사에는 이 회사가 요즘 투자자들에게 인기가 좋은 종목이라는 설명이 나온다. 결국은 우회 설계를 찾아 재무적으로는 "손목 때리기" 정도에 그칠 것이라는 추측이 나오면서도, 곧바로 "누가 잘못했는지도 아직 모른다"는 단서가 붙는다. 특허 싸움은 오래 끌고 이긴 회사도 늘 이기는 게 아니며 변호사만 이긴다는 말도 같은 자리에 있다.

업계에 보이는 것은 소송의 승패가 아니다. 진행자A가 궁금해한 것도 판결이 아니라 언제 특허를 꺼내 들지 정하는 셈법이었다. 꺼내 드는 데 드는 비용과 정신 분산, 그리고 얻을 것과 잃을 것을 나란히 놓고 재는 자리다. 공정 기술은 회사 하나에 갇혀 있지 않고 사람과 장비를 따라 흐르는데, 그 흐름을 뒤늦게 법정에서 세우려 할 때 드는 비용을 미리 세어 둔 사람은 없다. 그 셈법을 아는 IP법 전문가를 한 회차 불러오자는 합의로 화제가 닫혔다.

2 1년 된 논문이 블로그 하나로 뉴스가 됐다

회차의 문을 연 물음은 진행자V의 것이다. 새 추론 가속기가 나와도, 새 알고리즘이 나와도 왜 늘 메모리 회사 주가부터 빠지느냐. 알고리즘이 바뀌었다고 광학 회사를 파는 사람은 없다. 진행자A는 학생 때는 혁신 소식이 반가웠는데 주식을 들고 나면 같은 소식이 공포가 된다고 받았다. 그 사이에도 GPU는 어제보다 더 많은 HBM을 쓰고 있다.

TurboQuant 자체는 새 소식이 아니었다. 근거 논문은 2025년 4월 아카이브에 올라와 1년 넘게 먼지를 뒤집어쓰고 있었고, 연구자들에게는 진작 읽힌 글이었다. 달라진 것은 구글 리서치가 그림과 쉬운 설명을 붙여 블로그에 올렸다는 사실 하나다. 진행자V는 자기도 아카이브에서 봤다면 그냥 지나쳤을 것이라고 인정했다. 투자자의 눈에 든 시점과 기술이 나온 시점 사이에 1년이 비어 있었다.

수는 둘이다. FP16으로 저장하던 KV 캐시(어텐션이 앞 토큰들의 정보를 계속 쌓아 두는 저장소)를 6배로 줄였고, H100에서 재니 추론이 8배 빨라졌다. 진행자V가 놀란 지점이 이 8배다. HBM 대역폭이 초당 8테라바이트인데 Groq의 SRAM 구현이 초당 80테라바이트로 열 배 빠른데, 캐시 압축만으로 추론이 열 배 빨라지는 것이냐고 되물었다. 진행자A가 왜 압축이 속도까지 올리느냐고 묻자 답은 "둘 다"였다. 계산에 쓰는 비트도 줄고 불러오는 데이터도 준다.

16자리를 3자리로 줄이는 손질

① 무작위 행렬 ② 거리와 각도 ③ QJL 변환 원래 16자리 줄인 뒤 3자리 이 논문이 새로 얹은 자리
무작위 행렬은 점들 사이 거리와 각도는 그대로 두면서 유난히 큰 값 몇 개를 고르게 편다. QJL 을 거치면 거리는 한 자리, 각도는 두세 자리가 된다. 각도가 0에서 128까지 흩어지면 일곱 자리인데 여덟 개로 몰면 세 자리다.

원리는 두 겹이다. ① PolarQuant는 숫자 뭉치를 좌표평면의 점으로 보고 가로세로 대신 거리와 각도로 바꿔 적는다. 그 전에 무작위 행렬을 한 번 곱해 두는데, 점들 사이 거리와 각도는 그대로 두면서 유난히 큰 값 몇 개를 전체에 고르게 펴는 손질이다. 이 큰 값들 때문에 매 단계 숫자를 다시 눌러 담는 정규화가 필요했고, 정규화가 메모리 부담을 얹고 있었다. ② QJL 변환을 거치면 거리는 플러스냐 마이너스냐 한 자리로 줄고, 각도는 몇 개 값 근처로 몰려 두세 자리면 적을 수 있다. 진행자V가 든 예가 알기 쉽다. 각도가 0에서 128까지 흩어져 있으면 일곱 자리가 필요한데, 여덟 개로 몰아 놓으면 세 자리로 끝난다. 16자리로 적던 것을 세 자리로 적게 된다.

이 설명에는 화자 자신의 단서가 앞뒤로 붙어 있다. 시작할 때 "저는 ML 연구자가 아니라 제 이해도 좀 불안정하다"고 밝혔고, 마치면서는 "이쯤이면 다들 졸았을 것"이라고 웃었다.

3 압축분은 절감으로 안 가고 컨텍스트로 간다

진행자A는 제품관리자 시절의 반응을 그대로 재연했다. 엔지니어가 와서 KV 캐시를 절반으로 줄였다고 하면 "그럼 100만 토큰 대신 200만 토큰 컨텍스트를 달라"고 답했을 것이고, 실제로는 150만쯤에서 타협했을 것이라고 했다. 줄어든 자리는 비어 있지 않다. FP32에서 FP16, FP8, FP6, FP4로 내려온 흐름 내내 같은 일이 벌어졌고, 그렇게 아낀 자리에 더 많은 가중치와 더 긴 컨텍스트가 들어갔다.

이력이 그 편이다. 진행자V는 GQA(그룹 쿼리 어텐션)와 딥시크의 MLA(멀티헤드 잠재 어텐션)도 KV 캐시를 크게 줄인 기법이었다고 짚었다. "딥시크 모멘트"가 2025년 초였다고 기억하며 "내가 맞다면"이라는 단서를 붙였고, 그 뒤로도 HBM 수요는 줄기는커녕 계속 늘었다고 말했다. TurboQuant 이전에도 4배쯤 압축한 연구는 있었는데 블로그에 안 오르니 아무도 몰랐을 뿐이다.

줄여서 생긴 여유가 가는 곳 셋

KV 캐시를 6배 줄여 생긴 여유 ① 컨텍스트를 늘린다 ② 같은 설비로 사용자를 더 ③ 노트북·엣지로 내린다 셋 다 메모리를 덜 사는 데로 안 간다 절감으로 안 가는 이유
엣지로 내리는 길은 정보 손실 없이 된다며 「건초더미에서 바늘 찾기」 벤치마크를 근거로 들었다. 셋 중 어느 쪽으로 가도 메모리를 덜 사는 결과에는 닿지 않는다.

여유가 흘러가는 곳은 셋이다. ① 같은 하드웨어에서 컨텍스트를 늘린다 ② 하이퍼스케일러라면 같은 설비로 동시 사용자를 더 받는다 ③ 일부 작업을 노트북이나 엣지 기기로 내린다. 진행자V는 이 방식이 정보 손실 없이 ③을 가능하게 한다며 구글이 제시한 "건초더미에서 바늘 찾기" 벤치마크 점수를 근거로 들었다. 셋 중 어느 쪽으로 가도 메모리를 덜 사는 결과에는 닿지 않는다.

덤으로 붙은 관측이 하나 더 있다. 진행자A는 HBM3를 단 호퍼 H100이 이런 소프트웨어 덕에 오히려 더 쓸모가 커졌다고 봤다. 감가상각으로 헐값이 될 하드웨어라던 물건이 소프트웨어 한 겹으로 수명을 늘린다. 계층 구조 자체는 남는다. SRAM·HBM·DRAM·SSD 순서는 그대로 가고, 아래 계층이 좋아져도 가장 자주 꺼내 쓰는 것은 계속 비싼 자리에 둔다.

4 Arm이 발표한 4배는 칩이 아니라 코어를 센 수다

기가와트당 CPU 코어

3천만 에이전틱 AI 이전 1억2천만 이후 같은 전력 안에서 기가와트당 CPU 코어 Arm 이 든 수
에이전틱 AI 가 도구 호출과 웹 탐색 같은 조율 작업을 CPU 에 얹는다는 것이 앞의 논리다. 막대 높이는 두 값의 비율이다. 이 수를 무엇으로 셌는지는 전사에 없다.

행사에서 Arm이 편 논리는 순서가 뚜렷했다. 에이전틱 AI는 도구 호출과 웹 탐색 같은 조율 작업을 CPU에 얹는데, 헤드노드 CPU만으로는 감당이 안 되고 GPU를 계속 먹이려면 바로 옆에 CPU가 더 있어야 한다. 그래서 에이전틱 AI 이전에는 기가와트당 CPU 코어 3천만 개면 됐지만 이후에는 1억2천만 개가 필요하다, 같은 전력 안에서 코어가 4배 든다. 그러면 이 코어를 누구한테 사느냐가 다음 물음이 되고, 그 자리에 Arm이 손을 든다. IP도 CSS(미리 구현해 둔 컴퓨트 블록)도 이미 있으니 칩으로 만들어 팔면 된다.

진행자V가 붙잡은 것은 단어 하나다. 발표자가 CPU라고 하지 않고 코어라고 했고, 에이전틱 AI CPU에서는 칩 안의 코어 수가 핵심 지표다. 근거는 둘이다. ① 에이전트 하나가 코어 하나를 쓰고 어려운 일이면 둘까지 쓴다 ② 메모리 도메인을 나눠 쓰면 지연이 생기니 NUMA(코어마다 가까운 메모리를 따로 두는 구조)까지 챙겨야 한다. 자기 뉴스레터에 이미 쓴 지표라고 밝혔다. 젠슨 황이 강조한 코어 하나의 성능은 워크로드에 따라서만 중요하다고 선을 그었다.

코어 수를 칩 수로 옮겨 보면

무엇을 얼마나 랙 하나 트레이 42개 × CPU 8개 코어 4만5천 개쯤 칩 하나 Neoverse V3 코어 136개 그래서 CPU 액체냉각 330개 · 공기냉각 60개
코어 4만5천은 화자가 「그게 얼마였더라」 하며 더듬은 근사치다. 칩당 136코어로 나눈 것은 진행자V 의 계산이고, 베라 루빈 랙이 이미 1대1이라 4배 주장이 맞으면 4대1까지 간다는 데까지만 갔다.

수를 코어에서 칩으로 옮겨 놓으면 규모감이 달라진다. Arm이 함께 내놓은 액체냉각 랙은 OCP 더블와이드 규격에 트레이 42개, 트레이당 CPU 8개이고 코어는 4만5천 개쯤이라고 기억을 더듬어 말했다. 진행자V가 칩 하나에 Neoverse V3 코어 136개를 기준으로 나눠 보니 액체냉각 랙은 CPU 330개, 공기냉각 랙은 60개였다. 자기 계산으로 베라 루빈 랙의 CPU 대 GPU 비율이 이미 1대1이었으니 Arm의 4배 주장이 맞으면 4대1까지 갈 수 있다고 추정하면서, 정확한 계산은 듣는 사람이 직접 해 보라고 넘겼다.

5 전력 효율 논거는 GPU 랙 옆에서 서지 않는다

Arm이 늘 앞세우는 논거는 명령어 집합이 단순해 전력을 덜 먹는다는 것이다. 진행자V는 이 대목을 받지 않았다. GPU 랙이 어마어마한 전력을 태우는 데이터센터를 짓는 상황에서 CPU 하나가 효율적인지 아닌지는 시스템 전체에서 큰 역할을 못 한다. 진행자A도 몇 퍼센트를 놓고 다투는 것 아니냐고 동의하면서, 정작 전력을 크게 태우는 것은 망과 데이터 이동이라고 덧붙였다.

소프트웨어 호환성 논거도 얇아졌다. 진행자A는 호퍼 초기에는 헤드노드 CPU로 인텔 제온이나 AMD x86이 많이 쓰였지만 다음 세대 그레이스 블랙웰부터는 대부분 Arm으로 넘어갔고, AI 워크로드는 이미 Arm 위에서 돈다고 짚었다. 진행자V는 캐드언스 같은 EDA 툴이 맥 실리콘에서 도는지 자기도 모르겠다고 인정하면서 이런 틈새 도구 때문에 x86이 아직 조금 앞설 수 있다고 했다. 그러면서도 시간이 갈수록 덜 중요해지는 문제라고 스스로 정리했다. 무대에 오른 메타 엔지니어(성이 Saab이라고 들렸다고 진행자A가 전했다)도 포팅이 예전엔 걱정거리였지만 LLM 덕에 훨씬 쉬워졌다고 말했다.

그러면 남는 논거는 코어 수 하나인데, 하필 그 자리에서 Arm이 유리하지 않다. 전사에는 AMD의 Venice Dense가 칩당 코어 256개에 스레드 512개인 반면 이번 Arm AGI 칩은 코어 136개뿐이고 멀티스레딩 언급은 없었다는 지적이 나온다. "있었으면 발표했을 텐데 못 봤다"는 추측이 붙는다. 진행자A는 옛 서버 랙 열 개를 하나로 줄인다는 AMD의 오랜 논리가 이번 에이전틱 AI 랙 이야기와 그대로 맞아떨어진다며, AMD와 인텔이 나서서 자기들 이야기를 해야 한다고 촉구했다.

6 이익률은 50%로 오르고 물량은 2028년으로 밀린다

같은 매출에서 가져가는 금액

5% IP 만 10% CSS 까지 50% 직접 만들어 팔면 CPU 가 10억 달러어치 팔릴 때 이번에 고른 길
막대 높이는 세 값의 비율이다. 라이선스 사업의 순이익률은 이미 98~99%에 가깝고, 직접 팔면 이익률은 절반으로 내려가지만 들어오는 금액은 크게 는다.

Arm이 보여준 도표 하나가 사업모델을 바꾸는 이유를 다 담고 있다. CPU가 10억 달러어치 팔릴 때 IP만 라이선스하면 5%인 5천만 달러, CSS까지 얹으면 10%인 1억 달러, 직접 만들어 팔면 50%인 5억 달러를 가져간다. 라이선스 사업의 순이익률은 이미 98~99%에 가깝다. 이익률은 절반으로 내려가지만 통장에 들어와 급여를 주는 데 쓰는 금액은 크게 늘어난다.

문제는 시점이다. "첫 CPU를 내놓기에 역사적으로 기막힌 시점이다, 수요는 하늘을 찌르는데 공급은 부족하니까"라는 말이 나온 직후에, 정작 Arm이 매출 10억 달러 규모에 닿는 시점을 2028년으로 잡았다는 대목이 붙는다. 지금 실어 내야 하는데 왜 2028년 이야기를 하느냐고 되물었다.

늦어지는 이유가 이 회차에서 가장 업계다운 대목이다. 현장에서 나온 설명은 메모리 부족이었다. 고객들이 줄 뒤에 서 있어서 이 CPU를 늘려 쓰기가 어렵다. 칩 자체도 이미 물량이 넘치는 3나노 공정으로 만든다. 코어가 4배 필요하다는 주장을 Arm이 스스로 세워 놓고, 그 코어를 실어 나를 D램과 웨이퍼를 못 구해 2년을 기다린다.

같은 자리에서 2절과 3절 이야기가 겹친다. 압축이 만든 여유는 컨텍스트로 흡수되어 메모리 주문을 줄이지 않았고, 그 메모리 부족이 다시 CPU 물량을 막는다. 발표된 수는 코어 4배와 압축 6배로 각각 늘고 줄었는데, 두 화제의 실제 물량을 정한 것은 D램 줄 서기 하나다.

7 이 회차가 말하지 않은 것과 무엇이 나오면 판단이 바뀌나

말하지 않은 것은 넷이다. ① Arm의 3천만·1억2천만을 누가 어떻게 셌는지 근거가 안 나왔다. 전사에는 이 대목에서 4천만·3천만·1억2천만·1억이 뒤섞여 나오는 구간이 있어, 발표된 수 자체가 옮겨 적히는 사이에 흔들렸다. ② Arm AGI 칩의 전력과 가격이 없다. 코어 136개짜리 칩을 랙에 330개 넣는다는 말은 있어도 그 랙이 몇 킬로와트를 먹는지는 안 나온다. ③ 소송의 쟁점이 무엇인지 아무도 모른다. ④ TurboQuant의 8배를 어떤 모델과 어떤 컨텍스트 길이에서 쟀는지 전사에 없다.

판단이 바뀌는 자리는 셋이다. ① Arm AGI 칩에 멀티스레딩이 있다는 발표가 나오면 4절과 5절의 코어 수 견줌이 뒤집힌다. ② 메모리 공급이 풀려 2028년보다 이른 램프가 시작되면 6절에서 병목이라고 본 자리가 사라진다. ③ 압축 기법이 컨텍스트 확장으로 안 가고 실제로 메모리 주문을 줄이는 사례가 한 번이라도 나오면, 3절이 기대고 있는 이력 근거가 처음으로 깨진다.

회차 자체가 그 자리에서 닫힌다. 진행자 둘은 Arm과 x86과 Nvidia CPU 쪽 사람을 불러 더 정교하게 다투고 싶다고 말했고, 소송은 드라마가 어떻게 전개되는지부터 보자며 미뤘다. 지금 손에 쥔 것은 발표된 수 몇 개와, 그 수를 물량으로 바꿔 줄 D램이 없다는 사실뿐이다.

받은 글을 문장 그대로 싣는다. 원본 insights/semidoped/2026-03-27-arm-cpu-turboquant-strategy.md · 페르소나 전략 컨설턴트 출신 애널리스트