MatX 공동창업자 겸 CEO Reiner Pope가 Semi Doped에 나와 자기 회사가 만드는 칩을 처음부터 끝까지 설명했다. 진행은 Austin Lyons(이하 진행자A)와 Vik Sekar(이하 진행자V) 둘이 맡았다. 이 글은 MatX가 성공할지를 점치지 않는다. 이 대화에 업계 전체의 어떤 사정이 비쳤는지를 읽는다.
2022년 MatX가 투자를 받으러 다닐 때 돌아온 회의론은 두 갈래였다고 Pope는 정리했다. ① 다들 CUDA로 코드를 짜는데 GPU가 아닌 하드웨어를 누가 사겠느냐 ② 세계에서 가장 큰 회사와 어떻게 겨루겠느냐. Pope 는 앞쪽을 길게 다뤘다. 엔비디아의 소프트웨어 해자가 걸려 있고, 지난 수십 년 소프트웨어 산업이 개발 환경 잠금을 어떻게 겪었는지가 그대로 물음이 됐다.
Pope의 답은 지금은 이미 결판이 났다는 것이다. 오래전부터 TPU만 쓰는 구글을 빼면 OpenAI, Anthropic, Meta, X가 모두 엔비디아 위에 있으면서 동시에 다른 플랫폼도 함께 굴린다. TPU를 쓰는 곳도 여럿이고 Cerebras 발표도 있었으며 AMD와 Broadcom 계열 칩도 들어가 있다. 아무도 한 벤더에 묶여 있지 않다는 사실 자체가 종속이 약하다는 증거라는 뜻이다.
왜 이번엔 다른가. Pope는 종속의 세기를 하드웨어에 쓰는 돈과 그 하드웨어를 떠받치는 소프트웨어 인건비의 비율로 봤다. 서비스형 소프트웨어 시대에는 비싼 엔지니어 팀이 인건비의 큰 덩어리였고 컴퓨팅 비용은 그중 일부에 그쳤다. 그래서 엔지니어의 시간이 귀하다는 말이 업계의 상식이 됐다. 지금 프런티어 랩은 컴퓨팅에만 수백억 달러 단위를 쓴다. 커널을 짜는 사람들의 연봉이 아무리 높아도 그 옆에 놓으면 작다.
비율이 뒤집히면 계산도 뒤집힌다. "합리적인 선택은 무엇을 해서든 하드웨어 비용을 낮추는 겁니다". 여기서 업계가 읽을 것은 특정 회사의 우열이 아니다. 소프트웨어 해자의 수명은 그 소프트웨어를 지탱하는 인건비가 하드웨어 청구서보다 클 동안만이라는 것이다. 여러 플랫폼을 같이 쓰는 데는 협상력이라는 덤도 따라온다.
가중치를 어디에 두나
칩 안에서 모델 가중치를 어디에 두느냐를 놓고 시장은 두 갈래로 나뉘어 있었다. 엔비디아, 구글, 아마존은 계산에 쓰는 숫자 뭉치를 전부 HBM(고대역폭 메모리, 칩 옆에 쌓아 붙인 큰 메모리)에 넣었다. Cerebras와 Groq은 가중치를 SRAM(칩 안에 직접 새겨 넣은 아주 빠른 메모리)에 올렸다. SRAM 쪽은 응답이 매우 빠른 대신 담을 수 있는 양이 적다.
Pope는 이 둘을 한 시스템에 합치는 일을 "테이블 위에 그냥 놓여 있던 공짜 돈"이라고 불렀다. 균형을 맞추기가 까다로울 뿐 못 할 일은 아니라고 봤다. 무슨 이득이 있는지는 토큰을 하나씩 만들어 내는 디코드 단계에서 가장 잘 드러난다.
HBM 통행량을 무엇이 쓰나
디코드에서 벌어지는 일은 이렇다. 토큰 하나를 뱉을 때마다 모델 가중치 전체를 메모리에서 연산기 쪽으로 다시 실어 와야 한다. 가중치가 HBM에 있으면 그 왕복이 HBM이 낼 수 있는 통행량의 대부분을 잡아먹는다. 가중치를 SRAM에 미리 올려 두면 그 통행이 통째로 사라진다. "HBM 대역폭을 가중치 불러오는 데 하나도 안 씁니다. 그 대역폭 전부를 KV 캐시에만 씁니다".
KV 캐시는 이미 읽은 문맥을 다시 계산하지 않으려고 쥐고 있는 중간 결과다. 결국 HBM은 문맥을 나르는 데만 쓰이고, 지연시간은 SRAM에 가중치를 둔 Cerebras나 Groq 수준으로 내려간다. 엔비디아도 성격이 다른 랙을 나란히 붙여 비슷한 그림을 만들지만, Pope는 서로 다른 패키지에 나뉘어 있는 데서 오는 손실을 지적했다. 하나의 패키지에 다 넣는 설계가 원리에 더 맞는다고 했다.
지연을 줄이면 문맥이 길어지는 사슬
여기서 Pope가 꺼낸 대목이 이 회차에서 가장 덜 알려진 이야기다. 지연시간이 낮으면 동시에 처리 중인 요청 수가 적어진다. 대기 줄의 길이는 도착 속도에 처리 시간을 곱한 값이라는 오래된 규칙, 리틀의 법칙 그대로다. 처리 시간이 짧으면 줄이 짧아진다.
동시에 처리 중인 요청이 적으면 HBM에 쌓아 둘 KV 캐시도 적어진다. 그 자리를 문맥에 내줄 수 있다. 같은 용량의 HBM으로 더 긴 문맥을 담게 된다는 뜻이다. "저지연은 쓰기 편하다는 이점만이 아니라 처리량 자체를 올립니다". 지연시간과 처리량을 맞바꾸는 대상으로 놓고 보던 습관이 여기서 흔들린다.
같은 메모리 선택이 병렬화 방식의 순위도 바꿨다. 모델을 여러 칩에 나눠 태우는 방법에는 텐서 병렬화, 전문가 병렬화, 파이프라인 병렬화가 있는데 마지막 것은 오래 "천덕꾸러기" 취급을 받았다. 지연시간과 메모리 사용량을 줄이는 이점이 다른 방식만 못했기 때문이다. Pope는 그것이 실은 메모리 시스템을 어떻게 짜느냐의 문제였다고 말한다. SRAM과 HBM을 합치자 파이프라인 병렬화가 처음으로 다른 방식만큼 잘 돌았다.
칩을 재는 다섯 잣대와 그 방침
칩을 평가하는 잣대가 몇 개냐는 물음에 Pope는 다섯을 들었다. ① HBM 대역폭 ② HBM 용량 ③ 행렬곱 처리량 ④ SRAM 대역폭과 용량 ⑤ 칩과 랙 사이를 잇는 인터커넥트 성능이다. MatX의 방침은 이 전부에서 엔비디아 수준에 최소한 맞추고 그중 몇 개에서 크게 앞서는 것이다. 앞선다고 꼽은 곳은 행렬곱, 인터커넥트, SRAM 셋이다. 이 큰 항목들에서 크게 뒤지는 데는 없다고 했고, LLM 과 덜 붙는 항목에서는 뒤질 수도 있다는 유보를 달았다.
왜 전부를 맞춰야 하는지가 이 절의 핵심이다. 고객이 새 칩으로 옮길지 말지는 잘하는 항목이 몇 개냐로 정해지지 않는다. 도저히 못 봐줄 만큼 나쁜 항목이 하나라도 있으면 나머지가 아무리 좋아도 결심이 안 선다. 다섯 곳 어디에도 구멍이 없으면 갈아탈 때 치르는 대가가 크지 않다는 것이 Pope의 논리다. 진행자A는 이 말을 그대로 되짚어 확인했고 Pope는 맞다고 답했다.
그 위에 얹히는 것이 여유분이다. 이득을 최대로 뽑고 싶으면 모델 쪽을 손보면 된다. 어텐션 비중을 줄이고 MLP 비중을 늘리거나, MatX가 제공하는 여러 정밀도 중 낮은 쪽을 쓰는 식이다. 다만 Pope는 고객을 편안한 자리 밖으로 너무 끌어내지 않겠다고 못 박았다. 제품이 시장에 맞으려면 고객이 서 있는 자리로 대체로 찾아가야 한다는 것이다.
인터커넥트에 유독 많이 투자한 이유도 모델 쪽 사정에서 나왔다. 전문가 하나하나가 작고 그중 극히 일부만 켜지는 MoE 모델이 통신량을 결정한다. 전문가를 고르는 라우팅은 되도록 촘촘히 묶인 영역 안에서 끝내는 것이 모두의 방식이고, 그 영역이 클수록 더 큰 MoE 층을 받아낼 수 있다. 엔비디아가 스위치로 모든 트래픽을 모으고 구글이 토러스 배선을 쓰는 것과 달리, MatX는 MoE 층에 맞춘 배선을 따로 설계했다고만 밝혔다.
가장 관심을 보인 쪽이 프런티어 랩이라는 것은 놀랍지 않다. Pope가 든 이유는 둘이다. ① 지출 규모가 가장 커서 새 소프트웨어 스택을 떠안을 셈이 맞아떨어지고 ② 3년에서 5년 앞을 내다보는 시야를 갖고 있다. 맞춤 하드웨어를 사면서 함께 설계하려면 그만한 시간 감각이 있어야 한다. 오늘 선반에 있는 것을 사겠다는 자세로는 이 거래가 성립하지 않는다.
신생 업체에게 남는 문제는 믿음이다. Pope는 믿어 달라는 말이 가는 거리를 냉정하게 봤다. 대신 증거를 내민다. 핵심 아키텍처, 칩 안에서 데이터를 흘려보내며 계산하는 시스톨릭 어레이의 구조, 연산 단위끼리 어떻게 연결되는지, 명령어 집합, 고객에게 주는 소프트웨어 개발 도구까지 비밀유지계약을 걸고 전부 보여 준다. 그러기가 불편하지만 믿음을 얻는 데 크게 보탬이 된다고 했다.
옮겨 붙이는 데 드는 실제 인력도 숫자로 나왔다. 여러 플랫폼을 함께 지원하는 회사들이 플랫폼 하나당 붙이는 인원이 50명에서 100명 선이고, 커널을 짜고 컴파일러와 디버깅 도구를 만드는 상급 인력이다. MatX 위에서도 비슷한 규모를 예상한다. MatX 자체는 100명을 조금 넘는 규모로, 비슷한 프로젝트에 1만에서 2만 명을 붙이는 회사와 대비된다.
그 인력을 누가 대느냐에도 선이 있다. 컴파일러와 디버깅 기반 같은 첫 구간은 MatX가 대신 해 줄 수 있지만, 마지막 구간인 커널 개발은 프런티어 랩이 직접 쥔다. 거기에 모델 아키텍처가 그대로 드러나기 때문이다. 업계에 보이는 것은 이것이다. 맞춤 칩 사업에서 고객이 넘겨주지 않는 것은 물량이 아니라 자기 모델의 모양이고, 공급자가 준비해야 하는 것은 그 마지막 구간이 남을 자리다.
진행자A가 에이전틱 AI와 폭증하는 추론 수요를 두고 다음 칩을 다르게 설계해야 하느냐고 물었다. Pope의 답은 뜻밖에 담담하다. 모델과 사용 방식이 바뀌는 속도는 확실히 빠른데, 그것을 하드웨어에 필요한 변화라는 체로 거르고 나면 "95퍼센트가 잡음"이다. 에이전트도 결국 프리필과 디코드를 할 뿐이다.
수요의 세기는 올라갔다. 에이전트가 오래 생각하는 동안 사용자가 5분이 아니라 30초만 기다리게 하고 싶어졌다. 다만 이건 늘 있던 일이라 놀랄 대목이 아니라고 Pope는 정리했다. 성능 요구가 계속 높아지는 자리에 서 있는 것은 좋은 일이라고 덧붙였다.
정말 바뀐 것은 모델이 놀고 있는 시간의 성격이다. 챗봇에서는 사람이 답을 읽고 다음 메시지를 칠 때까지 30초에서 1분쯤 문맥을 어딘가에 들고 있으면 됐다. 아예 안 돌아올 수도 있었다. 에이전트는 사람 대신 바깥 도구의 응답을 기다린다. 이메일 확인은 몇 초면 끝나지만, 컴파일러를 돌리거나 배치·배선 도구를 돌리는 일은 몇 시간이 걸린다.
그래서 KV 캐시가 실제로 쓰이지 않으면서도 버려서는 안 되는 구간이 길고 들쭉날쭉해졌다. Pope가 에이전트 시대의 가장 큰 변화로 꼽은 것이 여기서 생기는 별도의 보관 시스템 수요다. 메모리 계층에 새 칸이 하나 생긴다는 뜻이고, 이 수요는 연산 성능 경쟁과 다른 곳에서 온다.
MatX가 자기 칩을 설계하면서 AI를 쓰는 방식도 같은 결이다. 칩 설계는 사실상 소프트웨어 개발이고, Verilog는 이상하게 생겼을 뿐 프로그래밍 언어다. AI가 가장 잘 먹히는 자리는 목표가 숫자로 딱 떨어지는 곳이다. 컴파일이 되는가, 면적은 작은가, 전력은 낮은가, 테스트를 몇 개나 통과하는가. MatX는 개발 과정 자체를 그런 꼴에 가깝게 바꾸는 방향으로 손보고 있다. 함수형 프로그래밍에서 나온 소수 언어 Bluespec을 쓰는 이유는 거의 농담처럼 나왔다. "세상에 Bluespec 프로그래머가 워낙 적어서, 그들을 전부 채용하면 그 자체로 경쟁우위가 됩니다".
감당해야 할 규모의 크기
가장 큰 회의론이 무엇이냐는 물음에 Pope가 꺼낸 것은 양의 문제였다. 신생 기업이 대량 생산 체제를 얼마나 빨리 갖추느냐가 앞으로 몇 년의 숙제다. 규모 감각은 이렇게 잡았다. 데이터센터 수요 전망이 여러 기가와트에서 수십 기가와트로 가고 있고, 100기가와트에 언제 닿을지는 자신도 모르겠다고 했다. 엔비디아 칩이 기가와트당 150억에서 200억 달러쯤 팔리니, 여기에 10배나 100배를 곱하면 감당해야 할 규모가 나온다.
이 회차가 말하지 않은 것도 적지 않다. ① 네트워크 배선을 구체적으로 어떻게 짰는지는 밝히지 않겠다고 분명히 했다. ② 지난 10년간 칩 성능 향상의 가장 큰 요인이었다고 본 수치 정밀도 기법도 공개 대상이 아니다. 칩을 낸 뒤 1년이나 2년 늦춰 낼 생각이라고 했다. 어텐션 연구만 내놓는데, 이건 모델 설계자들에게 앞으로 나올 하드웨어의 성격을 미리 알리려는 목적이다.
숫자로 남은 빈칸이 더 크다. ① 칩이 언제 나오는지 ② 어느 공정에서 만드는지 ③ 성능이 실제로 얼마인지 ④ 칩 하나가 얼마에 팔리는지가 이 회차에 하나도 없다. 앞에서 다섯 항목 전부에서 엔비디아 수준 이상이라고 말했지만 그 근거가 되는 측정치는 나오지 않았다. 돈에 관해 나온 숫자는 진행자가 물음에 얹은 투자 유치액 1억 달러와 5억 달러뿐이다.
무엇이 나오면 이 글의 판단이 달라지나. ① SRAM과 HBM을 합친 설계의 이점은 아직 논리로만 서 있으므로, 전력과 비용까지 정규화한 비교치가 나와야 2절과 3절이 검증된다. ② 다섯 항목 전부에서 뒤지지 않는다는 4절의 주장은 엔비디아의 다음 세대가 같은 표에 올라오는 순간 다시 재야 한다. ③ 7절의 생산 관문은 첫 대량 출하가 실제로 이뤄지는 시점이 답한다. 설계에서 이겼다는 말과 기가와트를 채웠다는 말 사이의 거리가 이 회사의 남은 이야기 전부다.