← 회차 목록

웨이퍼 한 장을 통째로 칩으로 쓰는 회사가 상장한다

2026-05-15 · Austin Lyons · Vik Sekar
원문 https://daily.semidoped.com/p/cerebras-ipo · 요약본 저장소
진행 Austin Lyons (Chipstrat) · Vik Sekar (Vik's Newsletter) — Semi Doped 공동 진행. 게스트 없음
⚖ 전략 판전략 컨설턴트 출신 애널리스트의 해설 · claude-opus 가 씀
웨이퍼 한 장을 칩으로 만드는 일은 40년 전에 이미 풀려 있었고, 걸린 것은 제조 성숙과 추론 수요였다

이번 Semi Doped 회차는 상장 당일 아침에 녹음됐다. Austin Lyons(이하 진행자A)와 Vik Sekar(이하 진행자V)가 한 회사만 붙들고 이야기하는데, 절반은 웨이퍼 한 장을 칩 하나로 쓰는 물건이 어떻게 만들어지는지이고 나머지는 그 물건을 어떻게 팔 것인지다. 이 글은 종목 판단을 걷어 내고 그 대화에서 업계에 보이는 것을 읽는다.

1 청약 주문이 기술 평가보다 먼저 나왔다

공모가는 주당 185달러, 조달액은 55억 달러였다고 진행자V는 기억했다. 진행자V는 이 숫자가 굳는 과정을 한 주 내내 봤다. 처음 들린 예상이 135달러, 그다음이 150~160달러였고, 마지막에 185달러가 나왔다. 회사가 잡았던 목표는 35억에서 40억 달러쯤이었던 것 같다는데 15억 달러가 더 들어왔다. 청약 방식도 특이했다. 몇 주를 원하고 최대 얼마까지 낼 수 있는지를 적어 넣게 했고, 마감 직전에 Arm과 소프트뱅크가 들어와 사려 했다는 블룸버그 보도까지 있었지만 그 응찰은 통하지 않았다.

이 회차는 뒤에서 이 물건의 한계를 조목조목 짚는다. 메모리가 44기가바이트뿐이고, 웨이퍼 밖으로 나가는 순간 느려지고, 배치 규모를 늘릴 수 있을지 모른다. 그런데도 15억 달러가 더 들어왔다. 진행자A가 회차 끝에서 한 말이 그 사정을 짚는다. "살 수 있는 AI 가속기가 가장 좋은 AI 가속기다".

2 자르지 않은 웨이퍼가 성립하는 조건

자를 것인가, 그대로 둘 것인가

통상 웨이퍼 자른다 다이로 패키징 칩 하나씩 잇는다 네트워크 · 스위치 Cerebras 웨이퍼 안 자른다 웨이퍼 위 배선으로 이음 그대로 칩 하나
레티클 84장이 한 장에 이어 붙는다.

진행자V가 먼저 그림을 그렸다. 웨이퍼는 큰 접시 같고 보통은 그 위에 만든 칩들을 잘라 내 하나씩 패키징해 내보낸다. Cerebras는 자르지 않고 웨이퍼 위 금속 배선으로 그 칩들을 이어 한 장을 통째로 칩 하나로 만들었다. 진행자A는 이 발상이 낯설지 않다고 했다. NVIDIA도 다이 하나에서 둘로, 둘에서 넷으로 늘려 왔고 사람들은 여덟을 생각한다. 잘라 놓으면 다시 통신을 붙여야 하고, 운이 좋으면 이어 붙여 한 덩어리처럼 쓰지만 아니면 네트워크와 스위치까지 들어간다.

죽은 코어를 건너뛰는 순서

전원을 켜고 코어를 전수로 검사한다 신호가 없는 자리를 적어 둔다 — 「10행 13열」 웨이퍼 위 패브릭이 그 자리를 건너뛰어 예비 코어로 배선을 돌린다 소프트웨어가 그 자리에 일을 안 보낸다
상자로는 안 세고 순서만 그렸다.

문제는 완벽한 웨이퍼가 없다는 사실이다. 결함은 어느 웨이퍼에나 있고 Cerebras 웨이퍼에도 있다. 대신 이어 붙인 단위가 GPU만큼 크지 않다. 코어 하나는 GPU의 20분의 1이나 100분의 1 크기이고 연산 조금과 메모리 조금을 함께 가진다. 그런 코어가 한 장에 97만쯤 들어가고 그중 90만 개가 실제로 돌아간다. 나머지는 결함을 피하느라 비워 둔다. 웨이퍼 위에 깔린 네트워킹 패브릭이 죽은 코어를 건너뛰어 예비 코어로 배선을 돌린다. 진행자A는 그 검사가 전원을 켠 뒤 코어 전수로 이뤄지는 것 같다고 봤다. 얼마나 자주 하는지는 모른다고 하면서, 신호가 없으면 10행 13열이 죽었다고 적어 두고 소프트웨어가 그 자리에 일을 보내지 않는다.

칩이 커지면 표면적이 넓어져 결함을 만날 확률이 올라가지만, 코어 하나하나가 작으면 각 코어의 표면적이 작으니 코어 단위 수율은 좋다고 진행자A는 설명했다. 그렇게 해서 나온 물건이 44기가바이트 SRAM에 초당 21페타바이트 대역폭이다. SRAM 한 칸은 트랜지스터 여섯 개이고, 실리콘이 넓으면 트랜지스터를 연산에 줄지 빠른 메모리에 줄지 정할 수 있다. Cerebras는 절반 가까이를 메모리에 줬고, 코어 하나 안에서도 실리콘이 연산과 SRAM에 반반이다.

3 전력을 넣고 열을 빼는 일이 설계를 정했다

층 셋이 저마다 다른 숙제를 진다

층 이 층의 숙제 엔진 블록 미세 유로가 수직으로 흘러 한 장을 한꺼번에 식힌다 웨이퍼 한 장 23킬로와트 · 수만 암페어를 수백 지점에서 수직으로 받는다 기판 열을 받으면 웨이퍼만 늘어나 정렬이 어긋나고 커넥터가 뜯긴다
커넥터 개수는 전사에 없어 안 그렸다.

진행자V가 규모를 이렇게 잡았다. 레티클 84장이면 GPU 84개쯤이고, NVL72가 칩 72개짜리이니 웨이퍼 한 장에 랙 하나 분량이 들어앉은 셈이다. 웨이퍼 하나가 23킬로와트를 먹으니 1볼트로 공급한다면 수만 암페어가 흘러야 한다. 한쪽 옆에 커넥터를 붙여 12인치 건너까지 보낼 방법은 없다. 그래서 웨이퍼 표면 수백 지점에 위에서 수직으로 꽂는 전용 커넥터를 만들었다.

냉각은 엔진 블록이라 부르는 금속 덩어리가 맡는다. 미세 유로가 수직으로 흘러 한 장을 한꺼번에 식힌다. 웨이퍼 어디에 뜨거운 자리가 생길지 모르니 전면을 동시에 식혀야 한다. 게다가 웨이퍼는 열을 받으면 0.1밀리미터쯤 늘어나는데 기판은 그만큼 늘어나지 않는다. 정렬이 어긋나고 커넥터가 뜯겨 나간다. Cerebras는 열팽창 계수를 맞추는 재료를 따로 만들어 특허를 냈고, 진행자V는 이것이 업계 공통의 숙제가 아니라 이 회사만의 숙제라고 못 박았다.

진행자A는 비용을 물었다. 자르고 패키징하고 다시 잇는 공정을 건너뛰니 싸질 것 같은데, 저 엔진 블록이 싸 보이지 않는다. 진행자V의 답은 짧았다. 이 일은 비용 이야기가 전혀 아니다. 레티클을 이어 붙이는 것만 해도 마스크가 한 번에 비추는 크기가 정해져 있어 패터닝을 달리해야 하고, TSMC와 10년을 들여 풀어낸 문제다. 처음부터 표준을 벗어난 웨이퍼 공정이고 전원과 냉각과 팽창과 기계까지 전부 어렵다. 이 방식을 뒤따르려면 개발비를 크게 쓰고 그 결과를 특허로 묶어 둔 회사와 붙어야 한다.

4 44기가바이트라는 천장

44기가바이트 안과 밖

모델이 44기가바이트 안에 들어간다 SRAM 초당 21페타바이트로 돈다 넘으면 웨이퍼 밖으로 나간다 파이프라인 병렬 층을 나눠 차례로 텐서 병렬 행렬을 쪼개 전문가 병렬 전문가마다 한 장 셋 다 웨이퍼 사이 통신에 기댄다
모델이 44기가바이트 안에 들어가면 GPU 로는 못 내는 초당 토큰이 나온다. 넘으면 웨이퍼 여러 장에 쪼개야 하는데 네트워킹은 칩 한쪽 끝으로만 나가고 웨이퍼 안 데이터 이동보다 훨씬 느리다. 병렬 셋은 진행자V 가 든 우회로 그대로다. 셋 다 웨이퍼 사이 통신에 기대니 웨이퍼 스케일의 기본 발상과 어긋난다.

진행자A는 시점을 짚었다. 이 회사가 시작한 때는 ChatGPT 이전이고, 그때 44기가바이트 SRAM은 넉넉해 보였을 것이다. 지금은 작은 모델도 그보다 크다. Llama 70B이 이미 넘고, 활성값과 KV 캐시까지 얹을 자리도 필요하다.

모델이 44기가바이트 안에 들어가면 결과는 압도적이다. 진행자V는 GPU 기반 시스템에서 꿈도 못 꿀 초당 토큰이 나온다고 했다. Groq의 LPU조차 한 장에 SRAM이 수백 메가바이트뿐이라 여러 장을 이어야 모델이 들어가고 그만큼 네트워킹 부담이 붙는다. 그러니 작은 모델을 아주 빠르게 돌려야 하는 일이 이 물건의 자리다. 진행자A는 구글이 광고 문구를 즉석에서 다시 쓰는 작업을 예로 들었다.

문제는 그 밖이다. 전력은 웨이퍼 전면으로 들어오지만 네트워킹은 칩 한쪽 끝으로만 나가고, 웨이퍼 안에서 데이터가 움직이는 속도에 견주면 훨씬 느리다. 웨이퍼 밖으로 나가는 순간 병목이다. 진행자V가 우회로 셋을 들었다. ① 파이프라인 병렬은 첫 웨이퍼가 어텐션 몇 층, 다음 웨이퍼가 또 몇 층, 그다음이 피드포워드를 맡아 차례로 넘긴다 ② 텐서 병렬은 행렬을 다섯으로 쪼개 웨이퍼 다섯 장에 돌린다 ③ 전문가 병렬은 전문가마다 웨이퍼를 배정한다. 어느 쪽이든 웨이퍼 사이 통신 대역폭이 모자란 상태에서 문제를 쪼개는 일이고, 진행자V는 그것이 웨이퍼 스케일 엔진의 기본 발상과 정면으로 어긋나는 근본적 약점이라고 정리했다.

그래서 나온 아이디어들이 죄다 더 어렵다. 진행자A는 전날 나온 SemiAnalysis 기사에서 웨이퍼 스케일 광연결 실험을 봤다고 전했다. 위에 광 웨이퍼를 한 장 더 올려 필요한 자리로 오르내리게 하는 그림이다. SRAM이나 DRAM 웨이퍼를 본딩해 쌓는 이야기도 나왔다. 다른 가속기 회사들은 메모리 계층으로 이 문제를 다룬다. MatX의 Reiner Pope는 가중치를 SRAM에 KV 캐시를 HBM에 두는 구성을, 퀄컴과 인텔과 d-Matrix는 DDR을 한 층 더 쓰는 방식을 말했다. 다만 Cerebras에서는 그 면으로 전력이 들어오고 냉각이 이뤄진다. 겹쳐 쌓으면 전력과 냉각을 어디로 넣을지가 다시 문제가 된다.

5 왜 40년이 걸렸나

같은 발상, 40년 뒤

언제 무슨 일이 1980년대 트릴로지 — 2.5인치 웨이퍼에서 결함을 우회해 한 장을 통째로 1982 폭풍이 공장을 잠기게 하고 먼지가 청정실로 날려 든다 1983 제품 없이 상장해 돈을 모았지만 아무 일도 없었다 1989 Amdahl 이 물러난다 100년은 안 된다고 말한다 오늘 같은 발상이 12인치 웨이퍼에서 제품 바뀐 것은 웨이퍼 제조 성숙 하나
진행자V 가 센 간격이 40년이다.

진행자V가 꺼낸 트릴로지 시스템즈 이야기가 이 회차의 무게 중심이다. 1980년대에 Gene Amdahl이 2억 3천만 달러, 오늘 값으로 10억 달러에 가까운 돈을 모아 지금 Cerebras가 해낸 것과 같은 일을 하려 했다. 웨이퍼 크기만 2.5인치였다. 결함을 우회한다는 해법까지 같았다. 실패한 이유는 발상이 아니라 그 시절의 수율이다. 2.5인치 웨이퍼조차 수율이 너무 낮았다.

거기에 사고가 겹쳤다. 1982년쯤 폭풍이 3천 3백만 달러짜리 공장을 물에 잠기게 했고, 공조로 물이 스며 배관이 녹으면서 미세 먼지가 청정실로 날려 들어갔다. 수율이 떨어지는 원인을 몇 달 동안 찾지 못한 채 자본을 태웠다. 1983년에 제품도 없이 상장해 6천만 달러를 모았지만 아무 일도 없었고, 주가는 12달러에서 몇 해 뒤 0에 가깝게 내려갔다. 재무를 맡던 Clifford Madden은 위기가 가장 심할 때 뇌종양으로 죽었다. 회사는 구조조정 끝에 웨이퍼 스케일 슈퍼컴퓨터를 포기했고, Amdahl은 앞으로 100년은 안 된다고 말한 뒤 남은 돈으로 미니컴퓨터 스타트업을 사서 방향을 틀었다. 1989년에 물러났다.

진행자V가 계산한 실제 간격은 40년이다. 이 회차의 첫 번째 대답이 여기 있다. 발상은 처음부터 맞았고, 붙잡고 있던 것은 웨이퍼 제조가 얼마나 좋아지는지였다. 진행자A는 이 회사가 돈이 떨어지기 전에 제품을 여러 세대 냈다고 보탰다.

두 번째 대답은 수요다. 처음 목표는 슈퍼컴퓨팅이었다. CPU 10만 개를 묶던 일을 같은 실리콘 위에서 하면 어떻겠냐는 발상이다. LLM 훈련이 뜨자 훈련으로 옮겼는데, 훈련은 메모리 대역폭이 걸리는 문제가 아니었다고 그는 봤고 CUDA를 두고 다른 것을 프로그래밍할 이유도 마땅치 않았다. 추론으로 옮긴 뒤에야 맞는 자리가 생겼다. 진행자V는 프리필과 디코드를 나눈 추론에서 디코드 구간이 메모리 대역폭을 요구하게 된 것을 이 회사 무릎에 떨어진 선물이라고 했다. 진행자A가 순서를 세웠다. 오픈 모델이 Groq에 선물이었고, Groq가 Cerebras에 선물이었고, NVIDIA의 Dynamo와 프리필·디코드 분리가 그 앞에 있었다.

6 하드웨어를 팔지 않는 하드웨어 회사

하드웨어를 안 파는 하드웨어 회사

제조·공급망 데이터센터 클라우드 운영 토큰 공급 OpenAI 가 연산 시간과 토큰에 돈을 낸다 하드웨어 판매 — 없다 Cerebras 가 지는 자리

가치 제안은 저지연 추론 하나로 좁혀졌다. 진행자V는 NVIDIA가 Groq를 인수한 뒤로 추론 엔진의 승부가 여기 모였다고 봤고, 코딩처럼 손이 계속 움직여야 하는 일에서는 빠른 추론이 제품 출시 속도를 바꿔 매출로 이어진다고 했다. 다만 이 시장을 크게 보지는 않는다. 프리미엄 토큰은 비싼 만큼 금전적 회수가 있어야 하니 금융 분석이나 코딩쯤이 남고, 대부분의 사람은 GPU로 충분해서 물 한 잔 받아 오는 동안 답이 오면 된다. 진행자A는 에이전트를 반례로 들었다. 사슬로 엮인 작업에서는 10초씩 쌓이는 것과 1초씩 쌓이는 것이 전혀 다르다.

계약의 모양이 낯설다. OpenAI는 웨이퍼 스케일 엔진을 사서 데이터센터를 짓겠다고 한 적이 없다. 연산 시간을 사고 토큰에 돈을 낸다. 워런트 조항이 붙었다. 그러면 제조와 공급망은 물론이고 데이터센터 건설과 클라우드 운영과 토큰 공급까지 전부 Cerebras가 한다. 진행자V가 물은 것이 이 대목이다. 왜 복잡한 칩을 만들면서 신생 클라우드까지 해야 하나.

진행자A는 다른 그림을 하나 상상해 봤다. 마이크로소프트가 이 회사를 샀다면 Azure가 규모와 SLA를 맡고 Cerebras는 긴 컨텍스트와 KV 캐싱, 월드 모델을 감당할 다음 세대 웨이퍼에 집중할 수 있었다. 지금 구조에서는 Cerebras가 OpenAI에게 Azure 역할까지 해야 한다. 고객 집중도 그대로 남는다. 진행자A는 예전 상장 시도 때 국부 투자자 겸 클라우드 구매자 하나에 기대던 그림이 사업 검증으로 보이지 않았다고 하면서, OpenAI가 들어온 지금도 집중은 집중이라고 했다.

배치 규모가 마지막 물음이다. 진행자A는 엔진 블록처럼 새로 만든 부품은 공급망 협력사와 함께 발명하는 것이니, 큰 고객이 데이터센터 하나 분량을 주문하면 그 협력사들이 갑자기 대량으로 찍어 낼 수 있느냐고 물었다. 진행자V가 되받았다. 그건 지금 AI 데이터센터 전체의 이야기 아닌가. 진행자A는 그쪽은 이미 대량 생산되는 부품이라는 차이를 들었고, 진행자V는 Lumentum 레이저가 모자라면 Coherent가 만들겠다고 나서는 것처럼 두세 곳이 붙을 여지를 남겼다. 진행자V가 앞서 던진 물음이 이 대목의 크기를 보여 준다. 내년에 웨이퍼 스케일 엔진 10만 장을 깔 수 있나.

7 이 회차가 말하지 않은 것, 그리고 무엇이 나오면 판단이 바뀌나

말하지 않은 것은 넷이다. ① 계약 조건. 워런트가 몇 주에 얼마이고 기간이 얼마인지를 진행자V가 지루하다며 넘겼다. ② 웨이퍼 사이를 잇는 스케일업 연결. 진행자A가 물었고 진행자V는 잘 모른다고 답했다. ③ 44기가바이트 안에 실제로 무엇이 올라가 매출을 내는지. 용례는 광고 문구 재작성 하나만 나왔다. ④ 지금 운영하는 클라우드의 규모. 서비스가 있긴 하지만 그 규모로는 못 돌린다는 말까지가 전부다.

판단이 바뀌는 조건은 셋이다. ① 웨이퍼 밖 대역폭. 광 웨이퍼를 얹는 방식이나 메모리 웨이퍼 본딩이 제품에 들어오면 4절의 천장이 물러나고, 웨이퍼 스케일이 작은 모델 전용이라는 지금의 자리 규정이 무너진다. ② 후발 주자의 납품. 두 진행자가 이름을 늘어놓은 회사가 여럿이다. SambaNova, MatX, Taalas, Sohu, Tenstorrent, Etched, 그리고 전날 2억 2천만 달러를 모은 Fractile. 진행자A는 이들 제품을 아직 규모로 살 수 없다는 점이 지금 Groq와 Cerebras가 서 있는 자리라고 했고, 초당 1천 토큰을 낼 수 있는 회사가 열 곳이 되면 그 자리가 사라진다고 했다. ③ 토큰 공장이 실제로 커지는지. 하드웨어를 팔지 않는 구조에서는 제조와 데이터센터와 클라우드 중 어디 한 곳이 막히면 그 지점에서 매출이 통째로 멈춘다. 진행자V가 남긴 말이 지켜볼 자리를 정해 준다. "풀 수 없는 문제를 계속 풀어 가고 있는 거죠, 그러길 바랍니다".

받은 글을 문장 그대로 싣는다. 원본 insights/semidoped/2026-05-15-cerebras-ipo-strategy.md · 페르소나 전략 컨설턴트 출신 애널리스트