OpenAI가 Hot Chips에서 추론 가속기 Jalapeño를 공개했다. Semi Doped 진행자 둘, Austin Lyons(이하 진행자A)와 Vik Sekar(이하 진행자V)는 발표 12시간 안에 슬라이드를 짚어 가며 회차 하나를 냈다. 이 글은 그 대화에서 한 회사의 결정이 아니라 업계에 보이는 것을 읽는다.
진행자V가 먼저 꺼낸 수는 일정이다. "첫 RTL(레지스터 전송 레벨 — 회로가 매 클럭에 무엇을 하는지 기술하는 설계 단계)에서 테이프아웃(설계를 마감해 제조로 넘기는 시점)까지 아홉 달쯤이다". 보통은 아무리 짧아도 2~3년이 걸린다. 설명은 셋으로 나뉜다. 진행자V가 든 것이 ① AI 도구와 ② 사람이고, 진행자A가 ③ 백지를 보탰다. 초기 RTL은 GPT-3급 모델로 짜고 더 나은 모델이 나올 때마다 갈아탔다(진행자V가 전함). 사람은 구글 TPU팀 출신이 통째로 들어와 있다(발표를 이끈 Richard Ho가 전 구글 TPU 담당). 백지는 레거시 부담 없이 시작했다는 뜻이다(진행자A가 전함). 이 셋 중 새로운 것은 ①뿐이다. d-Matrix나 Reiner Pope처럼 사람과 노하우로 출발한 팀에게는 당장 쓸 AI 도구가 없었다.
아홉 달을 만든 세 요인
진행자V의 결론은 산업을 향한다. "맞는 사람과 맞는 도구를 가진 회사라면 1년 안에 루빈급 칩을 만들 수 있다". 장벽은 두 겹이다. ① 설계 장벽은 낮아졌다. 작은 팀이 빠르게 칩을 내면 수요가 늘 테니 EDA(전자설계자동화 — 칩 설계 소프트웨어) 업계에는 호재라고 진행자A는 봤다. ② 제조 장벽은 그대로다. 그럼 대량으로 만들어 출하해 보고 규모에서 신뢰성을 보자는 것이 Nvidia 진영의 반론이다.
주기가 짧으면 덜 욕심내도 된다
설계 셈법도 달라진다. Ravi의 기준은 둘을 견주는 것이다. ① 기능 하나를 더 넣는 데 드는 한계비용과 ② 그 기능이 없어서 못 받는 기회비용. 기회비용이 훨씬 크다(진행자A가 전함). Ravi가 가장 어려웠다고 한 결정도 무엇을 뺄지 고르는 일이었다. 2세대가 이미 테이프아웃에 다가가 있으니, 이번에 잘라낸 것은 곧 다음 판에 붙는다. 주기가 짧으면 설계마다 덜 욕심내도 된다.
그래서 아홉 달이 뜻하는 것은 「누구나 칩을 만들 수 있다」가 아니다. 첫 칩을 버리지 않아도 되게 됐다는 것이다. 보통 첫 칩은 거의 버리는 셈이고 진짜 경쟁은 두세 번째부터인데, OpenAI는 1세대부터 경쟁력을 내고 나왔다. 첫 칩이 수업료가 아니라 제품이 되면, 새로 들어오는 회사의 손익 계산이 통째로 바뀐다.
설계 목표는 둘뿐이다. ① 사용자 경험 ② 요청당 에너지. 사용자 경험을 첫 토큰이 아니라 종단 지연으로 정의한 대목을 진행자A가 눈여겨봤다. "얼마나 빨리 처리를 시작하느냐가 아니라, 얼마나 빨리 끝내느냐다". 둘은 서로 어긋나므로 단일 수치 대신 파레토 프론티어(한 축을 조였을 때 다른 축이 어떻게 움직이는지 그리는 곡선)를 쓴다.
잣대가 다른 이유 — 사이에 판매자가 있나
진행자A가 본 것은 목표를 누가 세우느냐다. 상용 업체는 파는 입장이라 TCO(총소유비용)를 먼저 말한다. 여기서는 설계팀과 최종 사용자 사이에 중간 판매자가 없다. 진행자V는 지표 자체는 새롭지 않다고 했다. 메가와트당 초당 토큰은 이미 상호작용 곡선의 세로축이고, 주울당 토큰은 와트당 초당 토큰을 달리 부른 것이다. 같은 지표라도 보고용 곡선으로 쓰느냐 설계 제약으로 쓰느냐에 따라 나오는 칩이 다르다.
그 차이가 드러난 곳이 전력이다. Jalapeño는 700W TDP(열설계전력)이고, 진행자V가 견준 Blackwell GB200은 1,200W쯤이다. OpenAI 팀이 SemiAnalysis의 Inference X 벤치마크를 좋게 본 이유도 전력으로 정규화했기 때문이다. 그 잣대 위에서 Jalapeño는 DeepSeek R1(6,710억 파라미터)로 새 파레토 프론티어를 그었다. 같은 상호작용성에서 처리량이 훨씬 높고, GPU가 못 가는 데까지 밀어 올린다. 이 잣대가 표준이 되면, 전력을 더 먹여 성능을 올려 온 설계는 뒤로 밀린다.
다만 진행자A는 조건을 붙였다. Jalapeño는 HBM4를 쓰고 Blackwell과 MI355는 HBM3E를 쓰니, 공정한 비교라면 Vera Rubin과 Helios를 상대로 하는 것이라고 했다. 진행자V도 이것을 Rubin급 칩으로 봤다.
추론은 성격이 다른 두 구간으로 이뤄진다. ① 입력을 한꺼번에 밀어 넣는 프리필 ② 토큰을 하나씩 내는 디코드. 투기적 디코딩이 얹히면 더 갈린다. 작은 초안 모델이 토큰을 뱉고 큰 모델이 검증하는데, 초안 모델이 똑똑할수록 적게 뱉고 검증도 가벼워진다(진행자V). 비율은 워크로드마다 움직인다.
추론을 받는 세 구성
GPU 진영이 이 비대칭을 다룬 방법은 나누는 것이었다. 진행자A는 Dynamo를 들어, 디코드를 SRAM(칩 안에 두는 빠른 메모리) 기반의 Groq이나 Cerebras에 맡기는 길을 설명했다. 사용자당 초당 1,000토큰이 넘는 영역에는 GPU가 닿지 못했기 때문이다. Jalapeño는 작은 모델(GPT-OSS 1,200억 파라미터)에서 그 선을 넘어, 그 자리를 한 칩으로 밟고 들어왔다. 이 선택을 두고 나온 말이 회차 제목이 됐다. "다크 실리콘이 놀고 있는 GPU보다 낫다"(진행자V의 요약). 연산·메모리 대역폭·IO를 넉넉히 넣어 두고 안 쓰는 구획은 전원을 끊으면, 워크로드 비율이 어떻게 움직여도 랙이 통째로 노는 일은 없다.
투기적 디코딩 — 초안이 똑똑할수록 검증이 가볍다
진행자V는 균형을 잡아 뒀다. Rubin 시스템에 Groq LPU를 붙이면 같은 곡선을 낼 수 있다. 그런 하드웨어가 없는 게 아니라 다른 꼴로 있다는 말이다. 진행자A는 거기에 값을 물었다. NVL72 랙 하나에 Groq 랙 아홉을 붙이는 구성과 Jalapeño 랙 한둘 중 어느 쪽이 비용과 전력에서 맞느냐. 수명도 다르다. 특정 형태의 디코드에 맞춘 LPU는 형태가 바뀌면 쓸 데가 좁아지지만, 균형 잡힌 칩은 2세대 뒤에도 오래 쓴다. 업계가 볼 것은 SRAM 전용 칩이 틀렸다는 게 아니다. 그들이 서 있던 자리의 근거가 「GPU가 그 속도에 못 닿는다」였는데, 그 전제가 GPU 아닌 칩에서 깨졌다는 것이다.
가장 값이 큰 관측은 성능이 아니라 미달이다. 진행자V의 산수는 이렇다. 칩 128개의 HBM4 대역폭을 다 더하면 초당 1페타바이트다. FP4(4비트 부동소수점)로 1조 파라미터 모델을 얹으면 0.5테라바이트쯤이니, 초당 2,000토큰쯤이 나와야 한다. 그런데 실제로는 안 나온다. "왜 우리는 HBM을 최대로 쓰지도 못하고 있나?".
가속기마다 HBM 을 나눠 쓰나, 따로 두나
답은 코디자인을 맡은 Chris의 말에 있다. "피연산자가 늦게 도착한다". HBM을 스케일업 망의 이웃들과 나눠 쓰다 보니 경합이 생긴다. 빨리 빼 오는 것은 되는데, 제때 제자리에 놓는 것이 안 된다. 그래서 나온 말이 "보여 주기용 플롭은 뜻이 없다. 실제로 전달하는 플롭이 얼마냐다". 처방은 나눠 붙이는 것이다. 가속기마다 로컬 HBM 슬라이스를 따로 두고 전용 버스로 붙이는 NUMA(비균일 메모리 아키텍처 — 코어마다 가까운 메모리를 따로 둬 경합을 줄이는 방식) 방식이다.
지금 업계의 답은 늘 더 빠르게였다. 핀당 10Gb/s에서 16Gb/s로 밀고 있고, HBM5는 23~24Gb/s에 닿는다. 진행자A의 물음은 그 곡선을 겨눈다. 매년 더 빠르게 만들어야 하나, 아니면 이미 가진 것을 다 쓰는 데 먼저 매달려야 하나. 공급자에게는 가격을 정하는 근거가 흔들린다는 뜻이다. 핀당 속도로 세대를 나누고 가격을 정해 왔는데, 그 속도를 다 못 쓴다는 것을 최대 수요처 중 하나가 공개 자리에서 말했다. 다음 세대의 판매 논거는 속도 수치가 아니라 그 속도가 실제 토큰 수로 옮겨진다는 증명으로 옮겨 간다.
밸류체인에서 어디에 새 수요가 생기나
진행자A는 발표 슬라이드의 감사 문구에서 실마리를 잡았다. Broadcom과 Celestica가 이름을 올렸다. OpenAI가 자체 칩에 점점 더 많은 기가와트를 쓴다면, 공급망의 어느 업체가 그 흐름을 받게 될까. CPU는 X86이고 Turin급으로 보인다. 진행자V는 다음 세대 Venice가 더 낫고 인텔 대안도 있으니 CPU는 널려 있다고 했다. 공정은 TSMC N3(N3P·N3E)로 본다. 메모리는 삼성 HBM4로 보이고, 핀당 속도가 SK하이닉스보다 조금 나아 보탬이 됐을 수 있다는 것이 진행자V의 관측인데, 그는 이것을 "전적으로 추측"이라고 분명히 했다. 시스템 조립은 Celestica로 추정되고, 진행자A는 그 자리를 OEM으로 봤다.
스케일업은 랙 안이 아니다
망이 가장 구체적이다. Jalapeño 128개가 하나의 스케일업 도메인 안에서 Broadcom Tomahawk 6 스위치로 붙고, 칩당 초당 600기가비트로 통신한다. 그 위로 2,048개까지 넓히는 200기가비트 도메인이 있다. 프로토콜은 Broadcom이 이끈 ESUN이고, UALink와는 다른 갈래다. 배치로는 128개가 랙 하나, 2,048개가 랙 16개다. 진행자A는 스케일업의 정의도 고쳐 잡았다. 랙 안이 아니라 메모리를 나눠 쓰는 가속기들을 뜻하며, 이 구성은 랙 16개에 걸친다. 그 시장을 랙 안으로 잡아 온 계산은 다시 세워야 한다.
모델랩이 실리콘까지 내려와도 밸류체인 아래쪽 전부에 새 수요가 생기는 게 아니라, 어긋난 자리에만 생긴다. CPU처럼 대체재가 널린 자리는 비싸게 팔리지 않고, 파운드리처럼 대안이 없는 자리는 하던 대로 간다. 새 수요가 생기는 곳은 둘이다. ① 세대 차이가 성능 비교를 뒤집을 만큼 큰 메모리 ② 프로토콜이 아직 갈라져 있는 스케일업 망.
범용과 전용 사이 어디에 앉았나
Jalapeño는 자사 모델만 도는 칩이 아니다. GPT-OSS부터 형태가 다른 Kimi K2.5까지 돌렸고, 둠(Doom)까지 돌렸다는 것을 SemiAnalysis가 짚었다. 진행자A는 이것을 작은 모델부터 아주 큰 모델까지 받는 일반화된 LLM 추론 칩으로 정리했다. 진행자V는 반대편에 섰다. 팔 게 아니라면 왜 남의 모델에서도 돈다는 걸 보여주는지 모르겠다는 것이다. OpenAI의 무기는 자기 토큰과 워크로드 데이터인데, 극단적인 코디자인으로 Cerebras급까지 밀어붙일 우위를 버리는 일이라고 했다. 그런데 같은 사람이 뒤에서 뒤집었다. 범용성이 있어야 자기들의 다음 모델을 그 칩 위에서 개발할 수 있다는 것이다. 저울질이라는 뜻이다.
남에게 걸리는 것은 진행자A의 물음이다. 이 칩이 다른 모델도 돌린다면 Nvidia·AMD의 범용 GPU 논거와 구글 TPU의 자리에는 무엇이 남을까. 범용 GPU의 논거는 모델 모양이 바뀌어도 하드웨어가 죽지 않는다는 것이었고, TPU는 특화됐으면서도 특정 모델에 묶이지 않는 중간 자리였다. 그 중간에 Jalapeño가 하나 더 앉았다. 「팔 것인가」는 아직 안 닫혔다. 진행자A는 안 팔 논거(수직 통합·마진·속도)와 팔 논거(테이프아웃과 양산 준비에 든 돈을 상각하고 싶어진다)를 나란히 놓고, 시간이 답할 것이라고 했다. 볼 것은 답이 아니라 선례가 있다는 사실이다. AWS가 자사 XPU 위에서 모델을 굴려 GPU 중간 마진 없이 더 싸게 서비스하는 예를 진행자A가 들었다. 그래서 진행자V가 회차 끝에 던진 물음이 남는다. 그럼 Anthropic의 칩은 어디 있나.
미검증은 셋이다. ① 에이전틱 워크로드를 안 돌렸다. SemiAnalysis 스스로 안 돌렸다고 밝혔다고 진행자V가 전했고, AgentX 플랫폼으로 재는 일은 남아 있다. ② 컨텍스트 길이가 짧다. 진행자V가 어림으로 든 조건은 입력 8K·출력 1K이고, 백만 토큰급 긴 입력에서 어떻게 되는지는 이 회차에 없다. ③ 망 구조의 이름(반쯤 평평한 2계층 Clos)은 나왔지만, 그 배선이 무슨 뜻인지는 진행자V도 아직 정리하지 못했다고 했다. 스케일업 스위치 수요를 세려면 이것이 풀려야 한다. 앞의 둘은 3절의 판단을 직접 겨눈다. 균형 잡힌 한 칩이 여러 워크로드를 받아낸다는 논거는 짧은 컨텍스트에서 잰 수로 세워져 있다. 긴 컨텍스트에서 KV 캐시(이미 처리한 토큰의 중간 계산 결과를 재사용하려고 쥐고 있는 데이터)가 로컬 슬라이스에 안 들어가면, 4절의 경합 문제가 다른 꼴로 다시 나온다.
무엇이 나오면 이 글의 판단이 바뀌는지는 셋이다. ① Vera Rubin과 Helios가 같은 표에 올라오면, 2절의 전력당 성능 우위가 얼마나 남는지가 그때 정해진다. ② AgentX 결과가 나오면, 3절의 균형 단일 칩 논거가 실제 워크로드에서 서는지가 드러난다. ③ 2세대가 실제로 나오는 시점이 1절의 아홉 달을 한 번의 사건과 반복 가능한 주기로 나눈다. 첫 칩은 백지에서 시작한 이점을 다 썼고, 두 번째부터는 1세대 소프트웨어와 이미 배치된 시스템에 맞춰야 하는 부담이 처음 생긴다.