추론 칩
2026-08-27발표 Richard Ho (전 구글 TPU 팀, 발표를 이끔) · Ravi (칩 아키텍트) · Chris (소프트웨어 코디자인)
설계를 아홉 달에 끝낸 추론 칩 — 오픈AI 할라페뇨한글패치
OpenAI가 Hot Chips에서 발표한 지 12시간도 안 돼 녹음한 회차로, 자체 추론(inference) 칩 Jalapeño의 설계 슬라이드를 처음부터 끝까지 훑는다. 진행자 두 사람(Austin, Vik)이 SemiAnalysis 벤치마크 기사를 화면에 띄워 놓고 사용자 경험·에너지 효율 중심 설계 철학, NUMA(비균일 메모리 접근) 방식 로컬 HBM, ESUN 스케일업 네트워킹, 9개월 설계 주기를 차례로 짚는다.
네트워크
2026-08-07게스트 Tom Barber (GlobalFoundries 통신 인프라·데이터센터 담당 부사장, 전사 라벨 Tom)
구리가 끝나는 거리 — 빛을 패키지 안으로 들인다한글패치
GlobalFoundries의 통신 인프라·데이터센터 담당 부사장 Tom Barber가 회사의 실리콘 포토닉스(Silicon Photonics, 빛으로 신호를 주고받는 반도체 기술) 사업 연혁과 300mm 웨이퍼 전환, 구리 배선의 한계, pluggable→NPO→CPO(co-packaged optics, 공동 패키지 광학) 전환 이유, OCI MSA(복수업체 합의 규격)가 PAM4 대신 NRZ 변조를 택한 배경, 자사 Scale 플랫폼과 실리콘 저메이늄(SiGe) 공정의 역할을 설명한다.
네트워크
2026-07-16게스트 Al Yuen (PicoJool 최고경영자, 전사 라벨 Al)
새 공장을 안 지어도 되는 쪽 — VCSEL 로 스케일업 광통신을 채운다한글패치
PicoJool CEO Al Yuen 은 갈륨비소(GaAs, gallium arsenide) 기반 VCSEL(수직공동표면방출레이저, vertical-cavity surface-emitting laser)이 인듐인(InP, indium phosphide) 기반 단일모드(single-mode) 광소자보다 스케일업 인터커넥트(scale-up interconnect, 랙 간 짧은 거리 광통신)에 실용적이라고 주장한다. 근거는 25년간 월 수백만 개를 출하해 온 공급망이 이미 갖춰져 "제약 없음(unconstrained)"이라는 점이며, 회사는 200기가비트/레인 VCSEL 을 막 발표하고 8×200/16×100/32×50 세 가지 조합으로 1.6T 를 채운 뒤 2-D 배열과 양방향(bi-di) 파장으로 12.8T 까지 가는 로드맵을 제시한다.
메모리
2026-07-10게스트 Val Bercovici (WEKA, 전사 라벨 Val)
토큰 값을 정하는 것은 연산이 아니라 캐시다
WEKA의 Val Bercovici가 진행자 Vik Sekar와 함께, AMG(Augmented Memory Grid, WEKA의 NAND 기반 메모리 확장 제품)가 어떻게 NVLink 대역폭을 타면 DRAM보다 빨라지는지, DeepSeek V4의 캐시 읽기 가격이 왜 87배 낮은지, SLC(단일 레벨 셀)·QLC(쿼드 레벨 셀) NAND 계층이 추론에서 어떻게 재편되는지, CXL이 왜 시들해졌는지를 다룬다. 마무리는 소프트웨어 회사가 토큰 원가를 감당하려면 결국 뉴클라우드(중소형 GPU 클라우드)를 인수해야 한다는 전망이다.
추론 칩
2026-06-29
HBM 을 옆에 붙이지 않고 연산 위에 쌓겠다는 설계
퀄컴 인베스터 데이(뉴욕) 참관기를 다룬 회차다. 통신 중심에서 데이터센터·자동차·IoT로의 사업 다각화 목표, HBM(고대역폭 메모리, High Bandwidth Memory) 대신 로직 위에 LPDDR를 쌓는 HBC(고대역폭 컴퓨트, High Bandwidth Compute) 구조, 알파웨이브(Alphawave)·모듈러(Modular) 인수, C1000 CPU를 순서대로 짚는다.
추론 칩
2026-05-12게스트 Natalie (Gimlet Labs 공동창업자) · Baltier (Gimlet Labs, 합류 5개월차 — 이전 인텔에서 포트폴리오사로 담당)
Gimlet Labs, 서로 다른 칩을 하나의 추론 클라우드로 엮어 처리량-지연 곡선을 4배 밀어낸다
Gimlet Labs 공동창업자 Natalie와 합류 5개월차인 Baltier가, 추론(inference) 워크로드를 잘게 쪼개 GPU·SRAM(정적 램) 가속기·CPU 등 서로 다른 벤더의 칩에 나눠 배정하는 오케스트레이션(작업 배치·조율) 소프트웨어로 추론 클라우드를 짜고 있다고 설명하며, D-Matrix Corsair를 GPU 옆에 붙여 처리량-지연 파레토 곡선(둘 사이 최선의 절충 지점을 이은 선)을 4배 밀어낸 실측 사례를 든다.
추론 칩
2026-04-20게스트 Matt Steiner (Meta 수익화 인프라·랭킹·AI 파운데이션 부문 VP)
메타 광고 추천 시스템은 GPU와 다른 실리콘(MTIA)을 요구했고, 이제 LLM이 그 하드웨어별 커널을 직접 짠다
메타의 광고 추천 인프라를 총괄하는 Matt Steiner가 광고 시스템의 두 단계(검색 — Andromeda, 랭킹 — Lattice)와 그 아래를 받치는 실리콘의 변천사를 설명한다. CPU에서 Nvidia와 co-design한 GPU로, 다시 추천 시스템 특유의 메모리·컴퓨트 비율 때문에 커스텀 칩 MTIA로 넘어간 과정과, LLM이 하드웨어별 커널을 직접 써 주는 최근 기법(AlphaEvolve/AlphaKernel)까지 짚는다.
추론 칩
2026-04-09게스트 Reiner Pope (MatX 공동창업자 겸 CEO)
MatX 는 SRAM 과 HBM 을 한 칩에 합쳐 지연시간과 처리량을 함께 잡는 쪽에 걸었다
구글 TPU(자체 AI 가속기) 팀 출신 라이너 포프(Reiner Pope)가 이끄는 MatX 는 가중치를 SRAM 에, KV 캐시(추론 중 문맥을 저장해 두는 공간, key-value cache — 전사에는 "KB cache"로 잘못 받아 적혔다)를 HBM 에 나눠 담는 하이브리드 메모리로 저지연(Cerebras·Groq 식)과 고처리량(엔비디아 식)을 한 칩에서 동시에 얻는다는 설계를 설명한다. 소프트웨어 종속이 이미 약해졌다는 진단, 프런티어 랩을 첫 고객으로 고른 논리, MoE(전문가 혼합, mixture-of-experts) 를 위한 인터커넥트 투자를 거쳐, 남은 가장 큰 과제는 기가와트급 생산 규모로 빠르게 올라서는 일이라고 마무리한다.
시황·규제·자금
2026-04-07
청취자 7만 명짜리 팟캐스트에 3억 달러를 낸 이유는 머릿수가 아니라 청중이 쥔 결정권이다
Austin Lyons(Chipstrat)와 Vik Sekar(Vik's Newsletter)가 그날 아침 올라온 인텔-일론 머스크 "테라팹(Terafab)" 협력 발표, OpenAI의 팟캐스트 TBPN 인수, 그리고 파이낸스 뉴스레터 Citrini Research가 애널리스트를 호르무즈 해협(Strait of Hormuz)에 직접 보낸 사연까지 세 가지 그 주 시황을 훑는다. 관통하는 물음은 하나 — 정보와 주목(attention)에 매겨지는 값을 정하는 게 머릿수인지, 그 청중이 쥔 결정권인지다.
네트워크
2026-03-20
마이크론 HBM4는 베라 루빈에 설계로 들어갔고, 마이크로LED는 광학 스케일업에서 아직 죽지 않았다
그 주 GTC(엔비디아 GPU 기술 컨퍼런스)와 OFC(광섬유 컨퍼런스, Optical Fiber Conference)가 겹쳐 소식이 쏟아진 가운데, 진행자들은 마이크론의 HBM4(4세대 고대역폭 메모리)가 베라 루빈(Vera Rubin, 엔비디아 차세대 GPU 플랫폼)에 실제로 설계돼 들어갔다는 소식과, 스케일업(같은 랙 안 GPU 간 연결) 광학 인터커넥트에서 마이크로LED·VCSEL(수직공진표면발광레이저)이 인듐인화물 레이저의 대안으로 떠오르는 흐름을 다뤘다. 중간에 토큰 예산과 온프레미스(사내 설치형) 추론이라는 짧은 화제도 끼어든다.
추론 칩
2026-03-17
GTC 키노트, 추론을 무료·중간·프리미엄 등급으로 나누고 Groq를 해독 전담 랙에 끼워 넣다
아이오와 폭설로 항공편이 결항돼 키노트를 비행기 안에서 스트리밍으로 본 오스틴을 대신해, 진행자 둘이 젠슨 황의 두 시간 반짜리 GTC 키노트를 늦은 밤 급히 훑어본다. 추론을 무료·중간·프리미엄 등급으로 나눈 요금 설계, SRAM 기반 Groq 칩을 소프트웨어로 해독(디코드) 전담에 붙인 방식, 별도의 Vera CPU 랙, 그리고 그 사이에서도 왜 HBM 수요는 줄지 않는지를 정리한다.
네트워크
2026-03-06
브로드컴의 코퍼 400기가 주장이 CPO 스케일업 시점을 늦출 조짐을 보인다
같은 주에 엔비디아가 루멘텀·코히런트에 각 20억 달러를 투자한 뉴스와, 브로드컴 CEO 훅탄이 실적발표에서 "코퍼는 400기가까지도 될 수 있다"고 말한 뉴스가 맞부딪히자, Austin과 Vik가 옵틱스(광학)와 코퍼(구리 배선) 중 스케일업(scale-up, 랙 내부 연결)의 승자가 누구인지, 그리고 왜 승자가 아직 정해지지 않았는지를 짚는다.
시황·규제·자금
2026-02-10게스트 Wayne Nelms (Ornn 최고기술책임자(CTO))
GPU 잔존가치를 미리 값 매기면 뉴클라우드의 파이낸싱 비용이 낮아진다
Ornn 최고기술책임자 Wayne Nelms는 GPU 컴퓨트와 메모리를 표준 상품처럼 거래하는 선물(先物)거래소를 만들었다고 설명한다. 스팟 가격이 뛸 때 상한을 씌우는 선물, GPU가 몇 년 뒤 얼마에 팔릴지 미리 가격을 정해 주는 잔존가치 상품, 그리고 그 확실성이 뉴클라우드의 대출 금리를 낮춘다는 논리를 진행자 Vik Sekar와 나눈다.