구글이 Cloud Next 2026 키노트에서 TPU 8세대를 공개했다. 훈련용 8T와 추론용 8I 두 칩으로 나눈 것은 예상됐던 일이지만, Semi Doped의 Austin Lyons(이하 진행자A)와 Vik Sekar(이하 진행자V)는 방송에서 칩보다 그 뒤에 숨은 네트워크를 짚었다. 두 사람은 이 회차에서 한 회사의 결정보다, 훈련과 추론을 나누는 일이 데이터센터 전체를 어떻게 다시 설계하게 만드는지를 읽는다.
TPU 는 세대마다 칩을 나눴다 붙였다 했다
TPU는 원래 하나의 칩으로 훈련과 추론을 모두 맡아 왔다. v1은 추론 전용이었고, v2부터 v4까지는 훈련과 서빙을 한 칩에 담았다. v5에서 효율칩과 성능칩으로 한 번 나뉘었다가 v6에서 다시 단일 칩으로 돌아왔고, v7도 단일 칩이었다(추론 위주로 홍보됐을 뿐이다). v8에 와서야 훈련용 8T와 추론용 8I로 다시 나뉘었다.
진행자A는 이 분리가 칩에서 끝나지 않는다고 짚었다. 8T는 3D 토러스(TPU를 3차원 격자 모양으로 연결하는 방식)로, 8I는 Boardfly라는 새 방식으로 스케일업(칩 사이를 메모리처럼 촘촘히 묶는 근거리 연결)한다. 컴퓨트가 병목이던 시절에는 하나의 칩과 하나의 망으로 버틸 수 있었다. 이제는 훈련과 추론이 주고받는 트래픽의 성격 자체가 달라, 칩을 나눈 논리 그대로 망도 나눴다.
8I는 SRAM(칩 안에 두는 가장 빠른 메모리) 384MB를 넣었다. 8T의 세 배다. 진행자V는 Groq LPU가 SRAM 위주로 설계된 것과 같은 논리라고 봤다. SRAM을 최대한 채워야 저지연 추론과 빠른 디코딩(토큰을 하나씩 생성하는 단계)이 나온다.
추론칩과 훈련칩이 메모리를 다르게 채운다
HBM(고대역폭메모리 — 칩 옆에 쌓아 붙이는 고속 메모리) 배분은 더 눈에 띈다. 추론칩 8I는 288GB, 훈련칩 8T는 216GB로 오히려 적다. 진행자V의 설명은 이렇다. 훈련은 칩을 여러 개 묶어 클러스터 전체의 메모리를 늘릴 수 있지만, 추론은 칩 한 개 안에서 SRAM·HBM·DRAM 세 계층을 전부 최대치로 채워야 한다. 진행자V는 Nvidia가 정리한 메모리 계층 용어를 빌려, SRAM을 0단계, HBM을 1단계, DRAM을 2단계로 부르며 8I가 이 세 계층을 모두 최대치로 채우려는 시도라고 짚었다. 훈련칩의 HBM을 줄인 결정은, 하나의 칩이 모든 용도에 맞아야 한다는 전제를 깬 결정이기도 하다.
두 시스템 모두 구글 자체 ARM 기반 Axion을 헤드노드 CPU로 쓴다. 데이터 전처리 지연이 낳던 호스트 병목을 없애 TPU를 계속 먹이려는 설계다. 진행자V는 여기서 더 큰 흐름을 봤다. "손에 넣을 수 있는 CPU가 최선의 CPU다. ARM이든 x86이든 상관없다". CPU 아키텍처 자체가 더는 승부처가 아니라는 신호다.
진행자V는 네트워킹이 이번 발표의 진짜 핵심이라고 봤다. 컴퓨트는 더는 제약이 아니고, 모든 연산을 가로막는 병목은 이제 네트워킹이라는 전제에서 출발한다.
계층이 셋에서 둘로 줄었다
구글의 이전 망 Jupiter(2015년)는 당시 세계 최초 페타비트급 망이었다. 리프-스파인-슈퍼스파인으로 계층을 쌓는 Clos 네트워크였고, 인터넷·웹서비스 시대에는 맞았다. 랙 하나에서 다른 랙으로 가려면 리프에서 스파인으로, 슈퍼스파인으로 올라갔다가 다시 내려와야 했다. 진행자V는 계층이 이렇게 쌓인 이유를 스위치의 radix(포트 수)가 낮았기 때문이라고 짚었다. 포트가 적은 스위치로 규모를 키우려면 계층을 더 얹는 수밖에 없다.
AI 훈련은 다르다. 모든 칩이 동시에 통신하는 동기적 트래픽이라, 가장 느린 노드 하나가 전체 완료 시각을 좌우한다. 구글도 이 지연을 tail latency(꼬리 지연)라 부르고, 원인이 되는 노드를 straggler(뒤처지는 노드)라고 이름 붙였다. 인터넷 트래픽과 달리 AI는 무작위 지연을 견디지 못한다. 이 시절 트래픽을 관리하던 소프트웨어 계층의 이름이 Orion이다.
구글은 2022년 데이터센터에 OCS(광회로스위칭 — 빛을 전기신호로 바꾸지 않고 스위치 안에서 광경로 자체를 바꿔 연결하는 방식)를 넣었다. 파장분할다중화(WDM, 여러 파장의 빛을 한 가닥에 실어 대역폭을 늘리는 기술)까지 더해 대역폭이 초당 6페타비트로 늘었고, 이후 400기가 네트워킹을 적용해 13.1페타비트까지 갔다. 2015년부터 2023년까지 13배 늘어난 셈이다.
구글은 망을 스케일업(패드 안에서 메모리를 나누듯 묶는 근거리 연결)·스케일아웃(랙 사이를 잇는 백엔드 망)·프런트엔드(컴퓨트·스토리지·인터넷 연결) 세 층으로 나눠 다시 짰다. 프런트엔드는 새로 안 만들고 기존 Jupiter·Clos를 그대로 쓴다. 이번에 새로 설계한 층은 스케일아웃뿐이고, 이름은 Virgo다.
Virgo는 고radix OCS 스위치로 계층을 둘로 눌렀다. 리프에서 스파인, 슈퍼스파인까지 올라갈 필요 없이 두 계층만 거치면 어디든 닿는다. 이 구조로 TPU 134,000개를 하나로 묶었다. 구글은 이것을 "캠퍼스 하나가 컴퓨터"라고 불렀다. 지금 쓰는 Lumentum OCS 스위치는 포트가 300x300이고, 다음 세대는 1,000x1,000까지 늘어난다. 진행자V는 Coherent도 구글에 OCS를 공급하는지는 확실히 모른다고 선을 그었다.
결과는 대역폭 47페타비트/초다. 앞서 나온 13.1페타비트/초의 네 배쯤이다. 진행자V는 칩 13만 4천 개를 묶고 나면 고장도 그만큼 늘어난다며, 구글이 텔레메트리(원격 상태 감시)를 촘촘히 심어 goodput(하드웨어가 실제로 유효하게 처리해 낸 처리량)을 지키는 이유도 여기 있다고 짚었다.
메모리 접근도 다시 짰다. TPU Direct(RDMA, 원격직접메모리접근)는 TPU가 이웃 TPU의 메모리에 접근할 때 호스트 CPU를 거치지 않는다. 예전에는 요청마다 양쪽 CPU가 주소를 확인하고 허락을 주고받아야 했다. 이제는 네트워크 인터페이스로 곧장 접근한다. 호스트 CPU라는 중간 다리 하나를 뺀 것만으로 메모리 접근 속도와 지연이 함께 좋아졌다.
훈련용 8T가 쓰는 3D 토러스는 TPU를 3차원 격자로 놓고 안쪽 면은 구리로, 같은 행·열의 반대편 끝은 광케이블로 이어 고리를 만든다. 3D 토러스에는 직관과 어긋나는 함정이 있다. 가장 멀리 떨어진 지점은 정반대편 모서리처럼 보이지만, 실제로 가장 닿기 어려운 곳은 격자 한가운데다. 세 축을 각각 절반씩 거쳐야 닿기 때문이다.
같은 거리를 몇 홉에 가나
TPU v7 구성인 4x4x8 배치를 예로 들면, 한 축에서 2홉, 다른 축에서 2홉, 나머지 축에서 4홉을 더해 8홉이 나온다. 구글 블로그가 든 예는 8x8x16이고, 같은 셈으로 4+4+8 해서 16홉이 나온다.
훈련에서는 이 구조가 문제되지 않는다. 모든 TPU가 항상 서로 통신하기 때문이다. 문제는 추론, 그중에서도 MoE(전문가 혼합 모델 — 토큰마다 일부 전문가만 활성화하는 구조)다. 토큰마다 활성화되는 전문가가 달라 통신 패턴이 이웃끼리 규칙적으로 오가는 대신 여기저기로 튄다. 16홉이라는 지연이 그대로 추론 시간에 얹힌다.
Boardfly는 이 문제에 답하려고 나왔다. 기본 단위는 보드 하나에 TPU 4개를 PCB(회로기판) 구리 배선으로 묶는다. 보드 8개를 AEC(능동전기케이블 — 신호를 증폭하는 회로를 넣은 구리 케이블)로 랙 하나에 묶어 그룹 하나를 만든다. 그룹끼리는 Dragonfly(스위치를 그룹으로 묶고 그룹 간을 다시 잇는 전통적 슈퍼컴퓨팅 망 구조) 방식으로 연결한다. 그룹 36개가 모여 파드 하나가 되고, 그룹 간은 다시 OCS로 잇는다. 36개 그룹과 8개 보드, 4개 TPU를 곱하면 1,152개 칩이다.
Dragonfly는 새로 나온 개념이 아니다. 2008년 슈퍼컴퓨팅 논문에서 제안된 방식이고, 저자 중 한 명인 Dennis Abts는 당시 구글에 있다가 2017년부터 2022년까지 Groq에서 네트워크 설계를 맡았고, 이후 Nvidia로 옮겼다. 진행자V는 Groq도 랙 설계에 Dragonfly를 쓰지만, 보드 단위가 아니라 LPU 하나하나를 직접 묶는다고 짚었다. 같은 연결 방식이 회사마다 다른 단위로 쓰이고 있는 셈이다.
이름도 거기서 왔다. GPU 하나하나가 아니라 TPU 넷을 얹은 보드를 Dragonfly 꼴로 묶는다고 해서 Boardfly다. 층마다 잇는 매체가 다르다는 점도 눈여겨볼 만하다. 보드 안은 구리 배선, 보드끼리는 능동전기케이블, 그룹끼리는 광케이블이다. 진행자A가 이 순서를 되짚자 진행자V는 스케일아웃도 전부 OCS이고 그룹 간 연결도 광이라고 확인했다. 구리가 죽었다는 말이 무색하게, 짧은 거리에서는 여전히 구리가 쓰인다.
이 구조의 이득은 홉 수 감소에 있다. 보드끼리 몇 홉을 거치고, OCS로 다른 그룹까지 한 번에 크게 뛴 뒤, 그 그룹 안에서 몇 홉을 더 거치면 목적지에 닿는다. 다 합쳐 여섯에서 일곱 홉이다. 진행자V는 "16홉에서 7홉까지 줄었다. 이 방식으로 지연이 50% 넘게 떨어졌다"고 정리했다.
진행자A는 이 회차의 결론을 이렇게 정리했다. "칩 하나가 모든 걸 하던 시절에서 훈련용·추론용 두 칩으로, 이제는 스케일업 망도 3D 토러스와 Boardfly 두 갈래로 나뉘었다. 실리콘은 물론 데이터센터 전체가 워크로드를 중심으로 설계되고 있다". 진행자V는 여기에 "극단적인 공동설계다. 바람 방향까지 중요해졌다"고 덧붙였다.
이 회차가 다루지 않은 것도 있다. CAE(집합가속엔진 — all-reduce·all-gather 같은 집합통신 연산을 전담하는 칩렛)는 이름만 나왔다. 진행자V 자신도 "아직 무엇인지 제대로 읽어 보지 못했다"고 인정했다. 진행자A가 TPU 8I 하나에 텐서코어 둘과 CAE 하나가 칩렛으로 얹혀 집합통신을 오프로드한다고 보충했지만, 이 설명은 구글 발표를 되짚은 추정이지 이 회차에서 검증된 사실은 아니다.
두 사람이 답을 미룬 물음도 남았다. AWS 같은 다른 클라우드가 Trainium에 같은 수준의 네트워크 혁신을 가져올지, 아니면 기존 클라우드 구조를 그대로 쓸지는 열려 있다. 에이전틱 워크로드가 지금의 두 갈래(훈련·추론)와 또 다른 세 번째 인프라를 요구할지도 짐작만 나왔다. 진행자A는 TPU를 먹이는 Axion 말고도, 지연에 민감한 에이전트가 일반 CPU와 가상머신 위에서 어떻게 이 토폴로지에 들어맞는지 아직 모른다고 인정했다.
무엇이 나오면 이 판단이 바뀌는가. ① CAE의 실제 구조가 공개돼 집합통신 지연이 얼마나 줄었는지 숫자로 나오면, 4절의 goodput 향상분 가운데 네트워크 재설계가 기여한 부분과 CAE가 기여한 부분을 나눠 볼 수 있다. ② 다른 클라우드가 비슷한 칩·망 분리를 발표하면, 이번 재설계가 구글만의 선택을 넘어 업계 전체의 방향이라는 근거가 늘어난다. ③ MoE가 아닌 다른 추론 워크로드(에이전틱·긴 컨텍스트)에서 Boardfly의 홉 절감이 그대로 유지되는지가 확인되면, 5·6절의 판단이 특정 워크로드에만 해당하는지 일반적인 것인지가 나뉜다.