← 회차 목록

곱셈을 덧셈으로 바꿔 실리콘을 비운다 — 텐서다인의 로그 연산 추론 랙한글패치

2026-08-18 · R K Anand
원문 https://daily.semidoped.com/p/new-episode-tensordynes-r-k-anand · 요약본 저장소
진행 Austin Lyons (Semi Doped)
게스트 R K Anand (Tensordyne 공동창업자 · 최고제품책임자, 전사 라벨 RK)
⚖ 전략 판전략 컨설턴트 출신 애널리스트의 해설 · claude-opus 가 씀
곱셈을 덧셈으로 바꿔 레티클 아래 머무르고, 스케일업 패브릭은 라우터에서 통째로 빌린다

텐서다인 공동창업자이자 최고제품책임자인 R K Anand가 Semi Doped 진행자 Austin Lyons(이하 진행자A)와 마주 앉았다. 3나노 추론 칩 하나와 그 칩을 담은 쿼터랙 이야기다. 회사 소개로만 들으면 놓치는 것이 많다. 아직 전원도 안 켠 이 시스템이, 업계가 당연하게 여기던 전제 여럿을 한꺼번에 건드리고 있기 때문이다.

1 라우터를 만들던 사람이 추론 랙을 만들 때 무엇이 따라오나

RK는 1990년 Sun의 마이크로프로세서 팀에서 시작해 1996년 주니퍼를 창업 엔지니어로 함께 세웠다. 회차 내내 그가 돌아가는 이야기는 그때의 시스코와 주니퍼다. 주니퍼가 출발할 무렵 시스코는 코어 라우터 시장의 93~94%를 쥐고 있었고, 2000년 즈음에는 시가총액 세계 1위였다. 그런데 주니퍼가 몇 해 만에 30%를 가져갔다. "새 시장이 생길 때 스타트업이 들어갈 데가 있고, 차별화된 기술이 있으면 시장에 영향을 줄 수 있다는 증거"라고 그는 말했다. 주니퍼에 17년 가까이 있으면서 매출이 0에서 42억 5천만 달러까지 커지는 것을 지켜봤고, 그 시절 인터넷은 6~9개월마다 두 배로 불었다.

눈여겨볼 것은 그가 이 비유의 한계를 스스로 그었다는 점이다. "닮은 점은 거기서 금방 끝난다". 다른 점이 셋이다. ① 시장의 크기와 규모가 그때와 자릿수부터 다르다 ② 정보가 바로 퍼지는 세상이라 누구나 서로를 안다 ③ 구글 같은 하이퍼스케일러가 실리콘과 시스템을 직접 만든다. 1996~99년에도 라우터 회사 여럿이 돈을 받았고, 그는 그 이름들을 지금도 외운다. 그런데도 지금이 기회라고 보는 이유는 압력이 바뀌었기 때문이다. 학습에서 추론으로, 단일 모델에서 전문가 혼합으로 옮겨 오면서 시스템에 걸리는 요구가 4~5년 전과 달라졌다.

그러니 이 회차에서 볼 것은 「스타트업도 이길 수 있다」가 아니다. 차별화가 수학 한 군데에만 있어서는 안 되고 시스템 전체에 걸쳐 있어야 한다는 쪽이다. 아래 절들은 텐서다인이 그 차별화를 어디에 나눠 놓았는지, 그중 무엇이 다른 회사에도 해당하는지를 따라간다.

2 곱셈을 덧셈으로 바꾼 값은 전력이 아니라 남은 면적이다

로그 연산은 오래된 도구다. 400년도 더 전에 존 네이피어가 만들었고, 아폴로 계획에서는 계산자로 탈출속도를 구하는 데 썼으며, 최근 20~30년은 DSP(디지털 신호 처리기) 안에 들어 있었다. RK가 새로 던진 물음은 이것을 AI에 쓸 수 있느냐였다. 밑이 2인 로그에서는 A 곱하기 B가 로그 A 더하기 로그 B가 되므로 곱셈기가 덧셈기로 바뀐다. 실리콘에서 곱셈은 게이트도 면적도 전력도 훨씬 많이 먹는다. 이 물음이 처음 나온 곳은 데이터센터가 아니었다. 텐서다인의 옛 이름은 레코그니이고, 2019년 시리즈 A를 받을 때 겨눈 것은 자동차용 이미지 인식이었다. 차가 내줄 수 있는 전력은 정해져 있어서, 예전 방식으로 계산하면 주행거리가 깎인다. 그것이 그때 풀려던 문제였다. 7나노 실리콘까지 만든 뒤 2022년 말에서 2023년 초에 ChatGPT를 보고 방향을 틀었다. 시장이 50~100배 크고, 인증이 긴 자동차보다 매출까지 가는 시간이 짧다고 봤기 때문이다.

곱셈을 덧셈으로, 그리고 되돌아오기

A × B — 곱셈 로그로 가면 log A + log B — 덧셈 선형 복귀 — 이득 안 반납 누산
절감률은 전사에 없다.

어려운 쪽은 그다음이다. 곱한 값을 누산해야 하는데 로그 영역에서는 덧셈이 문제가 된다. 룩업 테이블이나 테일러 급수 같은 흔한 길로 가면 곱셈을 덧셈으로 바꿔 번 것을 그대로 돌려준다. RK가 특허로 세운 것은 로그에서 선형으로 되돌아와 덧셈을 하되 그 이득을 잃지 않는 방법이다. 회사의 거의 절반이 5년 가까이 이 수학에만 매달렸다. 그 시간을 그는 이렇게 정당화했다. 남과 같은 7나노·5나노를 쓰면서 남과 같은 방식으로 만들면 아무 우위도 없고, 그래서는 큰 회사를 이길 수 없다.

여기서 업계가 볼 것은 전력 효율 숫자가 아니다. 연산이 자리를 덜 차지하면 무엇이 남느냐가 진짜 물음이고, RK의 답은 SRAM과 HBM이다. 칩을 레티클(노광 장비가 한 번에 찍을 수 있는 최대 크기) 한계까지 키우지 않고도 성능을 내면, 남긴 면적이 곧 메모리 용량이 된다. 수학의 혁신이 메모리 배치 문제로 되돌아오는 구조다.

3 스케일업 패브릭을 새로 만들지 않는 길이 있다

라우터 뒷면을 그대로 가져왔다

고성능 라우터 텐서다인 쿼터랙 앞면 포트 아무 크기 패킷 뒷면 패브릭 어느 포트에서 어느 포트로든 가속기 72개 뒷면 패브릭 어느 포트에서 어느 포트로든
가속기 수 72 는 쿼터랙 값이다.

모델이 한 칩에 안 들어가면 망 문제가 된다. 여기서 텐서다인이 한 선택이 이 회차에서 가장 배울 것이 많다. 스케일업 패브릭을 새로 설계하지 않고, 라우터 뒷면을 통째로 가져왔다. 고성능 라우터의 뒷면은 원래 어느 포트에서 어느 포트로든 가는 아무 크기의 패킷을 다루도록 만들어져 있다. 40바이트짜리부터 9K 점보 프레임까지, 이메일부터 실시간 영상까지 섞여 들어와도 버텨야 한다. 앞면에 800기가 포트가 수백 개쯤 붙을 수 있는 장비라고 그는 어림했다. 이 선택을 설명하면서 그가 든 원칙은 균형이다. 한 자원에 치우치면 연산이 놀고, 덜 잡으면 굶는다. 멘토들에게 그렇게 배웠다고 했다.

그 성질이 지금 비싸게 팔리는 이유는 모델 쪽에서 생겼다. RK가 본 것은 이렇다. 모델이 커지면서 트래픽이 텐서 병렬의 규칙적인 리듬에서 무작위로 바뀌었다. 전문가 혼합(MoE)에서는 어느 전문가로 갈지가 무작위이기 때문이다. 라우터 패브릭이 20년 동안 다뤄 온 것이 바로 그런 무작위 트래픽이다. 지연이 1~2마이크로초이고, 이용률이 99%를 넘어도 성능이 버틴다는 성질을 그는 들었다.

세대를 세는 셈법도 그의 논거다. "NVL72가 1세대다. 우리는 HP주니퍼 패브릭을 가져왔으니 7세대에 있다". 반대편의 UALink와 ESUN은 아직 사양과 초기 구현 단계라, 그 프로토콜로 말하는 가속기도 패브릭 칩도 아직 없다. AMD 헬리오스는 급한 대로 UALink 계열 패킷을 표준 이더넷에 터널링하는데, 그러면 헤더와 주소가 얼마를 먹고 페이로드가 얼마나 남느냐는 물음이 따라붙는다. 업계가 볼 것은 이것이다. 스케일업 망의 신참들이 사양을 맞추는 동안, 이미 20년 굴러 온 완제 패브릭이라는 우회로가 통신 장비 회사에 놓여 있었다.

4 프리필과 디코드를 나눈 지금의 답이 임시라면

지금 업계의 답은 나누는 것이다. 진행자A가 정리한 단계는 둘이다. ① 1단계는 전부 GPU에서 돌린다 ② 2단계는 프리필은 GPU에, 디코드는 SRAM이 많은 칩에 나눠 붙인다. 실제 조합도 나와 있다. 엔비디아 더하기 그록, 아마존 트레이니엄 더하기 세레브라스, 헬리오스 더하기 세레브라스다.

RK는 그 조합에 값을 구체적으로 붙였다. 2조 파라미터 모델 하나에 9랙에서 14랙, 베라 루빈용 CUDA 컴파일러와 그록용 컴파일러 둘, 그리고 그 섀시들을 묶을 이더넷 스위치 여럿이다. 통합 칩의 논거는 여기서 나온다. SRAM이 연산 배열 곁에 넉넉하면 HBM에서 데이터를 가져오는 지연을 가릴 수 있어 연산 배열이 멈추지 않는다. 쿼터랙 하나에 HBM 10.8테라바이트, SRAM 18기가바이트 이상이라는 수치를 그는 댔다. 이 용량으로 감당하겠다며 예로 든 가장 큰 모델은 2.8조 파라미터 Kimi K3 급이다. 재는 잣대는 사용자 한 명당 초당 토큰인데, 그 사용자가 사람인지 에이전트인지는 상관없다고 했다.

다만 그는 곧바로 단서를 달았다. 그것만으로는 필요조건이지 충분조건이 아니다. 연산과 통신이 번갈아 도는 리듬에서는 통신이 지연과 처리량을 좌우하기 시작한다. 그래서 2절의 연산과 3절의 망은 따로 자랑할 거리가 아니라 하나의 논거로 묶인다. 한 칩으로 두 구간을 다 하려면 남긴 면적과 빌려 온 패브릭이 동시에 있어야 한다는 뜻이고, 둘 중 하나만 있는 설계는 이 논거를 쓸 수 없다.

5 30킬로와트 공랭 쿼터랙이 겨누는 곳

쿼터랙 대 풀랙

텐서다인 쿼터랙 GB300 풀랙 13U · 랙의 1/4 칩 72개 30킬로와트 · 공랭 풀랙 150킬로와트 · 액랭
성능이 동급이라는 전제는 이 회차에 값이 없어 그리지 않았다.

수치가 가장 도발적이다. 13U 크기에 칩 72개, 랙의 4분의 1, 30킬로와트, 공랭이다. 그가 견준 상대는 블랙웰 GB300 풀랙 150킬로와트다. 액랭이 아닌 이유는 주니퍼 시스템을 그대로 쓰기 때문이니, 이것도 3절의 선택에 딸려 온 결과다. 쿼터랙 넷을 한 랙에 채우면 120킬로와트쯤 되는데, 그 상태로도 공랭이라고 확인해 줬다.

배포 이야기로 넘어가면 겨냥이 분명해진다. 하이퍼스케일러 중에는 전 세계에 데이터센터를 400개 둔 곳이 있는데, 그것들은 액랭이 아니고 개조도 안 된다. 텐서다인 시스템은 19인치 텔코 랙이라 AT&T·버라이즌·도이체텔레콤·NTT·뉴욕증권거래소에 그대로 들어간다. 그가 그린 그림은 이렇다. 20~30킬로와트짜리 작은 데이터센터로 200~500메가와트급의 성능 특성을 낸다. 같은 성능을 8분의 1 전력으로 낼 수 있다는 셈도 그 자리에서 같이 댔다.

업계가 볼 것은 성능 주장보다 수요가 놓인 자리를 다시 정한 것이다. 지금 AI 인프라 논의는 기가와트급 신축 액랭 데이터센터를 기본값으로 놓고 돌아간다. 이 회차는 그 옆에, 이미 세워져 있고 전력이 모자라고 개조가 안 되는 기존 랙 수만 개를 겨냥한 갈래를 세운다. 전력이 부족한 도시와 국가가 그 갈래의 근거로 직접 언급된다. 그 갈래가 성립하면 신축 전력 계약은 주춤하고, 돈은 기존 통신사 시설로 갈라진다.

6 스타트업이 만들지 않기로 한 것의 목록이 곧 전략이다

자기 손으로 하는 것과 맡긴 것

프런트엔드 설계 · 자기 물리 설계 브로드컴 시스템 HP주니퍼 양산 Flex 컴파일러 — 자기 (엔지니어 60% 이상이 소프트웨어) 자기 손으로 한다 남의 것을 쓴다
엔지니어 60% 이상이 소프트웨어다.

이 회차에서 가장 실무적인 대목은 텐서다인이 자기 손으로 하지 않기로 한 일의 목록이다. ① 프런트엔드 설계는 자기 것이지만, 물리 설계와 TSMC 관계는 브로드컴이 이끈다. ② 시스템은 HP주니퍼 것을 쓰고, 그 회사는 투자자이기도 하다. ③ 양산은 페낭의 Flex 공장, 이미 그 시스템이 출하되고 있는 라인에서 한다. 그가 든 이유는 시간이다. 스타트업이 실리콘 부담에 시스템 인증과 신뢰성 부담까지 지면 출시가 통째로 밀린다. 브로드컴을 고른 이유도 같다. 그 회사는 TSMC 용량과 HBM 용량을 가장 많이 사는 축에 들어서, 미리 넉넉히 예측해 두면 검증까지 끝난 부품을 받을 수 있다. Flex는 옛 플렉스트로닉스이고, 이런 시스템을 대량으로 만들 줄 안다는 것이 양산을 맡긴 근거다.

이 구조의 핵심은 신뢰성이다. 캐리어급 라우터의 기준인 5나인 가동률은 1년에 5분 남짓, 하루로 치면 680밀리초 이상 멈추면 안 된다는 뜻이다. 시스템의 80%가 이미 검증·인증돼 있고, 70개국에서 인증을 받았다. 일정은 이렇다. 3나노 테이프아웃을 마쳤고 10월 말에서 11월 초에 디바이스를 받는다. 1분기에 고객 베타를 하고, 내년 2분기 말에서 3분기 초에 초기 양산에 들어간다. 표적 고객은 하이퍼스케일러가 먼저, 그다음이 북미·유럽 네오클라우드, 소버린과 엔터프라이즈가 뒤따른다. 네오클라우드는 북미와 유럽의 거의 모든 곳에서 의향서를 받아 뒀고, 영업 조직이 크지 않아 표적을 좁혀야 했다고 그는 말했다.

소프트웨어에서도 같은 태도가 보인다. 컴파일러는 직접 만들어야 하고, 엔지니어링 조직의 60% 이상이 소프트웨어다. 그가 든 바깥의 변화는 둘이다. ① 분리 추론이 퍼지면서 "추론에서는 CUDA의 해자가 더는 없다" ② 에이전틱 워크플로가 커널을 새 하드웨어에 빠르게 맞춰 준다. 신참 아키텍처의 소프트웨어 벽이 낮아지는 이유를 모델 능력의 향상에서 찾는 논리다. 이것은 텐서다인만의 이야기가 아니라 모든 비 GPU 가속기의 진입 비용에 같이 걸리는 관측이다. 컴파일러 위층에서는 PyTorch나 Triton으로 된 모델을 빠르게 옮겨 컴파일하는 데 시간을 많이 썼다고 했다.

7 이 회차가 말하지 않은 것, 무엇이 나오면 판단이 바뀌나

가장 큰 미검증은 RK 본인이 말했다. 아직 시스템에 전원을 안 켰다. 그 말 바로 옆에, 세계 최신 시스템보다 거의 한 자릿수 배 앞설 것 같다는 말이 붙는데 근거는 시뮬레이션이다. 진행자A도 "너무 좋아서 못 믿겠다"고 받아쳤다. 검증되지 않은 것이 셋이다. ① 30킬로와트 대 150킬로와트 비교는 성능이 같다는 전제 위에 서 있는데, 그 성능 벤치마크가 이 회차에 없다. ② NVLink의 디코드 지연이 나쁘다는 대목은 그 자신이 "확실히 아는 건 아니고 일화로 들은 것"이라고 분명히 말했다. ③ 로그 연산의 정확도 손실을 다루는 대목이 없다. 곱셈을 덧셈으로 바꾸고 되돌아오는 과정에서 모델 품질이 어떻게 되는지는 이 대화에 나오지 않는다.

판단이 바뀌는 지점도 셋이다. ① 10월 말에서 11월 초에 디바이스가 돌아와 실제 전력과 성능이 나오면 2절과 5절이 동시에 정해진다. 남긴 면적이 정말 메모리로 돌아왔는지, 30킬로와트에서 GB300만 한 성능이 나오는지가 같은 시험이다. ② 라우터 패브릭이 MoE 트래픽에서 실제로 어떻게 움직이는지는 켜 봐야 안다. 라우터의 무작위 트래픽과 전문가 선택의 무작위성은 성질이 같지 않을 수 있는데, 이 회차는 그 둘을 같다고 놓고 3절과 4절의 논거를 세웠다. ③ UALink와 ESUN에 맞는 가속기와 패브릭 칩이 실제로 나오면 「7세대 대 1세대」 셈법의 수명이 정해진다. 그 격차는 시간이 지나면 좁아지는 종류이고, 앞선 세대라는 자리는 오래가지 않는다. 텐서다인이 실제로 파는 것은 결국 먼저 도착하는 시간이다.

받은 글을 문장 그대로 싣는다. 원본 insights/semidoped/2026-08-18-tensordyne-rk-anand-strategy.md · 페르소나 전략 컨설턴트 출신 애널리스트