이번 Semi Doped 회차는 진행자 Austin Lyons(이하 진행자A)가 GlobalFoundries의 통신 인프라·데이터센터 담당 부사장 Tom Barber를 불러 실리콘 포토닉스(빛으로 신호를 주고받는 반도체 기술) 한 분야를 깊이 판다. 게스트가 자기 회사를 소개하는 자리이기도 하지만, 이 글이 읽는 것은 데이터센터 배선이 왜 지금 다시 짜이는지의 순서다. 게스트가 자기 회사를 파는 자리라는 점은 마지막 절에서 따로 짚는다.
레인 속도별 구리가 가는 거리
Barber가 이 회차 내내 붙들고 있는 수는 하나, 거리다. 직결 구리 케이블은 레인당 100기가비트에서 2미터쯤 간다. 랙 하나의 높이다. 200기가비트로 올리면 1미터로 줄고 400기가비트에서는 0.5미터가 된다. 업계가 지금 겪는 일이 여기서 그대로 풀린다. NVL72에서 스위치가 랙 꼭대기에서 가운데로 내려온 것도 설계 취향이 끼어들 자리가 없어서다. 그 1미터를 지키려는 조치였다.
속도가 오르면 왜 광으로 가나
문제는 이 대응을 한 번밖에 못 쓴다는 데 있다. "400기가비트로 가면 거리가 0.5미터인데, 랙을 4분의 1로 줄이지는 않을 것 아닌가". 스위치를 당기는 방식은 랙의 물리적 높이가 바닥이라 거기서 멈춘다.
그리고 반대편에서 힘이 하나 더 걸린다. 스케일업 도메인을 랙 하나 안에 가두지 않으려는 흐름이다. NVL72도 AMD Helios도 아직 단일 랙이지만, 구글과 화웨이는 이미 랙 여섯에서 열 개에 걸쳐 GPU 300·500·1,000개를 하나의 스케일업 망으로 묶었다. 그렇게 되면 건너야 하는 거리가 수십에서 수백 미터라 구리로는 아예 선택지가 없다.
업계에 보이는 것은 광학 업체의 기술 개선 곡선이 아니라 구리의 한계 거리가 랙 치수보다 짧아진 시점이다. 그 시점이 지나면 광으로 갈지 말지가 판단이 아니라 산수가 되고, 물음은 광을 어디까지 안으로 들이느냐로 바뀐다.
200mm 에서 300mm 로 — 전과 후
수요가 이렇게 서면 다음 병목은 만들 수 있느냐다. 실리콘 포토닉스는 아직 대부분 200mm 웨이퍼에서 나오고 경쟁사 대부분도 거기 있는데, GlobalFoundries는 뉴욕 몰타 공장에서 300mm로 옮겼다. 지름이 1.5배면 면적은 그 제곱이라 웨이퍼당 다이가 2.25배 나오고, 같은 웨이퍼 장수를 돌려도 두 배 넘는 물량이 나온다. Barber는 지금 시장이 생산 능력에 목말라 있다고 진단했고, 자기 회사는 그것을 감당할 수 있다고 봤다.
5년 전에 이 시장이 왜 작았는지를 그가 둘로 나눴다. ① 50·100기가비트 구간에서는 인듐인화물과 EML(외부 변조 레이저)이 충분히 셌고 ② 데이터센터 수요가 아직 안 붙어 있었다. 200기가비트가 주력 노드가 되면서 그 구간이 실리콘 포토닉스에 가장 맞는 자리가 됐다.
매출 1위 주장의 구성도 그가 직접 갈라 놨다. ① 오래된 핵심 고객을 함께 키운 것 ② 300mm 조기 투자 ③ 싱가포르 AMF 인수다. GlobalFoundries는 단거리·데이터센터를 하고 AMF는 장거리를 해서 겹치지 않았기에 합산이 그대로 1위가 됐다. 같은 기술을 쓰면서 거리 대역이 다르면 인수에서 중복은 사라지고 품목 보강만 남는다.
다음 갈림은 광을 랙 가장자리에 두느냐 패키지 안에 넣느냐다. 이 회차는 그것을 두 수로 잰다. 전기 손실(dB)과 비트당 에너지(피코줄)다.
광 엔진을 어디까지 안으로 들이나
손실이 어디서 나는지가 뒤집힌 상식이다. 손실은 광학 부품 탓이 아니라 PCB 위 전기 배선에서 난다. 200기가비트 PAM4 신호는 대역폭이 약 55기가헤르츠인데, 그것을 서버 가운데 프로세서에서 가장자리까지 가는 가늘고 긴 배선에 통과시키니 손실이 쌓인다. 그래서 세 구성이 갈린다. ① 플러거블은 프로세서에서 랙 가장자리까지 약 35dB ② NPO(근접 패키지 광학)로 당기면 15~20dB ③ CPO(공동 패키지 광학)로 패키지 안에 들이면 6dB 안팎이다. 같은 것을 다른 데서는 3dB로도 말했다.
손실이 줄면 그것을 메우던 부품이 빠진다. 35dB을 보상하려면 비싸고 전력을 많이 먹는 DSP가 플러거블에 들어가야 하는데, NPO에서는 링크 예산이 버티면 리타이머 없는 리니어 방식으로 그 DSP를 뺄 수 있다. 결과가 비트당 에너지로 나온다. 완전 리타임 플러거블이 20~25피코줄, 리니어 NPO가 10피코줄쯤, 패키지 위로 올린 CPO가 5피코줄 미만이다.
이 수가 왜 순위를 흔드는지는 Barber의 한 문장에 있다. "이 시스템들은 전부 열에 묶여 있다. 통신에 들어간 1피코줄은 연산에 못 쓰는 1피코줄이다". 진행자A는 이것을 전력 예산 배분 문제로 다시 적었다. 50메가와트든 100메가와트든 총량이 고정된 데이터센터에서는 통신에 쓰는 전력을 깎을수록 연산에 쓸 전력이 늘어난다. 광 부품 업체가 파는 것이 대역폭이 아니라 되찾아 준 전력이 되면, 가격을 정하는 근거도 성능 사양에서 데이터센터 전력 예산으로 옮겨 간다.
CPO가 저렇게 유리한데 왜 다들 바로 안 가는가. 성능은 이미 문제가 아니다. 답은 교체 가능성이다. 운영자가 플러거블을 편하게 여기는 것은 문제가 생기면 뽑고 새것을 꽂으면 되기 때문이고, 근본 원인을 끝까지 밝히지 않은 채 교체로 넘어가는 일이 잦다. NPO는 아마 소켓형일 것이라 서버를 열어야 하지만 GPU까지 갈아 끼우지 않고 교체가 되는 절반쯤의 걸음이고, CPO는 GPU 패키지 안에 영구 부착이라 되돌릴 방법이 없다.
Meta가 그 물음을 실측으로 파고 있다. Barber가 기억하기로는 GPU 5만 개쯤 규모의 CPO 망을 오래 돌린 연구를 여러 판 공개했는데, 신뢰성이 플러거블보다 오히려 높았고 광통신에서 가장 걱정하던 링크 플랩(연결이 끊겼다 붙었다 하는 현상)이 5천만 시간쯤에 이르는 시험 범위 안에서 나오지 않았다.
이유가 가장 뒤통수를 친다. 광 문제의 일부는 광 부품 잘못이 아니라 꽂는 행위 자체에서 난다. 커넥터에 먼지가 들어가 신호를 막는데도 그 사고는 플러거블 탓으로 기록된다. CPO는 클린룸에서 붙여 그 연결부 자체가 없다. 진행자A는 이 역설을 되짚었다. 안전판으로 여기던 교체 가능성이 오히려 사고의 원인이 아니냐고 그는 되물었다.
다만 Barber는 문턱을 낮추지 않았다. "CPO가 플러거블만큼 좋은지를 의심하는 사람은 없다고 본다. 물음은 시스템의 영구 부품으로 삼아도 될 만큼 훨씬 나은가다". 원가에서도 방향은 같다. CPO로 가면 케이스·MCU·전원 같은 지원 회로가 통째로 빠지는데 그중 원가가 가장 큰 것은 아마 DSP이고, 거기에 낮아진 전력이 운영비로 이어진다. 신뢰성이 확인되는 순간 원가와 전력은 이미 같은 편에 서 있다. 기술은 이미 풀렸다. 전환을 늦추는 것은 검증 일정뿐이다.
OCI MSA(복수업체 합의 규격)에서 벌어진 일은 이 회차에서 가장 방향이 특이하다. MSA는 IEEE 표준의 선택지 중 무엇을 쓰고 안 쓸지를 업계가 합의하는 문서이고, 광통신에서는 주로 기계적 규격을 다뤄 왔다. 전기 인터페이스는 OIF가, 광 인터페이스는 IEEE가 정하고 MSA가 그것들을 묶었다. OCI는 광 인터페이스 자체를 새로 정의한다는 점에서 다르다. "IEEE가 정의하는 광 규격은 스케일업 용도에 맞지 않는다". 진행자A가 기억하는 참여사 이름은 AMD·Broadcom·Nvidia 정도다.
PAM4 와 NRZ — 레벨 사이 틈
바꾼 방향이 뒤로다. 업계는 파이버 하나에 더 많은 데이터를 밀어 넣으려고 다중 레벨 변조 PAM4(심볼당 2비트, 4레벨)로 갔는데, 레벨 사이가 좁아 수신하려면 전력을 많이 쓰거나 잡음을 극도로 낮춰야 한다. OCI는 심볼당 1비트인 NRZ로 되돌아가고 속도도 50기가헤르츠로 낮춘 다음, 파이버 하나에 파장 넷을 실어 200기가비트를 맞춘다. 대신 스케일업 망에는 과할 수 있는 2킬로미터 도달 거리를 굳이 지키지 않아도 된다고 봤다.
바꿔 얻는 것이 수로 나온다. 채널 등화와 순방향 오류 정정이 크게 줄고, 50기가헤르츠 NRZ의 원시 비트 오류율은 PAM4의 약 100만분의 1이다. 수신이 쉬워지면 그것이 그대로 원가와 전력으로 돌아온다.
레이저 하나가 먹이는 파이버 수
레이저 쪽 셈도 통념과 다르다. 레이저 하나가 파장 하나를 전담하는 경우는 드물다. 빛을 나눠 여러 파이버가 함께 쓴다. 지금 4대 1, 플러거블은 8대 1로 가는 중이고, OCI 규격은 극단적으로 레이저 하나가 파이버 32가닥까지 먹인다. 그래서 파장 여덟짜리 광 엔진 한 벌이 레이저 여덟 개로 선다. 파장을 늘리는 흐름이 레이저 업체에 수요가 되리라는 짐작을 이 수가 뒤집는다.
Scale 광 엔진의 세 층과 누가 만드나
Scale 플랫폼은 전기에서 광으로 넘기는 데 필요한 것을 한 덩어리로 묶었다. GPU나 AI ASIC과 통신하는 전자 IC 아래에 전기와 광을 번역하는 광자 IC가 앉고, 그 아래에 탈착식 파이버 커넥터가 붙는다. 탈착이 핵심인 이유는 조립 순서다. 파이버 동글이 늘 달려 있으면 CPU를 조립할 때 걸리니, 그래서 부품을 다 짜 놓고 마지막에 광 배선 하네스를 꽂는 순서를 구리 때와 똑같이 유지한다.
누가 만드는지가 밸류체인을 보여 준다. 광자 IC는 100% 자사, 전자 IC는 복잡도에 따라 자사 FinFET·FDX·SiGe로 하거나 고객이 3나노·2나노를 원하면 그 웨이퍼를 받아 조립·시험만 맡고, 마이크로 광학은 외부 제조에 조립·시험만 자사다. 선단 공정 경쟁에서 물러난 회사가 광 엔진에서는 조립·시험을 쥐고 앞단 웨이퍼만 남에게 넘기는 꼴이다.
커플링 방식의 차이도 미래 대역폭과 묶여 있다. 진행자A가 TSMC는 CoWoS에서 그레이팅 커플러를 쓴다고 말하자, Barber는 자사는 웨이퍼에 마이크로 미러를 심어 수직으로 들어온 빛을 수평 도파관으로 꺾는다고 답했다. 그레이팅 커플러는 대역폭이 좁아 O 밴드(1310나노미터 근처 광 대역) 전체를 한 방식으로 못 덮지만 미러는 덮는다. 대역폭을 더 늘리는 길은 파장을 더 얹는 것이니, 이 선택으로 다음 세대의 여유분을 미리 잡아 뒀다.
그런데 정작 만들기 어려운 곳은 다른 데다. 광 엔진에 필요한 부품은 광자 IC와 그것을 구동하는 고속 아날로그 전기 IC 둘인데, 후자가 다시 둘이다. ① 변조기를 구동하는 드라이버는 DSP로 통합되는 중이라 시장이 줄고 ② 포토다이오드의 전류를 전압으로 바꾸는 TIA가 남는다. 증폭기는 트랜지스터 속도가 대역폭의 5배쯤 되어야 해서, 200기가비트 레인에는 350~400기가헤르츠, 400기가비트 레인에는 600~700기가헤르츠가 필요하다. 이것을 대량으로 신뢰성 있게 낼 수 있는 회사가 극히 적고 실리콘 저메이늄(SiGe)이 그중 하나라는 것이 1.6T 트랜시버 물량의 큰 부분을 받고 있다는 주장의 근거다.
경쟁 구도를 보는 문장도 여기 붙는다. "지금 나의 적은 구리다. TSMC가 이기고 우리도 이기면 좋다. 둘 다 구리를 밀어내는 것이니까. 구리가 다 사라지기 전까지는 시장이 넉넉하다". 대체 대상이 경쟁사가 아니라 기존 방식일 때 업계가 어떻게 말하는지를 보여 주는 장면이다.
먼저 성격을 밝혀 둔다. 이 회차는 게스트 한 사람의 설명이고 그는 자사 사업 책임자다. 반대편(TSMC, 200mm에 남은 경쟁사들, 인듐인화물·EML 진영)의 답은 없다. 특히 5년 전 실리콘 포토닉스를 눌렀다던 인듐인화물이 200·400기가비트에서 무엇을 준비하는지가 비어 있다.
값이 없는 곳도 셋이다. ① 가격이 한 번도 나오지 않는다. CPO가 DSP를 없애 원가를 아낀다는 방향은 말했지만 얼마인지는 없어서 전환 시점을 셈할 수 없다. ② Scale의 양산 일정과 고객 이름이 없다. 「첫 OCI 가능 플랫폼」이라는 표현만 있고 언제 무엇에 실리는지가 없다. ③ Meta 연구의 조건이 어림이다. 5만 개, 5천만 시간이라는 수에 Barber 스스로 「내 기억으로는」에 해당하는 단서를 달았다.
무엇이 나오면 이 글의 판단이 바뀌는지는 셋이다. ① Meta 외의 대형 운영자가 CPO 신뢰성 데이터를 내놓으면 4절의 「검증 일정만 남았다」가 확인되거나 무너진다. 지금 근거는 한 회사의 시험 하나다. ② OCI 참여사의 실제 채택이 드러나면 5절이 달라진다. 규격 합의와 채택은 다른 일이고, PAM4에 이미 투자한 SerDes·DSP 업체가 NRZ 회귀를 반길 리 없다는 것은 이 글의 짐작이다. ③ 400기가비트 레인이 실제로 서면 6절의 SiGe 논거가 시험대에 오른다. 600~700기가헤르츠 트랜지스터를 낼 수 있는 회사가 정말 극소수인지는 그 세대의 수주가 갈릴 때 드러난다.