언어 모델의 역사를 병목 하나씩 뚫어 온 자국으로 다시 읽고, 지금 걸린 것이 답하기 전에 쓰는 계산량이 요청마다 고정돼 있다는 점임을 보여줌. 생각 단계를 고리로 끼워 수천에서 수만 번 돌게 하되 몇 번 돌지는 강화학습으로 모델이 배우게 한 과정, 초기 실험에서 모델이 제 가설을 스스로 기각하던 대목, 모델 크기라는 이산 선택이 연속 예산 슬라이더로 바뀐 것까지 나옴. 딥 싱크가 미국 수학 올림피아드에서 50번째 백분위를 65번째로 끌어올렸다는 값이 발표의 유일한 성능 수치다.
한줄 코멘트. 발표의 절반이 역사인데 그 역사가 장식이 아니다. 저장을 못 해서 막히고, 문맥이 뭉개져서 막히던 자리를 하나씩 풀어 온 끝에 지금 걸린 것이 답하기 전에 쓰는 계산의 양이라는 자리 매김이다. 그래서 생각 단계는 새 기능이 아니라 앞선 병목들과 같은 줄에 놓인 다음 항목이 된다. 다만 이 발표에 값은 딱 하나 나온다. 수학 올림피아드 백분위다. 나머지는 그림의 추세선과 「경험적으로 되고 있다」는 문장이다.
발표자는 구글 연구자이고 제미나이 안에서 씽킹을 이끄는 사람이라고 자기를 소개한다. 발표 앞머리에 슬라이드가 안 떠서 진행 요원과 몇 마디 주고받는 대목이 그대로 남아 있다.
막힌 것을 하나씩 풀어 온 자국
1948년으로 시계를 되감는다. 클로드 섀넌이 통신의 수학적 이론에서 언어 모델을 만든다. 손으로 센 낱말 통계 교과서를 가지고 낱말 둘짜리 모델을 짜서 표본을 뽑아 보고는 꽤 그럴듯하다고 감탄한다. 그러면서 이 방식을 키우면 더 나아지겠다고 말한다. 막고 있던 것은 데이터가 적고 통계가 초보적이라는 점이었는데, 그걸 풀려면 인류 지식이 디지털로 옮겨지고 현대적인 계산이 있어야 했다.
몇십 년 뒤 2000년대 구글에서 제프 딘을 비롯한 동료들이 토큰 수조 개로 *엔그램 언어 모델을 학습시킨다. 당시 가장 정교한 음성인식과 번역이 여기서 돌았다. 이번 병목은 문맥이었다. 문맥이 길어지면 저장 비용이 지수로 늘어 짧은 문맥에 갇혔고, 엔그램을 붙들고서는 돌아갈 길이 없었다.
2010년 순환신경망이 그 자리를 푼다. 지난 것을 신경망 상태에 눌러 담는 방식이라 다섯 낱말을 넘어 문장과 문단까지 다룰 수 있게 됐다. 몇 년 뒤 여기서도 병목이 보인다. 지난 것을 담는 상태가 고정 크기라 넣을 수 있는 정보가 정해져 있고, 그래서 문맥이 손실된 채로 표현된다는 것이다.
풀린 방식은 반대였다. 지난 임베딩을 다 남겨 두고 *어텐션으로 그때그때 모으는 것이다. 어텐션이 여기서 나왔고 곧 트랜스포머로 이어졌다.
10년을 건너뛰면 2024년이다. 제미나이나 챗GPT 같은 범용 대화 에이전트가 강력해졌는데, 이 모델들은 여전히 요청에 곧바로 답하도록 학습돼 있다. 그러니 요청에서 답으로 넘어가는 데 쓰는 계산량이 늘 같은 크기로 고정돼 있다.
발표자가 그 고정된 계산이 어디서 일어나는지 풀어 준다. 요청의 글이 토큰으로 바뀌고 언어 모델을 통과하는데, 층마다 병렬로 계산이 돌고 층과 층 사이에는 반복 계산이 돈다. 그 계산이 내 문제에 모델이 지능을 들이는 자리이고, 그 크기가 정해져 있다.
더 똑똑한 답을 원한다면 모델을 키우는 것도 한 방법이다. 그런데 그것으로는 모자란다고 말한다. 이유가 둘이다. 하나는 폭이다. 어렵고 값나가는 일에는 천 배 백만 배를 생각하게 하고 싶다는 것이다. 다른 하나는 그 폭을 상황에 맞춰 쓰는 것이다. 쉬운 요청에는 적게, 어려운 요청에는 많이, 그것도 모델이 알아서 정하는 쪽이다.
답하기 전에 도는 고리
방식 자체는 단순하다. 모델이 최종 답을 내기 전에 글을 더 내놓는 생각 단계를 끼운다. 이 고리가 수천에서 수만 번까지 돌 수 있으니 답을 확정하기 전에 쓰는 계산이 그만큼 늘어난다. 고리라서 몇 번 돌지도 모델이 배운다.
훈련은 강화학습이다. 사전학습을 마친 제미나이에 여러 과제를 시키고 맞게 풀었는지에 따라 양이나 음의 보상을 준다. 발표자는 이 조리법이 대단히 일반적이라고 말하면서, 무엇이 맞고 틀린지에 대한 흐릿한 신호만 받아 생각 단계 전체로 되돌려 보내는 것으로 모델이 제 생각 토큰 쓰는 법을 다듬는다는 것이 놀랍다고 덧붙인다.
되리라고 확신하지 못했다고도 말한다. 추론 단계에 구조를 얼마나 넣어야 할지가 불분명했다는 것이다. 그때 본 것을 옛 자료로 보여 준다. 정수를 맞히는 문제에서 모델이 생각 토큰으로 먼저 가설을 세우고, 시험해 보고, 이 공식은 성립하지 않는다고 스스로 밝히고 제 아이디어를 버린 뒤 다른 길로 갔다. 여러 아이디어를 시도하고 스스로 고치는 행동이 일반적인 강화학습 조리법에서 나온 것에 놀랐다고 말한다.
요즘 모델이 배우는 전략도 나열한다. 문제를 여러 조각으로 쪼개고, 해법을 여러 갈래로 살피고, 코드 조각을 초안으로 써서 모듈로 쌓고, 중간 계산을 하고, 도구를 쓴다.
첫째는 쌓인다는 것이다. 씽킹은 사전학습을 키우는 길이나 사람 피드백의 품질과 폭을 키우는 길 위에 겹쳐 놓이고, 셋을 함께 밀면 곱해진 효과가 난다고 말한다.
최근 제미나이 출시들을 늘어놓은 그림도 보여 준다. 가로축이 로그로 그린 *테스트타임 컴퓨트고 세로축이 수학·코드·과학 성적인데, 둘이 함께 올라간다. 왼쪽 끝이 작년 12월에 씽킹 없이 나온 2.0 플래시 실험판이고 오른쪽이 처음 나온 2.5 프로다. 발표자는 이 그림을 두고 테스트타임 스케일링이 경험적으로 되고 있다고 말한다. 축의 값은 대지 않는다.
둘째는 고르는 방식이다. 예전에는 모델 크기 몇 개 중 하나를 골라 품질과 비용을 함께 정했다. 이제는 예산이 연속이라 원하는 능력을 훨씬 잘게 끊어 고를 수 있다. 씽킹 버짓이 2.5 시리즈의 플래시와 프로에 나와 있다.
다음으로 하려는 일 둘을 든다. 하나는 생각을 효율적으로 만드는 쪽이다. 사용자가 따로 손대지 않아도 알아서 맞춰지기를 바라고, 지금 모델들이 과제에 과하게 생각하는 사례를 찾을 수 있다고 스스로 말한다.
다른 하나가 반대 방향이다. 추론 계산을 더 키워 능력을 더 끌어내는 쪽이다. 오래 걸려도 좋으니 파고들게 하는 제미나이 딥 리서치가 그런 예다. 그 위에 딥 싱크를 알렸고 신뢰받는 테스터에게 내주는 중이라고 말한다. 2.5 프로 위에 올린 아주 높은 예산 모드이고, 어려운 문제를 던져 놓고 다른 일을 하다 돌아와 받는 쓰임을 노린다. 핵심은 훨씬 깊은 *사고 사슬과, 서로 합쳐지는 여러 갈래 사고 사슬이다.
미국 수학 올림피아드에서 나온 값
| 무엇 | 값 | 언제 것 · 성격 |
|---|---|---|
| 당시 최고 모델 | 사실상 무의미한 성적 | 1월 · 발표자 표현 |
| 2.5 프로 | 참가자 중 50번째 백분위쯤 | 발표 시점 · 구글 자체 값 |
| 딥 싱크 | 65번째 백분위 | 발표 시점 · 구글 자체 값. 자막이 숫자를 한 번 뭉갠다 |
기반 모델을 고치는 것과 딥 싱크에 들어가는 알고리즘을 고치는 것이 함께 쌓일 것이라고 말한다.
올림피아드 대수 문제 하나를 푸는 과정은 미리 만든 영상으로 보여 준다. 모순으로 증명하는 길에서 시작해 롤의 정리와 뉴턴의 부등식 두 갈래를 살피고 그것을 합쳐 증명에 이른다. 발표자는 이 영상에서 가져갈 것이 많지는 않은데 보기 좋아서 넣었다고 말한다.
코딩 쪽으로도 하나 든다. 동료들이 딥마인드의 원조 DQN 논문에서 시작해 학습 설정과 알고리즘은 물론 아타리 에뮬레이터까지 제미나이로 짜서 게임을 돌게 만들었다. 예전 같으면 자기와 동료들에게 몇 달이 걸렸을 일이 몇 분 만에 일어나기 시작한다는 것이다.
끝은 사람이다. 20세기 초 수학자 한 사람을 든다. 수학 교과서 한 권만 쥐고 학계와 떨어져 있었는데, 작은 문제 묶음에서 시작해 교과서 여러 권 분량을 생각해 나가며 제 이론을 세워 방대한 수학을 만들었다. 자막이 이름을 뭉갠다. 모델도 그렇게 적은 것에서 깊이 파고들어 추론 토큰 수백만 개 너머까지 가며 지식을 쌓기를 바란다고 말한다.
성능 값이 하나뿐이다. 수학 올림피아드 백분위 말고는 잰 값이 없다. 씽킹이 되고 있다는 근거로 든 그림도 축에 숫자가 없고, 어떤 과제 묶음에서 잰 것인지 대지 않는다.
비용도 마찬가지다. 예산을 잘게 고를 수 있다는 것이 개발자에게 주는 값인데, 예산을 올릴 때 값과 지연이 얼마나 오르는지가 나오지 않는다. 자기네 모델이 비용 대비 좋다고 말하면서 견줄 수 있는 값은 대지 않는다.
과하게 생각하는 문제도 스스로 꺼내 놓고 크기를 대지 않는다. 어떤 과제에서 얼마나 자주 그러는지, 그 손해가 얼마인지가 없다.
딥 싱크가 어떻게 도는지도 이름까지만 나온다. 사고 사슬 여러 갈래가 서로 합쳐진다고 했는데, 몇 갈래를 띄우는지, 합치는 판단을 무엇이 하는지, 그 값이 얼마인지는 설명하지 않는다. 백분위 65가 그 값으로 산 것인지도 알 수 없다.
강화학습 쪽도 조리법 수준에서 멈춘다. 어떤 과제로 훈련하는지, 보상을 무엇으로 매기는지, 정답이 없는 일에는 어떻게 하는지가 발표에 없다.
용어