한 자씩 뽑는 방식보다 훨씬 빠른데도 큰 모델에 아무도 안 넣는 이유를 칩의 나르는 길에서 설명함. 토큰 256개를 스물네 번 훑어 만들면 실어 나르는 횟수가 10분의 1이 된다는 셈, 실제로 찍은 초당 2000토큰, 세 번 훑는 사이 스스로 오답을 두 번 고쳐 맞힌 사례가 나옴. 무엇을 몇 번 훑을지 모델이 스스로 정한다는 대목과, 지금 쓰이는 자리가 기기 위뿐이라는 자인도 함께 있음.
한줄 코멘트. 빠른 이유가 셈이 아니라 나르기에 있다는 설명이 이 발표의 값이다. 그리고 드물게 자기 기술이 안 쓰이는 이유를 먼저 말한다 — 한 사람에게는 빨라도 여럿을 한꺼번에 받으면 처리량이 낮아 내보내는 값이 더 든다는 것이다. 든 수치는 대부분 한 해 전 것이고 발표자도 그렇게 밝힌다.
연구소에서 연구원으로 일한다는 사람이 발표한다. 앞을 내다보는 연구 갈래라고 소개한다.
그림 쪽에서 하던 *디퓨전을 그대로 옮긴 것이다. 학습할 때는 정답에 잡음을 섞어 두고 그것을 걷어 내게 가르친다. 만들 때는 온통 잡음인 상태에서 시작해 되풀이해 다듬는다.
글에서는 그 잡음이 아무 토큰으로 바꿔 놓는 것이 된다.
한 해 전 이 방식으로 만든 시험판을 10만 명쯤에게 열었다고 말한다. 그때 견준 상대와 전반적으로 비슷했고 코드 쪽이 조금 낫고 다른 데가 조금 못했는데 지연은 훨씬 나았다고 한다. 그러면서 한 해 전 값이니 지금 기준으로 너무 믿지 말라고 덧붙인다.
빠른 이유는 셈이 아니라 나르기에 있다
한 자를 더 내놓기까지 무엇을 나르나
이 발표에서 가장 또렷한 설명이다.
칩에는 셈할 힘은 넉넉한데 실어 나르는 길이 좁다. 그 길을 넓히는 것이 비싸고 셈하는 힘을 붙이는 것이 싸기 때문이다.
한 자씩 뽑는 방식은 토큰 하나를 내놓을 때마다 가중치와 쌓아 둔 캐시를 통째로 실어 날라야 한다. 그러니 셈이 아니라 나르는 데서 발이 묶인다.
이쪽은 다르다. 긴 자리를 통째로 놓고 몇 번 훑어 고친다. 그래서 셈을 든다 — 토큰 256개를 스물네 번 훑어 만들면 나르는 횟수가 10분의 1이고, 정말 나르기에 묶여 있었다면 그만큼 빨라진다.
실제로 시험판이 초당 2000토큰쯤을 꾸준히 냈다고 말한다. 그것이 브라우저에서 실제로 받는 수였다고 덧붙인다.
딸려 오는 성질도 든다. 한 자씩 뽑는 쪽은 앞만 볼 수 있는데 이쪽은 뒤도 본다. 그리고 되풀이하는 구조라 어려운 것에 더 오래 붙들게 가르칠 수 있다.
바로 이어서 단점을 댄다. 여럿을 한꺼번에 받을 때 처리량이 낮다.
이유가 앞의 셈과 맞물린다. 같은 자리를 여러 번 훑으니 셈하는 힘이 먼저 바닥난다. 그래서 한 사람에게는 빨라도 전체로는 덜 나오고 내보내는 값이 더 든다.
그리고 못 박는다. 지금 큰 모델에 이것을 넣는 곳이 없는 것은 주로 이 단점 때문이다.
보인 사례가 좋다. 계산 문제 하나를 놓고 훑을 때마다 답이 어떻게 바뀌는지를 보인다.
한 번 훑은 뒤에는 틀린 답을 적어 놓았다. 두 번째에 다른 틀린 답으로 바뀌었고, 세 번째에 풀이를 끝까지 밟아 스스로 고쳐 맞혔다.
같은 문제에서 그때 새로 나온 훨씬 큰 모델 둘도 틀렸다고 말한다. 하나는 뒤에 가서 자기가 틀렸다며 고쳤고, 다른 하나는 끝까지 안 고치고 그 틀린 값을 그다음 계산에 그대로 물고 갔다.
어려울수록 오래 훑는다
몇 번 훑을지를 모델이 스스로 정한다.
사내에서 보는 코딩 시험 여섯 종에서는 훑는 횟수를 늘릴수록 품질이 대체로 계속 올랐다고 말한다.
시험별로도 갈렸다. 어려운 쪽에서는 오래 붙들었고 기본 문제 위주인 쪽에서는 아주 짧게 끝냈다.
그림 쪽에서 오려 낸 자리를 주변에 맞춰 메우듯, 글에서도 자리를 짚어 고칠 수 있다.
데모가 둘 나온다. 코드에 버그가 있다고 하면 통째로 다시 쓰지 않고 그 자리만 고친다. 이야기 가운데에 문단을 넣어 달라고 하면 앞뒤를 다 보고 있어 앞뒤에 맞게 채워 넣는다.
지연이 낮아서 되는 것들도 보인다. 누를 때마다 그 자리에서 만들어 채우는 백과사전 화면, 비슷하게 만든 게시판, 그리고 누를 때마다 다음 화면을 지어내는 운영체제 흉내다.
질의응답에서 지금 실제로 쓰이는 자리를 밝힌다. 기기 위에서 도는 쓰임이다 — 로봇 같은 것을 든다. 그리고 품질은 큰 것과 사실상 같다고 말한다.
견준 값이 한 해 전 것이다. 발표자가 직접 그렇게 말한다. 지금 판과 견준 자리가 없다.
초당 2000토큰의 조건이 없다. 어느 크기 모델에서, 어떤 물음 길이로, 몇 명이 동시에 쓸 때인지가 없다. 처리량이 낮다는 단점과 이 수가 어떻게 맞물리는지도 안 나온다.
10분의 1은 셈이지 잰 값이 아니다. 정말 나르기에 묶여 있었다면 그렇다는 조건부 계산이다.
여섯 종 시험은 사내 것이다. 무엇인지 밝히지 않고, 훑는 횟수를 늘리면 값이 얼마나 더 드는지도 없다.
값을 어떻게 매길지 모른다고 답한다. 가격을 묻자 아직 거기까지 안 갔고 자신은 연구 쪽이라고 말한다.
틀린 답을 고친 사례가 한 문제다. 스스로 고치는 일이 얼마나 자주 되는지가 없다.
자막이 모델과 도구 이름을 뭉갠다. 견준 상대와 함께 쓴 그림 모델의 이름이 어긋나 있어 정확한 표기는 원문에서 갈린다.
용어