평가가 왜 흩어지고 검증도 안 되며 소수만 만드는지 세 가지로 짚고, 그것을 고치려는 네 갈래 시도를 봄. 경쟁 연구소가 자기 모델에만 압축을 켜서 같은 벤치마크를 더 좋은 점수로 다시 낸 일, 포커에서 뜻있는 차이를 얻으려 40만 판을 돌린 값, 앞선 여섯 모델이 서로 몇 퍼센트포인트 안쪽인데 하네스를 바꾸면 22퍼센트포인트까지 갈린다는 인용, 그리고 튀르키예 폐수처리 기사가 자기 일로 만든 평가 사례가 나옴.
한줄 코멘트. 평가를 만드는 사람이 3만 명인데 그 결과를 쓰는 사람이 3천만 명이라는 대비가 이 발표의 손잡이다. 값나가는 대목은 인용으로 끌어온 한 줄 — 모델을 바꿀 때보다 하네스를 바꿀 때 점수가 더 갈린다는 것이다. 다만 발표자 본인이 그것을 확인해 보지는 않았다고 그 자리에서 밝힌다.
두 사람이 나온다. 한 명은 벤치마크 쪽 제품을 맡고, 한 명은 소프트웨어를 만든다고 밝힌다. 3천만 명 넘게 쓰는 커뮤니티라고 소개하며, 지난 두 해를 이 문제에 썼다고 말한다.
첫째, 흩어져 있고 금세 낡는다. 새 벤치마크가 하루에 열 개 넘게 나오는데 그것을 찾는 방법이 논문 목록을 몇 시간씩 훑는 것뿐이다. 게다가 만든 사람들이 다음 논문으로 넘어가 버려 순위표가 시간이 갈수록 뜻을 잃는다.
둘째, 속이 안 보이고 다시 해 볼 수도 없다. 사례가 구체적이다. 어느 연구소와 함께 벤치마크를 냈더니 경쟁 연구소가 결과가 마음에 안 든다며 직접 돌려 훨씬 좋은 값을 냈다. 갈린 이유는 자기 API가 주는 압축 기능을 자기 모델에만 켰기 때문이었다. 이쪽은 어느 모델에도 그것을 안 켰다.
셋째, 만드는 사람이 너무 적다. AI 연구자가 3만 명 남짓인데 기술 쪽 사람은 3천만 명이라고 말한다. 다만 이 수는 검색해서 얻은 것이라고 스스로 밝힌다.
이어지는 논리가 이 발표의 뼈대다. 재지 않는 것은 얼마나 잘하는지 알 수 없고, 알 수 없으면 올라갈 수도 없다. 그래서 모델이 잘하는 데와 못하는 데가 더 들쭉날쭉해질 것이라고 말한다.
사례 하나를 든다. 튀르키예에 사는 20년 경력의 폐수처리장 기사가 자기 경험으로 평가를 만들었다.
계기가 무겁다. 그 나라에서 안전 절차를 지키지 않아 사람이 죽은 사고가 있었고, AI가 자기 일에서 그것을 도울 수 있는지 재려고 만들었다는 것이다.
그러면서 짚는다. 이 자료는 웹 어디에도 없고, 어느 연구소의 관심 밖이다. 지금으로서는 돈이 안 되기 때문이다.
네 갈래
| 갈래 | 무엇인가 |
|---|---|
| 해커톤 | 누구나 열 수 있게 판을 깔아 준다 |
| 에이전트 시험 | 내 에이전트에 한 줄만 붙이면 시험을 치르고 점수가 나온다 |
| 게임 아레나 | 모델끼리 겨루게 해서 순위를 매긴다 |
| 벤치마크 | 누구나 만들고 돌리고 나눌 수 있게 한다 |
해커톤은 지금 딥마인드 쪽 팀과 함께 돌리는 중이라고 말한다. 몇 주 전 낸 논문이 인지 능력을 열 갈래로 나눴는데 그중 다섯에 집중해 열었다는 것이다.
여기서 실무적인 어려움이 나온다. 참가자가 천 명이면 자료를 어디에 두고 모델에 어떻게 닿게 할지가 문제다. 형편이 어려운 참가자는 앞선 모델들에 닿으려고 열쇠 다섯 개 값을 낼 수 없다고 짚는다.
또 하나. 새로움과 창의성을 판정하는 데는 에이전트가 아직 서툴러서 사람 전문가가 필요한데, 전문가끼리 판단을 맞추는 것부터 쉽지 않다고 말한다.
에이전트 시험은 지난주에 낸 것이라고 밝힌다. 이름을 원래 다르게 붙였다가 상표 문제로 바꿨다고 한다. 일주일 만에 에이전트 500개 넘게 시험을 치렀다.
난이도를 두고 하는 말이 정직하다. 너무 어려우면 끝내는 사람이 없고 너무 쉬우면 쓸 만한 신호가 안 나온다.
앞으로의 쓸모로 하나를 든다. 에이전트를 받은편지함이나 계정을 맡기러 내보내기 전에 안전 쪽으로 기준선을 잡는 시험이다.
게임 아레나는 벤치마크가 금세 *포화되는 문제에 대한 답이다. 서로 겨루게 하면 한쪽이 늘 다른 쪽과 붙을 수 있어 끝이 안 난다는 것이다.
크게 공들인 게임으로 셋을 든다. 속이는 능력을 보는 인랑, 무작위를 다루는 포커, 그리고 체스다.
포커에서 나온 관찰이 재미있다. 어떤 모델은 판돈을 다 거는 것을 즐긴다. 그리고 뒤집힌 대목 — 최신 세대 중 일부는 위험을 더 피하려 들어서 포커를 더 못한다.
값도 나온다. 뜻있는 차이를 얻으려고 포커를 40만 판 돌려야 했다.
만드는 순서도 밝힌다. 게임을 고르고, 모델이 실제로 둘 수 있는지 보고, 프롬프트가 공정해지도록 오래 다듬는다. 그 뒤 껍데기를 짜고 돌리고, 겨룰 짝을 정하는 데는 짝지어 견주는 방식을 쓴다. 오간 대화는 자료로 공개하고 *엘로 점수와 함께 낸다. 전부 열려 있다고 말한다.
스스로 아쉬워하는 대목도 있다. 모델끼리 두는 것을 지켜보는 일이 좀 지루해진다는 것이다. 그래서 사람들이 프롬프트를 내는 식으로 끌어들일 방법을 궁리 중이라고 한다.
모델보다 하네스가 더 나눈다
무엇을 바꿀 때 점수가 더 갈리나
이 발표에서 가장 값나가는 한 줄이 여기 있다. 남의 글에서 끌어온 것이다.
어느 코딩 벤치마크에서 앞선 모델 여섯이 서로 몇 퍼센트포인트 안쪽이었다. 그런데 정말 크게 나눈 것은 어느 하네스 안에서 도느냐였고 그 차이가 22퍼센트포인트였다.
발표자는 곧바로 단서를 단다. 자기가 확인해 본 것은 아니고 그럴듯해 보인다는 것이다.
시간을 건너 견주는 일도 어렵다고 말한다. 옛 모델은 사라지고 새 모델이 오는데, 어떤 창구는 뒤에서 실제로 무엇이 도는지 정직하게 알려 주지 않는다고 한다.
평가가 쌓이는 세 칸
벤치마크 쪽은 내보내기 전에 쓰는 판이 아니라 사람들을 끌어들이는 판이라고 못 박는다.
짜임은 단순하다. 코드로 못 박는 단언을 쓰고, 판정이 어려운 자리에는 모델을 부른다. 그것들이 과제로 묶이고 과제들이 다시 벤치마크로 묶인다.
직전 발표자가 만든 과제를 예로 든다. 그림 파일을 읽어 다시 그려 보게 하는 것이고, 글자가 맞는지 따위를 단언으로 걸었다.
어려움도 밝힌다. 사람들이 평가를 만들게 부추기는 일 자체가 어렵다. 해커톤과 점수·훈장 같은 장치가 도움이 됐다고 한다.
마지막 말이 이 발표에서 가장 무겁다. 모델 하나를 재던 데서 에이전트가 무엇을 하는지로 옮겨 오면서, 우리가 대체 무엇을 재고 있는지 알기가 훨씬 어려워졌다.
22퍼센트포인트는 남의 값이고 확인 안 했다. 발표자가 직접 그렇게 말한다. 어느 벤치마크 하나에서 나온 값이라는 것도 새겨야 한다.
3만과 3천만은 검색해서 얻은 수다. 발표자가 그 출처를 그렇게 밝힌다.
시험 500개의 속이 없다. 무엇을 치렀고 점수가 어떻게 갈렸는지가 없다.
40만 판이 무엇을 말해 주는지가 없다. 그만큼 돌려야 했다는 것만 나오고 그래서 무엇이 갈렸는지, 값이 얼마나 들었는지가 없다.
폐수처리 사례의 결과가 없다. 그런 평가를 만들었다는 것까지만 나오고 모델이 거기서 어땠는지가 없다.
압축을 켜고 낸 그 사건의 뒤가 없다. 다시 맞춰 돌렸는지, 어느 쪽이 맞았는지가 나오지 않는다.
용어