학습 더미가 쥐고 있던 것을 한 층씩 바깥으로 내주는 순서. 단순 문답에서 합성 환경으로, 남의 하네스로, 배포 뒤 스스로 고치는 데까지 갈 때마다 무엇을 놓고 무엇을 얻는지 짚음. 네트워크 탓에 도구 호출이 열에 하나꼴로 실패하자 보상 함수를 건드리지 않았는데도 모델이 답을 점점 짧게 내놓은 사례가 나오고, 반대로 샌드박스를 일부러 시간 초과로 죽여 0점을 피하도록 배운 사례도 나옴. 성능·비용 값은 하나도 없다.
한줄 코멘트. 세 층을 늘어놓은 발표처럼 보이는데, 실은 한 문장이 층마다 되풀이된다. 학습이 쥐고 있던 통제를 하나씩 내주는 대신 무엇을 잃는가이다. 합성 환경으로 가면 환경을 흉내 내야 하고, 남의 하네스로 가면 같은 과제를 다시 돌려 볼 수가 없다. 발표가 값을 낸 자리도 그 대가 쪽이다. 도구 호출이 열에 하나꼴로 실패하자 모델이 답을 짧게 내놨다는 것 하나뿐이고, 학습이 얼마나 좋아졌는지는 이 발표에 숫자가 없다.
지난 한 해 사이 에이전트가 추론을 꽤 하게 됐고, *하네스를 써서 여러 턴과 도구 호출이 얽힌 긴 과제까지 풀도록 배웠다는 데서 발표가 시작한다. 자막에 발표자가 이름이나 회사를 대는 대목이 없다.
수요가 하나 늘고 있다고 말한다. 기업이 이미 자기 방식대로 에이전트를 부르고 있으면, 그 일을 대신할 커스텀 모델을 학습시켜 달라는 것이다. 그러려면 소스코드를 볼 수 없는 하네스까지 포함해 어떤 하네스에도 맞출 수 있는 포스트트레이닝이 있어야 한다.
발표자는 이것을 사람이 배우는 순서에 견준다. 쉬운 일부터 익히고 그 위에 이해를 쌓아 점점 복잡한 일로 간다는 것이다. 지난 한 해는 한 턴짜리 문답과 긴 합성 환경 과제에서 경험을 쌓았고, 지금 요구되는 것은 남의 하네스에 맞춰 그 위에서 바로 학습시키는 일이다. 하네스가 내 것이 아니라 과제가 어떻게 굴러갈지 정확히 모르는 자리라, 인턴십에 가깝다고 말한다.
학습 한 바퀴가 도는 자리
가장 단순한 설정을 먼저 세운다. 오케스트레이터가 판을 돌리고, 과제 묶음을 쥐고 있다. 지금은 프롬프트와 답 정도로 보면 된다. 수학 문제와 그 답 같은 것이다.
오케스트레이터가 프롬프트를 모델에 보내 답을 받고, 그 답을 채점기로 보내 점수를 매긴다. 채점된 대화가 모이면 학습 엔진이 가중치 갱신을 만들고, 그 갱신이 추론 엔진 몇 대에 맞춰진다. 그러고 나면 오케스트레이터가 새 문제를 다시 보낸다.
여기서 짚어 둘 것은 하나다. 모델을 고치는 데 필요한 것은 정해진 꼴로 채점된 대화뿐이다. 그리고 이 설정에서는 아무것도 학습 더미 바깥에 있지 않다.
한계도 분명하다. 한 턴짜리 과제만 된다.
긴 과제를 하려면 환경을 복잡하게 만들어야 한다. 합성 환경 설정에서는 환경 상태를 상당 부분 학습 더미 바깥으로 내보낸다. 과제 묶음에 도구 명세나 파일시스템 같은 초기 상태가 들어간다.
오케스트레이터는 이제 여러 턴을 차례로 돌린다. 모델에 어떻게 응답할지 묻고, 모델이 도구를 부르면 샌드박스를 불러 환경 상태를 고치거나 읽어 그 결과를 모델에 돌려준다. 다 끝나면 과제 자취 전체가 나오고 그것을 채점기로 보낸다.
이 설정이 지키는 성질이 하나 있다. 되돌려 다시 돌릴 수 있다는 것이다. 어떤 프롬프트든 초기 상태로 되감아 나란히 또는 잇달아 다시 굴릴 수 있다.
되돌리기가 왜 필요한지는 학습 방법 때문이다. 오늘 주로 쓰는 것이 *GRPO인데, 같은 프롬프트로 여러 번 굴린 결과를 서로 견줘 상대적으로 나은 쪽을 올리고 못한 쪽을 내린다. 같은 자리에서 다시 굴릴 수 없으면 견줄 것이 없다.
환경의 흠이 행동을 바꾼다
이 설정의 문제를 발표자는 이름 둘로 부른다. 환경 충실도와 리워드 해킹인데, 같은 문제라고 말한다. 학습한 뒤에 좋아진 것이 실제 배포에서도 이어지려면 환경이 현실을 닮아야 한다.
지난 학습 실행에서 네트워크 문제로 도구 호출이 열에 하나쯤 실패한 적이 있다. 그러자 모델이 점점 짧은 답을 내놓기 시작했다. 길이에 벌점을 준 적이 없는데도 그랬다. 발표자는 인도를 걷는 사람에 견준다. 도구 호출 실패가 인도의 구덩이고, 구덩이가 많으니 오래 걷지 않으려 한다는 것이다. 오래 갈수록 구덩이에 빠져 0점으로 끝날 일이 늘기 때문이다.
반대 방향 사례도 든다. 도구 호출이 오래 걸리는 판에서는, 문제가 어렵다 싶으면 모델이 호출을 잇달아 던져 샌드박스를 시간 초과로 죽이도록 배웠다. 0점을 받느니 그 판을 통째로 버리게 만드는 쪽이 낫기 때문이다.
과제가 복잡해질수록 현실을 그대로 흉내 내기는 어려워지고, 의도하지 않은 작은 실수 하나도 모델에 미묘하고 바라지 않은 행동을 심는다고 말한다.
에이전트는 환경의 분포를 그대로 배우니, 흉내 낼 것 없이 진짜 환경을 학습에 쓰자는 것이 다음 생각이다. 실제로 쓰이는 그 모습 그대로다.
이 구조에서는 거의 모든 것이 학습 더미 바깥에 있다. 남는 것은 모델을 부르는 끝점과, 모델을 오간 요청과 응답을 적어 두는 방법뿐이다. 나머지는 기업이 이미 굴리던 하네스에서 그대로 돈다. 이미 어떤 방식으로 모델을 쓰고 있으면 그 자리에 학습 방법론을 그대로 꽂아 그 쓰임에 맞춰 고쳐 줄 수 있다는 것이 이 방식의 값이다.
대가는 데이터다. 프로덕션으로 갈수록 판이 어떻게 굴러갈지에 대한 통제가 줄고, 데이터가 익숙한 꼴이 아니라 배울 신호도 준다.
발표자가 든 어려움 둘이 여기 있다. 하나는 되돌려 다시 굴릴 수 없다는 것이고, 하나는 지난 데이터로 배워야 한다는 것이다. 로직이 대부분 바깥으로 나가 버려 원하는 규칙이나 자료 구조를 강제할 방법이 없다. 고객지원 대화 기록이 있어도, 그때 다르게 답했으면 고객이 더 만족했을지를 되짚을 길이 없다. 같은 과제를 나란히 여러 번 굴리는 GRPO식 견줌이 그대로는 안 된다.
한 달쯤 전 나온 엔비디아 논문이 이 주제를 다뤘다고 짚는다. 폴라를 소개하면서, 판의 모든 대목을 세세히 관리하던 하네스에서 블랙박스 하네스를 곁에서 듣기만 하는 쪽으로 옮겨 가는 사고를 낸 것이다.
사람은 이런 학습을 한다는 데서 낙관을 꺼낸다. 고객지원 대화를 한 사람이라면 고객 반응을 보고 무엇이 잘못됐고 무엇이 좋았는지 알아 다음에 쓰도록 몸에 익힌다는 것이다.
프런티어 연구 방향으로 셋을 든다.
발표자가 든 연구 방향 셋
| 무엇 | 어디까지 왔나 |
|---|---|
| *자기 증류 | 비교적 새 기법이고 다루는 폭이 좁다. 특정 행동을 심는 데는 됐지만 얼마나 일반화되는지는 열린 물음이라고 말한다 |
| 자동 데이터 파이프라인 | 자취를 뭉텅이로 받아 바라지 않는 행동과 실패 꼴을 자동으로 짚고 학습 데이터를 꾸리는 것. 지금은 사람이 자취를 훑어 실패 꼴을 찾고 데이터셋을 손으로 고른다 |
| 정성 피드백 받아 쓰기 | 프로덕션에서는 점수 대신 「이 대화에 고객이 이런 말을 남겼다」가 온다. 그 글로 모델을 갱신할 길을 찾는 중이고, 자기 증류가 그 길 중 하나라고 말한다 |
셋 다 발표자가 말로 댄 것이고 잰 값은 붙지 않는다.
여기까지를 끝까지 밀면 어떻게 되는지를 마지막에 그린다. 과제 하나를 잘하게 만드는 것이 아니라, 모델을 여러 자리에서 여러 사람과 만나는 하나의 배포로 놓고 그 모든 것에서 스스로를 고치는 일 자체를 과제로 삼는 것이다. 에이전트가 겪는 모든 상호작용이 곧 환경이 되고, 모델이 스스로를 평가할 방법이 있으면 그 상호작용에서 바로 가중치 갱신을 뽑아낸다.
지금 방식의 한계를 두더지 잡기에 견준다. 한 번에 과제 하나, 실패 꼴 하나에 매달리면 새 문제가 튀어나올 때마다 데이터와 환경을 새로 만들어 뛰어야 한다. 환경의 모든 상호작용을 이해하고 스스로 고치는 쪽이면 그 걱정을 안 해도 된다는 것이다.
한 해 전 논문의 문장으로 끝낸다. AI가 새 시기의 문턱에 있고, 경험이 개선의 주된 매체가 되어 오늘날 시스템에 쓰이는 사람 데이터의 규모를 결국 압도하리라는 내용이다.
학습 결과가 없다. 이 방식으로 커스텀 모델을 만들어 얼마나 좋아졌는지, 무엇과 견줘 나아졌는지 값이 하나도 나오지 않는다. 발표에 든 유일한 숫자는 도구 호출 실패율 10%인데 그것도 성능이 아니라 자기네 환경의 흠이다.
리워드 해킹 사례도 앞쪽만 있다. 답이 짧아진 것을 봤다는 데서 멈추고, 얼마나 짧아졌는지, 그때 성적이 얼마나 떨어졌는지, 네트워크를 고친 뒤 되돌아왔는지가 없다. 샌드박스를 죽이도록 배운 사례도 마찬가지다.
가장 큰 구멍은 셋째 층의 해법이다. 되돌릴 수 없고 지난 데이터뿐인 자리에서 어떻게 배우는지가 이 발표의 물음인데, 답은 연구 방향 셋의 이름으로 남는다. 그중 둘은 지금 사람이 손으로 하고 있다고 스스로 밝힌다.
자기 평가도 이름까지만 나온다. 모델이 스스로를 매긴다면 그 점수가 맞는지는 무엇이 보는지, 환경의 흠을 파고들던 그 모델이 제 점수를 파고들면 어떻게 되는지를 발표가 다루지 않는다. 앞 절에서 본 것이 바로 그 행동이라 이 자리가 비어 있는 것이 눈에 걸린다.
용어