앤스로픽이 매니지드 에이전트(Managed Agents)를 만들며 부딪힌 문제와 해법 네 가지를 정리함. 뇌(하니스)와 손(컨테이너)을 분리해야 하는 이유, 검증을 별도 컨텍스트로 떼어내야 하는 이유, 클로드가 포켓몬을 플레이하며 잘못된 위치 기억을 5번 중 5번 반복하다 꿈꾸기(dreaming)로 고친 실험까지 다룸.
한줄 코멘트. 기억을 적어 두는 것만으로는 모자라다는 대목이 이 발표에서 가장 구체적이다. 일하며 바로 적는 기억만 쓰자 같은 함정에 되풀이해 빠졌고, 다섯 번 돌려 다섯 번 다 그랬다. 일이 끝난 뒤 따로 훑어 잘못 적힌 것을 고치는 과정을 붙이고서야 다음으로 넘어갔다.
앤스로픽에서 비동기로 도는 에이전트를 다루는 사람이 발표한다. 자막에 자기 이름을 대는 대목은 없다.
먼저 맡길 수 있는 일의 길이가 어떻게 늘었는지 짚는다.
맡기는 일의 길이와 그에 맞춰 나온 것
| 시기 | 한 번에 맡길 수 있던 길이 | 그때 쓰던 것 |
|---|---|---|
| 오퍼스 3 무렵 | 10~20분 | 메시지 API. 묻고 답하는 정도 |
| 클로드 코드 무렵 | 한 시간쯤 | 에이전트 SDK |
| 지금 | 12시간 넘는 대 | 매니지드 에이전트 |
일이 길어질수록 감싸는 장치가 두꺼워진다는 것이 이 표의 이야기다.
머리와 손을 나눈다
오래 도는 일을 버티게 하는 자름이 여기 있다. 생각하는 자리인 *하네스는 상태를 안 들고 있다. 무슨 일이 있었는지는 기록이 맡는다. 그 기록은 덧붙이기만 하는 방식이다.
실제로 돌리는 일은 *컨테이너가 한다. 머리가 죽었다 살아나도 기록을 다시 읽어 이어 갈 수 있는 구조다.
안전 쪽도 한 줄 짚는다. 자격 증명은 손이 든 상자에 넣지 않는다. 따로 둔 금고에 두고 필요할 때만 꺼낸다.
만드는 에이전트와 검사하는 에이전트를 다른 맥락으로 갈라 둔다. 검사하는 쪽은 자기 목표와 *루브릭을 따로 들고, 만든 쪽의 결과를 채점한다.
통과할 때까지 이 왕복이 이어진다. 만든 사람이 자기 것을 검사하지 않게 한 것이 요점이다.
기억을 쓰는 두 갈래
기억을 쓰는 두 갈래
이 발표에서 가장 구체적인 실험이 여기 나온다.
기억을 쓰는 방식이 둘이다. 하나는 일하는 중에 그때그때 파일에 적는 것이다. 다른 하나는 일이 끝난 뒤 따로 돌면서 쌓인 것을 훑어 잘못 적힌 것을 고치는 것이다. 발표자는 뒤쪽을 사람의 잠에 빗댄다.
클로드가 포켓몬을 하게 두고 셋을 견줬다.
기억을 어떻게 쓰느냐로 갈린 결과
| 조건 | 어떻게 됐나 |
|---|---|
| 기억 없음 | 거의 나아가지 못했다 |
| 일하며 적는 기억만 | 같은 함정에 되풀이해 빠져 되돌아갔다 |
| 나중에 훑어 고치기까지 | 그 잘못을 고치고 다음 단계로 나아갔다 |
다섯 번 돌려 다섯 번 다 가운데 줄의 일이 벌어졌다고 한다. 적어 둔 기억에는 틀린 것도 함께 남는다는 이야기다.
마지막 갈래는 자리 문제다. 지금까지 에이전트는 대체로 혼자 쓰는 것이었다. 각자 자기 맥락에 맞춰 다듬은 장치를 자기 컴퓨터에서 굴렸다.
그것을 조직이 함께 쓰는 쪽으로 옮긴다. 조직 전체가 접근하고, 그 장치가 자기 신원과 자격 증명을 갖고, 조직 수준의 맥락에 닿는 형태다.
12시간이라는 길이가 무엇을 잰 값인지 좁혀지지 않는다. 바깥 측정 기준을 따랐다고 말하지만, 어떤 일을 맡겼을 때의 값인지와 그중 몇 번이나 끝까지 갔는지가 없다.
포켓몬 실험이 다른 일에도 통하는지 없다. 다섯 번 중 다섯 번이라는 값은 또렷한데, 게임 하나에서 본 것이 코드나 문서 작업에서도 같은 모양으로 나오는지는 나오지 않는다.
나중에 훑어 고치는 과정의 값이 없다. 얼마나 자주 돌려야 하는지, 그 과정 자체가 잘못 고칠 확률은 얼마인지가 없다. 기억을 고치는 장치가 기억을 망칠 수도 있는 자리다.
발표자가 모른다고 말하는 대목도 있다. 앞선 모델이 아닌 것들이 왜 이 영역에 못 오는지 확실히 모르겠다고 한다. 자기가 만든 형편없는 봇이 많다는 말도 한다.
용어