리서치 애널리스트용 에이전트를 400명·50개 팀이 매일 고쳐 내보내며 겪은 것. 「최근 5개 분기」에서 글자 하나가 빠져 월간 값이 분기 값으로 나간 사고, 위에서 에이전트를 바꾸면 아래가 흔들린다고 미리 가정하고 방어막부터 치는 순서, 가드레일을 언제 팀마다 두지 말고 수평으로 떼어낼지.
한줄 코멘트. 옮겨 쓸 만한 것은 「위에 있는 것을 믿지 마라」 한 줄이다. 도구가 판을 거듭할수록 좋아진다는 말은 평균이 좋아진다는 뜻이지 내 호출에서 좋아진다는 뜻이 아니다. 실제로 문자 하나가 빠져 월간 자료가 분기 자료 자리에 들어왔는데, 표를 안 펼치고 답만 내보내는 화면에서는 그것을 잡을 길이 없었다.
블룸버그에서 에이전트를 만드는 조직의 관리자가 스케일링을 두 측면으로 갈라 이야기한다. 하나는 시스템을 어떻게 확장하느냐이고 다른 하나는 조직을 어떻게 확장하느냐다.
회사는 15~16년쯤 AI에 투자해 왔다. 2021년 말 거대언어모델이 눈길을 끌기 시작하자 자체 모델을 만들기로 했고 2022년 한 해를 거기에 썼다. 이듬해 그에 관한 논문을 냈다. 그러다 챗GPT가 나왔고, 공개 가중치와 오픈소스 진영이 잘 자라는 것을 보고 이미 나와 있는 것 위에 짓는 쪽으로 전략을 틀었다고 한다.
지금 이 조직은 400명 규모에 팀이 50개이고 런던·뉴욕·프린스턴·토론토에 흩어져 있다. 생성 AI로 제품을 만들어 온 것은 12~16개월쯤 됐고 도구에서 에이전트 쪽으로 옮겨 가는 중이다.
발표자는 사내에서 「에이전트」와 「도구」를 가르기 어려웠다고 밝히며 어휘를 논문 하나에 맞춰 정했다고 말한다. 이 발표에서 에이전트는 더 자율적이고 기억을 갖고 스스로 바뀔 수 있는 쪽을 가리킨다.
핀테크 회사이고 고객이 금융에 있다는 점이 뒤의 선택을 거의 다 설명한다.
다루는 자료의 양이 먼저 나온다. 하루에 정형 자료 4,000억 건, 비정형 메시지 10억 건 남짓, 잘 쓰인 문서 수백만 건이 들어오고 40년 넘는 이력이 쌓여 있다.
발표는 금융 종사자 열 가지 유형 중 리서치 애널리스트 하나에 집중한다. 이들은 비정형 자료를 찾고 추리고 요약하며, 정형 자료로 분석하고, 동료와 정보를 주고받는다. 일부는 자료를 정규화해 직접 모델까지 만든다.
금융업에 40년 있었다는 사실에서 나오는 조건이 있다. 정밀성·포괄성·속도·처리량·가용성이 협상 대상이 아니고, 기고자와 고객의 자료를 지키는 것과 투명성도 마찬가지다.
2023년에 처음 만든 것은 분기 실적발표 콜을 다루는 제품이었다. 실적 시즌에는 하루에 여러 콜이 겹치므로, 섹터별로 관심 있을 질문에 미리 답을 준비해 두고 애널리스트가 그것을 훑어 더 깊이 볼지 정하게 하려 했다.
처음 성능은 좋지 않았다고 한다. 정밀도와 정확도와 사실성이 그랬다. 게다가 이 요약은 누가 혼자 보는 것이 아니라 모두가 같은 것을 보는 발행물이라 오류 하나의 영향이 크다. 그래서 계속 재고 고치며 요약을 정확하게 만들어 갔다.
지금 구조를 발표자는 *세미 에이전틱이라 부른다. 전부 자율에 맡길 만한 신뢰가 아직 없다는 판단이다. 어떤 조각은 자율이고 어떤 조각은 그렇지 않다. *가드레일이 후자다. 블룸버그는 금융 자문을 하지 않으므로 「여기에 투자해야 하나요」 같은 질문은 걸러 내야 하고, 그 호출은 선택이 아니라 여러 지점에서 반드시 지나가야 한다.
질의 하나가 지나는 길
발표자가 대비로 든 것은 잘 문서화된 소프트웨어다. 행렬곱 API 문서에는 입력의 모든 면과 오류 코드와 걸리는 시간까지 적혀 있다. 그런 것 위에 지으면 내 소프트웨어도 튼튼해진다.
기계학습으로 만든 제품에도 확률적인 구석은 늘 있었지만 그 정도는 다룰 만했다고 한다. 2009년에 만든 뉴스 감성 제품이 예다. 어느 뉴스 와이어를 보는지, 어떤 언어인지, 그 매체의 편집 지침이 무엇인지가 알려져 있었고 출력도 -1에서 +1 사이로 단순했다. 학습 자료를 직접 만들어 시간과 공간 기준으로 *홀드아웃을 떼어 놓을 수도 있었다.
그런데도 아래에 있는 사용자들에게 모델 판이 바뀐다고 따로 알리는 일이 많았다고 한다.
거대언어모델과 그것을 엮은 에이전트로 오면 오류가 곱해진다. 앞의 CPI 사고가 그 예다. 문자 하나가 빠져 월간 자료가 분기 자료 자리에 들어왔는데, 표를 펼쳐 보이지 않고 답만 내보내는 화면에서는 이렇게 겹쳐 쌓인 오류를 잡기 어렵다.
여기서 나오는 결론이 이 발표의 핵심이다. 위에 있는 시스템이 정확할 것이라 기대하지 말고 취약하고 계속 바뀔 것이라 가정한 뒤 내 쪽에서 안전 점검을 한다. 판마다 좋아진다는 말은 평균이 좋아진다는 뜻이고 나에게 좋아진다는 보장은 없다.
발표자는 이 방어막이 오히려 속도를 준다고 덧붙인다. 에이전트마다 방어막이 있으면 아래에 있는 모든 호출자와 합의하지 않고도 각자 바뀔 수 있기 때문이다.
조직이 옮겨 가는 방향
두 번째 측면이 조직이다. 발표자는 기계학습이 소프트웨어를 자르는 방식이 있고 그것이 조직 구조에 그대로 비친다고 말한다.
제품 모양을 아직 모를 때는 조직과 소프트웨어 스택을 뭉쳐서 한 팀이 빠르게 도는 편이 낫다. 에이전트를 여럿 만들고 나면 성능을 올리고 비용을 줄이고 시험하기 쉽게 만들고 들여다보기 쉽게 만들 차례가 오고, 그때 수평으로 나눈다.
가드레일이 대표적인 수평 기능이다. 50개 팀이 저마다 금융 자문성 질문을 어떻게 걸러 낼지 알아내게 두지 않는다.
지금 리서치 에이전트도 그 결과로 갈라져 있다. 사용자와 세션 맥락을 읽어 질문을 이해하고 무엇이 필요한지 정하는 에이전트가 하나이고, 답을 만드는 일은 다른 에이전트가 맡는다. 바닥에는 오래된 자료 처리가 그대로 깔려 있고, *희소 인덱스가 이제 밀집 인덱스와 둘을 섞은 것으로 바뀌었다고 한다.
숫자가 없다. 처음 성능이 좋지 않았다가 나아졌다는 이야기의 앞뒤 값이 안 나온다. 정밀도가 얼마에서 얼마가 됐는지, 가드레일이 무엇을 얼마나 걸러 내는지가 없다.
견줄 기준선도 없다. 세미 에이전틱을 택했다는데 전부 자율로 뒀을 때 무엇이 얼마나 나빠지는지가 안 나온다. 신뢰가 아직 없다는 것은 판단이고 그 판단을 받치는 측정은 발표에 없다.
언제까지 유효한 이야기인지 밝히지 않는다. 12~16개월 만든 제품을 놓고 하는 이야기라 상태가 빠르게 변할 자리인데 그 점을 짚는 대목이 없다.
조직 이야기에서 보여 준 표도 자막만으로는 다 읽히지 않는다. 열이 넷이고 앞의 둘이 수직 팀, 뒤의 둘이 수평 팀이라는 것까지만 나오고 행에 무엇이 적혔는지는 말하지 않는다. 그래서 이 글의 판에도 그 표는 옮기지 않았다.
한 가지는 드물게 좋다. 이 발표에는 자기 회사 제품을 쓰라고 권하는 대목이 없다. 자기들이 어떻게 만들었는지만 이야기하고 끝난다.
용어