NVIDIA 사내 지원 에이전트(NV Info Agent)의 라우터를 사례로, 파인튜닝 없이 배포한 70B 모델의 96% 정확도를 685개 피드백 데이터로 파인튜닝한 1B 모델이 94%까지 따라잡고 추론 비용은 98% 줄인 과정을 보여줌. 사용자 피드백으로 정답 데이터셋을 만들고 NeMo Evaluator·Customizer로 계속 재훈련·재평가하는 루프가 데이터 플라이휠의 실체라고 밝힘.
한줄 코멘트. 모델을 줄여서 아낀 이야기로 읽으면 순서가 뒤집힌다. 손 안 댄 8B는 같은 라우팅에서 정확도가 14% 아래로 떨어졌고, 파인튜닝한 1B가 94%까지 올라온 뒤에야 줄일 수 있었다. 그 사이를 메운 것은 불만족 응답을 훑어 만든 정답 자료이고, 그 자료를 어떻게 추렸는지가 이 발표에서 가장 옮겨 쓸 만한 대목이다.
엔비디아의 생성 AI 플랫폼 팀에서 일하는 발표자가 사내 직원 지원 에이전트를 사례로 이야기한다. 주장은 한 줄이다. 에이전트를 계속 정확하고 싸게 굴리는 데 필요한 것은 시장에 나온 다음 대형 모델이 아니라 *데이터 플라이휠이라는 것이다.
큰 모델을 깔면 쓸수록 추론 비용이 올라간다. 그래서 같은 정확도를 내면서 지연이 낮고 값이 싼 작은 모델을 계속 찾아 바꿔 끼우자는 것이 이 발표가 말하는 플라이휠이다.
큰 모델과 작은 모델의 맞바꿈
같은 라우팅 일을 두 모델에 맡겨 보면
사례는 사내 지원 에이전트의 *라우터다. 직원의 질문이 들어오면 *가드레일을 지나 라우터가 어느 전문가 에이전트로 보낼지 정하고, 그 에이전트가 검색으로 답을 찾는다. 라우터가 잘못 보내면 뒤가 다 어긋나므로 정확도가 중요하고, 매 질의마다 도는 자리라 값과 지연도 중요하다.
*파인튜닝을 하지 않고 그대로 깔았을 때 70B 계열은 라우팅 정확도 96%를 냈다. 대신 첫 토큰이 나오기까지 26초가 걸렸다. 같은 조건에서 8B로 내리자 정확도가 14% 아래로 떨어졌다. 지연은 크게 줄었지만 쓸 수 없는 정확도다.
이 간극이 발표의 출발점이다. 작은 모델이 싸고 빠른 것은 맞지만 손을 안 대면 일을 못 한다.
플라이휠을 돌리려면 무엇이 맞고 틀렸는지 판정할 자료가 있어야 한다. 발표는 그것을 사용자 피드백에서 만들어 냈다.
피드백에서 정답 자료까지
| 단계 | 수 |
|---|---|
| 피드백 양식으로 모은 데이터 포인트 | 약 1,224건 |
| 만족한 응답 | 729건 |
| 불만족한 응답 | 495건 |
| 그중 라우팅 오류로 지목된 것 | 140건 |
| 주제 전문가가 손으로 확인해 확정한 것 | 32건 |
| 만들어진 정답 자료 | 685건 정도. 자막이 뭉개져 정확히 안 들린다 |
| 학습과 평가로 나눈 비율 | 60 대 40 |
495건을 사람이 다 보지 않았다는 점이 눈에 걸린다. 먼저 모델이 판정자 노릇을 해서 495건 중 140건을 라우팅 오류로 골라냈고, 그 뒤에 주제 전문가가 손으로 봐서 32건을 확정했다. 사람의 손은 마지막에 가장 좁은 자리에만 들어간다.
이 자료로 작은 모델을 파인튜닝하자 1B 계열이 정확도 94%를 냈다. 70B보다 2%포인트 낮은 자리다. 그러면서 추론 비용은 98% 줄고 지연은 70배 낮아졌다고 한다.
데이터 플라이휠 네 걸음
발표는 이 과정을 되풀이할 수 있게 네 걸음으로 정리한다. 사용자 피드백을 지켜보고, 무엇이 틀렸는지 오류와 *모델 드리프트로 갈라 원인을 대고, 어떤 모델을 쓸지와 합성 자료를 만들지 파인튜닝을 할지 계획하고, 실제로 돌리며 정확도와 지연을 좇는다.
넷째 걸음의 결과가 다시 첫째 걸음으로 들어가는 것이 바퀴라는 말의 뜻이다.
이 걸음들을 받치는 도구로 발표자는 자사 마이크로서비스 묶음을 든다. 자료를 추리는 것, 파인튜닝하는 것, 평가하는 것, 가드레일을 거는 것, 검색 파이프라인을 만드는 것에 각각 하나씩 붙어 있고 모델은 자사 추론 형식으로 서빙된다고 한다. 자기 회사 제품 안내를 겸하는 대목이다.
정답 자료를 만드는 데 든 품이 안 나온다. 주제 전문가가 몇 명이 얼마나 오래 봤는지, 그 일을 몇 번마다 되풀이해야 하는지가 없다. 98%라는 절감폭 옆에 이 품값이 놓여야 비교가 되는데 한쪽만 있다.
바퀴를 얼마나 자주 돌리는지도 없다. 모델 드리프트를 본다고 했으니 주기가 있을 텐데 그 주기가 나오지 않는다.
정확도 말고 다른 것이 어떻게 됐는지 안 나온다. 라우팅을 96%에서 94%로 두고 바꿨을 때 어떤 질문이 새로 틀리게 되는지, 그 2%포인트에 무엇이 들어 있는지가 없다. 라우터가 틀리면 뒤가 다 어긋난다고 발표자가 먼저 말했으므로 이 대목이 비어 있는 것이 걸린다.
자막이 자동 생성이라 숫자 몇 개가 뭉개져 있다. 정답 자료 건수와 모델 크기 축소 배수가 그렇다. 이 글에서는 뭉개진 자리를 그대로 밝혀 두었다.
용어