← AI Engineer
데이터 플라이휠 · 라우팅 에이전트

더 큰 모델보다 데이터 플라이휠 — 라우터 에이전트를 70B에서 1B로 줄인 이야기

NVIDIA 사내 지원 에이전트(NV Info Agent)의 라우터를 사례로, 파인튜닝 없이 배포한 70B 모델의 96% 정확도를 685개 피드백 데이터로 파인튜닝한 1B 모델이 94%까지 따라잡고 추론 비용은 98% 줄인 과정을 보여줌. 사용자 피드백으로 정답 데이터셋을 만들고 NeMo Evaluator·Customizer로 계속 재훈련·재평가하는 루프가 데이터 플라이휠의 실체라고 밝힘.

Sylendran Arunagiri NVIDIA발표 2025-08-2616분 41초AI Engineer

한줄 코멘트. 모델을 줄여서 아낀 이야기로 읽으면 순서가 뒤집힌다. 손 안 댄 8B는 같은 라우팅에서 정확도가 14% 아래로 떨어졌고, 파인튜닝한 1B가 94%까지 올라온 뒤에야 줄일 수 있었다. 그 사이를 메운 것은 불만족 응답을 훑어 만든 정답 자료이고, 그 자료를 어떻게 추렸는지가 이 발표에서 가장 옮겨 쓸 만한 대목이다.

1. 왜 큰 모델을 그냥 못 쓰나

엔비디아의 생성 AI 플랫폼 팀에서 일하는 발표자가 사내 직원 지원 에이전트를 사례로 이야기한다. 주장은 한 줄이다. 에이전트를 계속 정확하고 싸게 굴리는 데 필요한 것은 시장에 나온 다음 대형 모델이 아니라 *데이터 플라이휠이라는 것이다.

큰 모델을 깔면 쓸수록 추론 비용이 올라간다. 그래서 같은 정확도를 내면서 지연이 낮고 값이 싼 작은 모델을 계속 찾아 바꿔 끼우자는 것이 이 발표가 말하는 플라이휠이다.

2. 그냥 줄이면 안 된다

큰 모델과 작은 모델의 맞바꿈

같은 라우팅 일을 두 모델에 맡겨 보면

70B 그대로정확도 96%첫 토큰까지 26초
파인튜닝한 1B정확도 94%추론 비용 98% 절감
발표의 주장이 이 한 장이다. 그냥 줄이면 안 된다 — 손을 안 댄 8B는 같은 라우팅에서 정확도가 14% 아래로 떨어진다. 정답 자료를 만들어 파인튜닝하고 나서야 1B가 70B보다 2%p 낮은 자리까지 올라온다고 발표자는 말한다.

사례는 사내 지원 에이전트의 *라우터다. 직원의 질문이 들어오면 *가드레일을 지나 라우터가 어느 전문가 에이전트로 보낼지 정하고, 그 에이전트가 검색으로 답을 찾는다. 라우터가 잘못 보내면 뒤가 다 어긋나므로 정확도가 중요하고, 매 질의마다 도는 자리라 값과 지연도 중요하다.

*파인튜닝을 하지 않고 그대로 깔았을 때 70B 계열은 라우팅 정확도 96%를 냈다. 대신 첫 토큰이 나오기까지 26초가 걸렸다. 같은 조건에서 8B로 내리자 정확도가 14% 아래로 떨어졌다. 지연은 크게 줄었지만 쓸 수 없는 정확도다.

이 간극이 발표의 출발점이다. 작은 모델이 싸고 빠른 것은 맞지만 손을 안 대면 일을 못 한다.

3. 정답 자료를 어떻게 만들었나

플라이휠을 돌리려면 무엇이 맞고 틀렸는지 판정할 자료가 있어야 한다. 발표는 그것을 사용자 피드백에서 만들어 냈다.

피드백에서 정답 자료까지

단계수
피드백 양식으로 모은 데이터 포인트약 1,224건
만족한 응답729건
불만족한 응답495건
그중 라우팅 오류로 지목된 것140건
주제 전문가가 손으로 확인해 확정한 것32건
만들어진 정답 자료685건 정도. 자막이 뭉개져 정확히 안 들린다
학습과 평가로 나눈 비율60 대 40

495건을 사람이 다 보지 않았다는 점이 눈에 걸린다. 먼저 모델이 판정자 노릇을 해서 495건 중 140건을 라우팅 오류로 골라냈고, 그 뒤에 주제 전문가가 손으로 봐서 32건을 확정했다. 사람의 손은 마지막에 가장 좁은 자리에만 들어간다.

이 자료로 작은 모델을 파인튜닝하자 1B 계열이 정확도 94%를 냈다. 70B보다 2%포인트 낮은 자리다. 그러면서 추론 비용은 98% 줄고 지연은 70배 낮아졌다고 한다.

4. 이것을 바퀴로 만드는 네 걸음

데이터 플라이휠 네 걸음

모니터링사용자 피드백을 모은다
분석·귀속오류와 모델 드리프트를 나눈다
계획모델을 고르고 합성 데이터와 파인튜닝을 잡는다
실행주기를 돌리고 정확도와 지연을 좇는다
발표자가 든 네 걸음이다. 둘째 걸음이 이 틀의 값어치를 정한다 — 무엇이 틀렸는지를 오류와 드리프트로 갈라 놓아야 셋째 걸음에서 무엇을 고칠지 정해진다. 넷째 걸음의 결과가 다시 첫째 걸음으로 들어가 바퀴가 된다.

발표는 이 과정을 되풀이할 수 있게 네 걸음으로 정리한다. 사용자 피드백을 지켜보고, 무엇이 틀렸는지 오류와 *모델 드리프트로 갈라 원인을 대고, 어떤 모델을 쓸지와 합성 자료를 만들지 파인튜닝을 할지 계획하고, 실제로 돌리며 정확도와 지연을 좇는다.

넷째 걸음의 결과가 다시 첫째 걸음으로 들어가는 것이 바퀴라는 말의 뜻이다.

이 걸음들을 받치는 도구로 발표자는 자사 마이크로서비스 묶음을 든다. 자료를 추리는 것, 파인튜닝하는 것, 평가하는 것, 가드레일을 거는 것, 검색 파이프라인을 만드는 것에 각각 하나씩 붙어 있고 모델은 자사 추론 형식으로 서빙된다고 한다. 자기 회사 제품 안내를 겸하는 대목이다.

5. 발표가 밝히지 않은 것

정답 자료를 만드는 데 든 품이 안 나온다. 주제 전문가가 몇 명이 얼마나 오래 봤는지, 그 일을 몇 번마다 되풀이해야 하는지가 없다. 98%라는 절감폭 옆에 이 품값이 놓여야 비교가 되는데 한쪽만 있다.

바퀴를 얼마나 자주 돌리는지도 없다. 모델 드리프트를 본다고 했으니 주기가 있을 텐데 그 주기가 나오지 않는다.

정확도 말고 다른 것이 어떻게 됐는지 안 나온다. 라우팅을 96%에서 94%로 두고 바꿨을 때 어떤 질문이 새로 틀리게 되는지, 그 2%포인트에 무엇이 들어 있는지가 없다. 라우터가 틀리면 뒤가 다 어긋난다고 발표자가 먼저 말했으므로 이 대목이 비어 있는 것이 걸린다.

자막이 자동 생성이라 숫자 몇 개가 뭉개져 있다. 정답 자료 건수와 모델 크기 축소 배수가 그렇다. 이 글에서는 뭉개진 자리를 그대로 밝혀 두었다.

용어

*데이터 플라이휠
쓰면서 쌓인 피드백으로 모델을 고치고 고친 모델이 다시 피드백을 낳게 돌리는 바퀴
*라우터
들어온 질문을 어느 전문가 에이전트로 보낼지 정하는 자리
*가드레일
모델이 넘지 말아야 할 선을 바깥에서 강제하는 장치
*파인튜닝
이미 학습된 모델에 자기 자료를 더 먹여 그 일에 맞게 다듬는 것
*모델 드리프트
세상이나 자료가 바뀌어 모델이 예전만큼 안 맞게 되는 것