← AI Engineer
온디바이스 평가 · 모델 선택

큰 모델 대신 30억짜리 — 프롬프트와 후처리로 기기 위에서 따라잡는다

큰 모델을 기준선(평균 지연 2.9초, 작업 열넷에 0.22달러, 하루 1달러 남짓)으로 두고 기기에서 도는 작은 모델 넷을 같은 시험으로 겨룬 기록. 가장 빠른 것도 가장 정확한 것도 아닌 가운데 것이 이겼고, 예시를 붙인 프롬프트와 하네스 후처리만으로 구조 유효성 100%·지연 1초대까지 올라와 기준선을 따라잡는 과정이 수와 함께 나옴. 심판을 맡은 모델이 자기 계열을 편들어 뜻이 같은 표현까지 깎아내린 대목도 있음.

RL Nabors Arize발표 2026-07-2630분 52초AI Engineer

한줄 코멘트. 작은 것에서 올라가며 합격선을 넘는 자리를 찾는다는 절차가 이 발표의 값이다. 큰 것에서 줄여 내려오는 것이 아니다. 그리고 주변에서 입을 모아 권한 가장 큰 모델이 답이 아니었다 — 그것을 그냥 썼으면 8초를 기다리게 했을 것이라고 말한다.

1. 왜 기기 위인가

여러 브라우저와 표준 일을 거쳐 최근 관측 회사에 합류했다는 사람이 발표한다.

먼 곳의 큰 모델을 부를 때마다 값을 낸다며 넷을 든다. 자료가 바깥으로 나간다는 것, 느리다는 것, 부를수록 더 든다는 것, 끊기면 아예 안 된다는 것이다.

수 하나를 인용한다. 사람이 믿고 기다리는 한계가 4초라는 연구가 있는데, 큰 모델을 부르면 그것을 넘기는 일이 잦다는 것이다.

값 이야기도 뒤집어 놓는다. 토큰 단가는 내려가는데 총지출은 오르고 있다. 에이전트가 되풀이해 생각하느라 단가가 떨어지는 속도보다 더 빨리 먹기 때문이다.

2. 정말 큰 모델이 필요한가

첫 물음이 이것이다. 이 일에 정말 언어 모델이 필요한가.

카메라로 들어온 것을 알아보는 일이나 소리를 글로 옮기는 일에는 그 일만 하는 작은 모델이 이미 있다고 말한다.

말을 다루는 자리라야 언어 모델인데, 거기서도 작은 쪽이 있다. 크기 차이를 이렇게 댄다 — 작은 쪽은 백만에서 수십억, 큰 쪽은 수십억에서 수조다.

그러면서 짚는다. 우리가 실제로 시키는 일은 대화를 간추리거나 누가 무례하게 굴었는지 가려내는 것 정도이고, 그런 일에는 놀랄 만큼 적은 크기로 충분하다.

무게도 든다. 대개 줄여 담아 내보내므로 자리와 메모리가 4분의 1이 되고, 10억이면 2기가바이트쯤이다. 어떤 휴대폰은 이미 그런 모델을 넣어 나온다고 말한다.

에너지 비교도 든다. 큰 모델이 어떤 일에 쓰는 것을 100이라 하면 작은 쪽은 25쯤, 그 일만 하는 모델은 그 절반쯤이다.

3. 크게 만들고 작게 내보낸다

크기를 정하는 네 걸음

된다는 것부터 본다가장 큰 모델로 되는지 확인
합격선을 세운다무엇을 몇 점부터 통과로 칠지
작은 것부터 올린다큰 것에서 내려오지 않는다
가장 작은 합격자넘기는 것 중 제일 작은 것
발표자가 넷이라 못 박은 차례다. 셋째 칸의 방향이 요점이다 — 큰 것에서 줄여 내려오는 것이 아니라 작은 것에서 올라가며 합격선을 넘는 자리를 찾는다.

원칙을 한 줄로 세운다. 프로토타입은 크게, 배포는 작게.

만들던 앱에서 긴 대화를 간추리는 기능을 예로 든다. 먼저 큰 모델로 만들어 이 기능이 되긴 된다는 것을 증명했다.

그다음 시험지를 만든다. 대화 열넷을 골라 간추린 것과 짚은 것 두 벌로 예시 28개를 만들었다.

무엇을 볼지도 미리 정한다. 형식이 깨지지 않았나, 짚은 자리가 말이 되나, 사실이 어긋나지 않나, 길이를 지켰나, 얼마나 걸리나다. 사실이 맞나는 사람이 보기 힘드니 모델에게 맡기는 편이 싸다고 말한다.

기준선의 값이 나온다. 큰 모델은 평균 2.9초, 열넷을 돌리는 데 0.22달러였다. 셈해 보니 하루에 1달러쯤 쓰고 있었다.

작은 모델 쪽은 그 칸이 0이다. 대신 그 몫이 쓰는 사람의 기기로 넘어간다 — 배터리를 채우는 전기값이라는 것이다.

4. 가장 큰 것이 답이 아니었다

제일 빠른 것도 제일 정확한 것도 아니었다

빠른 쪽과 정확한 쪽

가장 빨랐던 것절반 지점 지연 1초쯤다만 정확도가 낮았다
가장 정확했던 것맞히기는 제일 잘했다다만 8초쯤 걸렸다
고른 것은 둘 다 아니었다. 가운데 있던 30억짜리가 정확도 90% 언저리로 합격선을 넘었다 — 주변 기술자들이 입을 모아 권한 것은 제일 큰 쪽이었다고 말한다.

후보 넷을 골랐다.

겨룬 것들

후보크기결과
가장 작은 것15억, 1기가바이트절반 지점 1초쯤으로 제일 빨랐다. 정확도가 낮았다
그 자매17억—
가운데 것30억, 2기가바이트정확도 90% 언저리. 이겼다
가장 큰 것50억, 3.1기가바이트제일 정확했다. 8초쯤 걸렸다

여기서 이 발표의 가장 실용적인 경고가 나온다. 여러 기술자가 가장 큰 것을 쓰라고 했다. 그 말만 믿었으면 훨씬 나쁜 경험을 주었을 것이라고 말한다.

고르는 기준에 이름을 붙인다. 쓸 만한 답을 내는 것 중 가장 작은 것.

이긴 것을 두고 여러 경우에 큰 모델의 답과 구별이 안 될 만큼 가까웠다고 말한다. 그 모델을 만든 회사가 사람 글을 간추리는 데 이해관계가 크니 그럴 만하다고 덧붙인다.

5. 프롬프트를 다섯 가지로

남은 격차는 프롬프트로 좁힌다. 한 번에 하나만 바꾸기로 하고 원래 것을 기준선 삼아 넷을 더 만들었다.

기준선의 값은 구조 91.2%, 사실 87.1%, 지연 1초였다.

무엇을 바꿔 봤고 어떻게 됐나

바꾼 것가설결과
번호를 매겨 넣기작은 모델이 번호를 더 잘 따라갈 것별 차이 없었다
예시를 붙이기규칙보다 예시로 형식을 더 빨리 배울 것가장 좋았다. 지연은 200밀리초만 늘었다
하지 말 것을 못 박기곧이곧대로 된 명령에 잘 따를 것되레 나빠졌다
쓰기 전에 짚게 하기소리 내어 생각하면 근거가 붙을 것길이는 조금 나아지고 지연이 600밀리초 늘었다

셋째가 눈에 띈다. 하지 말라고 못 박은 쪽이 나빠졌다. 모델이 못 하게 하는 말에 나쁘게 반응했다는 것이다.

예시를 붙인 것으로 다시 재니 구조 91.7%, 사실 92.9%가 나왔고 뒤쪽 지연도 기준선보다 낮았다.

6. 심판이 제 편을 들었다

남은 격차를 열어 본 대목이 이 발표에서 가장 재미있다.

심사를 맡긴 모델이 자기 계열 모델의 답을 편들었다. 뜻이 사실상 같은 낱말 둘을 두고 네 해석이 정확하지 않다며 깎았다는 것이다.

그러면서 방향을 튼다. 짚은 자리 수나 길이 같은 것은 모델에게 시킬 일이 아니라 *하네스가 뒤에서 손볼 일이다. 짚은 자리가 대화에 있는 사람 수보다 많으면 걸러 내고, 너무 길면 자른다.

그렇게 하니 형식과 구조가 100%가 됐고, 절반 지점 지연은 1초쯤, 뒤쪽 지연도 잡아 둔 선 아래로 내려왔다. 기준선을 만나거나 앞섰다고 말한다. 그리고 하루 1달러쯤을 아꼈다.

닫는 말은 이어 가라는 것이다. 프롬프트를 고치거나 모델을 올릴 일이 또 오므로 되돌아가는지 계속 재라고 한다. 아는 창업자 이야기를 든다 — 최고기술책임자가 프롬프트를 살짝 고쳐 에이전트를 통째로 망가뜨린 적이 있었다.

7. 발표가 밝히지 않은 것

시험지가 작다. 대화 열넷에 예시 28개다. 그 위에서 나온 90%와 92.9% 같은 값은 몇 개 차이로 크게 흔들린다.

심판이 편향됐다고 스스로 말해 놓고 그 값을 그대로 쓴다. 편들었다는 것을 알아챈 뒤에도 정확도 수치를 다시 재지는 않는다.

기기에서 도는 값이 어디서 나온 것인지 없다. 어떤 기기에서 쟀는지, 사람마다 얼마나 다른지가 나오지 않는다. 값이 0이라는 것도 부담을 쓰는 사람에게 넘긴 것이라고 본인이 말한다.

배터리와 발열이 없다. 기기에서 돌리는 대가가 전기값이라고만 하고 얼마인지가 없다.

에너지 25%와 절반도 인용이다. 자기가 잰 값이 아니다.

4초 한계도 다른 상황의 연구다. 가상현실 대화에서 나온 값을 그대로 가져다 쓴다.

용어

*하네스
모델을 감싸 도구를 쥐여 주고 앞뒤를 손보는 바깥 장치