← AI Engineer
평가 · 에이전트

모델은 안전의 일부일 뿐이다 — 에이전트를 단계로 채점하기

행사 페이지에 참석자 수가 없었는데 에이전트가 링크를 따라간 다른 페이지에서 269명을 찾아 두 페이지를 합쳐 답한 실제 데모. 폭력적인 그림에 5점 만점 중 4점이 나와 기본 문턱으로는 탈락한 사례를 들며, 게임처럼 거친 것을 다루는 물건이면 문턱을 올려 통과시킬 수 있다고 짚음. 모델을 손으로 견주는 데서 시작해 규모를 키워 자동으로 매기기까지 네 걸음으로 나눠 정리함.

Cedric Vidal Microsoft발표 2025-08-2620분 2초AI Engineer

한줄 코멘트. 채점기는 점수를 내주고 통과선은 만드는 쪽이 정한다는 대목이 이 발표에서 가장 쓸모 있다. 같은 4점이 아이들 쓰는 물건에서는 탈락이고 거친 것을 다루는 게임에서는 통과다. 나머지는 자기네 도구 소개라 잰 값이 거의 없다.

1. 프롬프트 몇 개로 끝내지 마라

마이크로소프트에서 AI 쪽 일을 한다는 사람이 발표한다. 바로 앞 자리는 일부러 나쁜 상황을 만들어 넣어 보는 이야기였고, 이 자리는 자료 묶음을 놓고 재는 보통의 평가를 다룬다고 말한다.

여는 물음이 이것이다. 프롬프트 몇 개를 넣어 보고 잘 답하니 내보내도 되겠다고 하는가, 아니면 차례를 밟는가.

앞쪽이라면 바꿔야 한다고 말한다. 에이전트에게 스스로 할 몫을 줄수록 홀로 움직이는 폭이 커지고 그만큼 크게 어긋날 위험도 커지기 때문이다.

그리고 시점을 못 박는다. 평가는 프로젝트 맨 처음부터 시작한다. 이를수록 좋다.

2. 층이 넷이라는데 셋만 댄다

접근을 네 층으로 나눈다고 말한다.

하나는 모델과 안전 장치다. 이것은 판이 주는 것이라 자기네 것을 자기네 위에서 쓰면 따로 손댈 게 없다고 말한다. 다른 하나는 시스템 메시지와 *근거 대기, 또 하나는 쓰는 경험이다. 이 두 자리에서 앱을 어떻게 설계했느냐가 가장 크게 먹힌다고 말한다.

넷이라 해 놓고 이름이 뚜렷이 나오는 것은 셋뿐이다.

여기서 이 발표의 제목이 되는 한 줄이 나온다. 바탕 모델은 한 부분일 뿐이고, 진짜 안전은 앱 층에 완화 장치를 겹겹이 두는 데서 나온다.

3. 손으로 고르는 데서 시작한다

평가가 올라가는 네 걸음

모델을 고른다나란히 놓고 손으로 견준다
통째로 돌려 본다부품이 아니라 에이전트 전체를
몇 개를 손으로 매긴다좋다 나쁘다를 사람이 찍는다
규모를 키워 맡긴다내장 채점기로 묶어 돌린다
발표가 세우는 차례다.

첫 걸음은 어느 모델을 쓸지 손으로 견주는 것이다.

이유를 이렇게 댄다. 자동으로 매기는 수는 그 사례에서 실제로 어땠는지를 놓칠 때가 있다. 그러니 규모를 키우기 전에 몇 개를 골라 눈으로 봐야 한다.

편집기에 붙는 도구로 그것을 한다고 말한다. 예전에는 여러 사이트를 돌아다니며 견줬는데 이제 개발하던 자리에서 바로 할 수 있다는 것이다. 실제로 두 판의 모델에 같은 요리 물음을 넣고 나란히 놓아 보인다. 새 판이 훨씬 빨라서 대개 그것을 쓰게 된다고 말한다.

4. 페이지에 없는 수를 찾아온다

데모가 이 발표에서 가장 볼 만하다.

행사 페이지에서 이름과 날짜와 장소와 참석자 수를 뽑아내는 에이전트를 만들어 뒀다. 브라우저를 조종하는 도구를 붙여 실제로 돌린다.

결과가 나온다. 행사 이름과 장소와 날짜, 그리고 등록한 사람 269명이다.

값나가는 대목은 그다음이다. 그 행사 페이지에는 참석자 수가 없었다. 에이전트가 그 페이지에서 다른 페이지로 가는 링크를 찾아내 그리로 옮겨 갔고, 거기서 수를 찾아 두 페이지의 것을 합쳐 답했다.

만든 뒤에는 여러 물음을 넣어 돌리고 좋다 나쁘다를 손으로 찍을 수 있다. 그 결과를 파일로 내보내 더 자동화된 판에 도로 넣을 수 있다고 말한다. 원하는 틀에 맞춘 코드로도 뽑아 준다.

5. 규모를 키우면 무엇으로 재나

발표가 대는 채점기 갈래

갈래무엇을 보나
품질근거에 붙어 있나, 매끄러운가, 앞뒤가 맞나, 물음에 맞나, 원하는 답과 닮았나
예전부터 쓰던 지표벤치마크끼리 견주려고 쓰는 계산식들
위험과 안전나쁜 것이 섞였는지 보는 묶음

직접 만들어 넣을 수도 있다고 덧붙인다. 글만이 아니라 그림이 섞인 것도, 여러 번 오간 대화도 잴 수 있다고 말한다.

문턱은 만드는 쪽이 정한다

같은 4점을 어디서는 통과, 어디서는 탈락

아이들이 쓰는 물건문턱을 높이 둔다4점이면 걸러 낸다
거친 것을 다루는 게임문턱을 낮춰 둔다4점이면 통과시킨다
데모에서 폭력적인 그림에 4점이 나와 기본값으로는 탈락했다.

점수는 1에서 5 사이로 나온다. 그리고 이 발표에서 가장 쓸모 있는 한 줄이 여기 있다. 몇 점부터 탈락으로 볼지는 만드는 쪽이 정한다.

보여 준 사례가 구체적이다. 일부러 험한 그림을 넣었더니 채점기가 그 그림을 험하다고 짚었는데 점수가 5가 아니라 4였다. 기본 문턱으로는 탈락이다. 그러면서 거친 것을 다루는 게임이라면 문턱을 4까지 올려 통과시킬 수 있다고 말한다.

6. 발표가 밝히지 않은 것

층이 넷이라 해 놓고 셋만 댄다. 넷째가 무엇인지 나오지 않는다.

빠르다는 말에 수가 없다. 새 판이 처리량에서 크게 나아졌다고 하면서 얼마나인지가 없다.

269명은 데모가 잘 돈 증거이지 정확도가 아니다. 몇 번 중 몇 번 맞았는지, 틀린 적은 없는지가 나오지 않는다.

규모를 키운 결과가 없다. 시간이 없어 그 부분을 실제로 돌리지 않았다고 밝히고 넘어간다. 그러니 자동으로 매긴 값이 사람 판단과 얼마나 맞는지도 없다.

문턱을 어떻게 정할지에 대한 근거가 없다. 업종에 따라 다르다고만 하고 어떻게 고를지가 없다.

자막이 이름과 판 번호를 뭉갠다. 도구 이름과 모델 번호가 여러 군데 어긋나 있어 정확한 표기는 원문에서 갈린다.

용어

*근거 대기
모델이 지어내지 않고 주어진 자료에 붙어 답하게 만드는 일