라이브 AI 튜터 에이스(Ace)를 인트로·티치·체크·그레이드·어드밴스·랩 여섯 단계 상태 머신으로 쪼개, 모델에게는 한 번에 한 단계만 좁은 계약으로 넘기고 다음 단계 판단은 하네스가 맡는 구조가 나옴. 이 덕분에 오퍼스 4.7 대신 하이쿠 4.5로도 같은 신뢰도를 내면서 비용·지연을 줄였다고 밝힘. 에이전트 성공률이 동전 던지기 수준이면 모델의 결정권부터 걷어내라는 기준도 제시함.
한줄 코멘트. 오퍼스 4.7 대신 하이쿠 4.5로도 됐다는 대목이 눈에 띄는데, 모델을 줄여서 잘된 것이 아니다. 하네스가 「지금 몇 단계인가·다음은 무엇인가·끝났는가」를 전부 가져가 모델에 남은 일이 「이번 단계에 무슨 말을 할까」 하나로 줄어든 뒤에야 작은 모델이 버텼다. 하네스를 안 만든 채 모델만 하이쿠로 갈아 끼우면 신뢰성은 오히려 떨어진다.
마이크로소프트의 오넬라와 조엘이 라이브 AI 음성 튜터 에이스(Ace)를 만들었다. 학생과 말을 주고받으며 레슨 하나를 처음부터 끝까지 끊기지 않게 진행하는 제품이다.
여러 단계로 이어지는 *에이전트를 실제로 배포해 본 사람은 같은 장면을 본다. 데모까지는 잘 돌다가 진짜 사용자가 붙으면 중간에서 무너진다. 절반쯤 가서 스스로 끝났다고 판단하거나, 단계 하나를 건너뛰거나, 같은 자리를 맴돈다.
누구나 처음 잡는 해법은 프롬프트를 더 강하게 쓰고 빠져나갈 구멍을 규칙으로 메우는 것이다. 발표자들은 이 진단이 틀렸다고 본다. 신뢰성이 안 나오는 원인은 약한 프롬프트가 아니라 모델에게 준 통제(control) 권한이라는 것이다.
두 사람이 든 비유가 배우와 감독이다. 모델은 배우이고 *하네스는 감독이다. 배우는 대사 한 줄을 훌륭하게 소화한다. 그런데 지금이 여섯 장면 중 세 번째인지 기억하는 일에는 형편없다.
그래서 두 사람은 기억하라고 요구하는 것 자체를 그만뒀다.
상태가 어디에 있나
전부 모델에 맡길 때
하네스가 흐름을 쥘 때
에이스에서 레슨 하나는 여섯 단계를 오가는 *상태 머신이다. 인트로, 티치, 체크, 그레이드, 어드밴스, 랩 순서다. 발표는 단계 이름만 대고 각 단계가 안에서 무엇을 하는지는 설명하지 않는다.
중요한 것은 단계를 쪼갰다는 사실이 아니다. 단계를 넘기는 판단을 모델 바깥으로 옮겼다는 것이다. 조엘은 에이스를 만들 때 「지금 단계가 무엇인가」와 「그다음에 올 수 있는 단계가 무엇인가」를 먼저 따졌다고 밝혔다.
한 단계가 도는 순서
학생이 답을 말함
이 단계에 필요한 입력만 넘긴다
행동 하나의 결과를 돌려준다
결과를 검증하고 상태를 다음으로 넘긴다
다음 말과 화이트보드
각 단계는 모델에게 *좁은 계약을 하나씩 보낸다. 이 한 가지만 하고 결과를 돌려달라는 형태다. 돌아온 결과를 하네스가 검증하고, 상태를 다음으로 넘기고, 다음에 무엇을 할지 정한다. 조엘의 표현으로는 모델이 제안하고 하네스가 결정한다.
발표 중반에 조엘이 실제 레슨 하나의 로그 녹화를 틀었다. 화면 오른쪽에 하네스 네 갈래가 각자 돌고 있는 기록이 흘렀다.
레슨 하나에 붙은 하네스 넷
| 하네스 | 무엇을 다루나 |
|---|---|
| 섹션 | 지금 무엇을 말하고 무엇을 할지 입력을 만들어 넣는다 |
| 화이트보드 | 화이트보드에 그리는 일 |
| 대기열 | 대기열을 비우는 일 |
| 마무리 | 레슨을 끝내는 절차 |
에이스에서 특히 공들인 판단은 셋이다. 레슨이 언제 끝났는지, 학생이 정말로 이해했는지, 다음에 무엇을 할지. 이 세 범주에 들어가는 모든 질문과 모델이 취해야 할 모든 행동을 모델 바깥에서 미리 설계해 뒀다.
조엘은 오늘날 프런티어 모델, 예를 들어 앤트로픽의 오퍼스 4.7(Opus 4.7) 같은 모델을 사람들이 생각부터 처리까지 전부 맡기는 데 쓴다고 짚었다. 좋을 때도 있지만 학생과 실시간으로 말을 주고받는 라이브 튜터에서는 늘 통하지 않는다. 여기서는 신뢰성과 비용과 속도가 한꺼번에 필요하기 때문이다.
하네스로 흐름을 붙잡고 나자 무거운 오퍼스 4.7 대신 훨씬 작고 추론 능력도 떨어지는 하이쿠 4.5(Haiku 4.5)로 내려갈 수 있었다. 그런데도 기대한 수준으로 작동했고 비용과 시간과 지연을 아꼈다고 한다.
이 대목만 떼어 「작은 모델로 갈아 끼우면 싸진다」로 읽으면 거꾸로다. 모델이 내릴 판단을 하네스가 먼저 가져갔고, 그래서 모델에 남은 일이 쉬워졌고, 쉬워진 다음에야 하이쿠 4.5로 내려갈 수 있었다.
발표는 판단 기준을 하나 남긴다. 지금 굴리는 에이전트가 성공할지 실패할지가 동전 던지기 수준이라면 제어 흐름을 모델에서 빼내라는 것이다. 모델이 더 많은 결정을 내리게 두지 말고, 그 결정들을 모델 바깥에 미리 만들어 두고, 모델에게는 쉽게 답할 수 있는 입력만 넘긴다.
음성 튜터에만 해당하는 이야기가 아니다. 코딩 에이전트, *옵스 런북, 온보딩 플로우에도 같은 원칙이 든다고 했다. 발표는 「모델이 말은 하게 하되 운전은 시키지 마라」는 문장으로 끝난다.
6분짜리 발표라 빠진 정보가 많다. 세 가지를 기억해 두는 편이 좋다.
첫째, 비용과 지연이 얼마나 줄었는지 숫자가 없다. 아꼈다는 말만 있다.
둘째, 하네스가 모델의 결과를 어떻게 검증하는지는 공개되지 않았다. 검증 자체가 또 다른 모델 호출인지 규칙으로 짠 코드인지가 이 구조의 비용을 좌우하는데, 그 대목은 로그 화면으로만 지나갔다.
셋째, 새로운 상황을 전부 상태 머신 안에 녹여 넣었다는 말은 뒤집으면 상황이 늘어날 때마다 사람이 상태를 늘려야 한다는 뜻이다. 모델에게서 뺏은 판단은 사라지지 않고 개발자의 일로 옮겨 온다. 발표는 이 비용을 다루지 않는다.
용어