← AI Engineer
하니스 · 오토 리뷰

메시지 한 통이 코덱스 하니스를 통과하는 법 — 도구 검색부터 오토 리뷰까지

코덱스 하니스가 메시지 한 통을 처리하며 거치는 장치들이 구체적으로 나옴 — 스킬 목록을 컨텍스트 창의 2%로 묶어두는 규칙, 도구를 지연 로딩해 두었다가 도구 검색으로만 찾게 하는 방식, 파일 삭제 같은 위험한 행동을 읽기 전용 서브에이전트가 대신 판단하는 오토 리뷰 구조가 그것임. 세레브라스에서 초당 1,000토큰까지 빨라지자 병목이 추론에서 네트워크로 옮겨가 웹소켓 모드를 도입한 이야기, 슬래시 골로 돌리는 루프와 컴팩션까지 이어짐.

Dominik Kundel OpenAI발표 2026-08-1220분 54초AI Engineer

한줄 코멘트. 이 발표에서 값이 나가는 것은 「코덱스가 이렇게 만들었다」가 아니라 컨텍스트 창을 지키려고 건 상한 두 개다. 도구를 컨텍스트에 안 넣고 검색으로만 찾게 하고, 스킬 목록을 컨텍스트 창의 2%로 묶었다. 자기 에이전트에 그대로 옮겨 볼 수 있는 규칙은 이 둘뿐이고 나머지는 오픈AI 제품 안내에 가깝다.

1. 메시지 한 통이 지나는 길

메시지 한 통이 지나는 길

UI메시지를 보낸다
하니스컨텍스트를 조립하고 도구를 부른다
추론모델이 답한다
메시지 한 통이 지나는 길이다. 뒤쪽은 리스폰시스 API를 따르는 다른 모델 제공자를 꽂는 자리다. 오픈AI가 만든 것을 쓰라는 이야기이기도 하다.

코덱스 에이전트에는 프로토콜이 둘 있다. 앞쪽은 사용자가 UI에서 보낸 메시지가 *하니스까지 가는 길이고 이것을 앱 서버라고 부른다. 뒤쪽은 하니스와 추론 사이를 잇는 리스폰시스 API다.

둘 다 남이 갈아 끼울 수 있게 열어 뒀다고 한다. 앱 서버 프로토콜을 쓰면 자기 UI를 코덱스 하니스 위에 올릴 수 있고, 코덱스 앱 자체도 같은 앱 서버로 돈다. 발표자는 이 프로토콜로 코덱스를 다른 코딩 에이전트 안에 넣어 봤고 전날 발표에서는 게임 둠 안에 넣어 보였다고 밝힌다.

리스폰시스 API는 작년에 공개됐다. 챗 컴플리션 API를 에이전트 시대에 맞게 다시 짠 것으로 웹 검색이나 이미지 생성 같은 능력이 붙어 있다. 올라마·LM 스튜디오·엔비디아 등과 함께 열린 리스폰시스 스키마를 만들고 그것을 관리할 기구를 뒀다고 한다. 이 규격을 따르는 모델 제공자라면 코덱스 하니스에 꽂을 수 있다는 뜻이다.

하니스는 오픈소스이고 러스트로 쓰였다.

2. 컨텍스트를 조립할 때 무엇을 아끼나

하니스가 가장 먼저 하는 일이 컨텍스트 조립이고 여기서 세 가지를 본다.

첫째는 크기다. 토큰 예산을 헛되이 쓰지 않으려는 것도 있지만 이유가 하나 더 있다. 컨텍스트가 길수록 서로 어긋나는 정보가 들어갈 확률이 올라가고 그것이 모델을 헷갈리게 한다. 둘째는 유연성이다. 스킬이나 플러그인이나 MCP를 많이 깔든 적게 깔든 경험이 같아야 한다. 셋째는 성능과 비용이고 여기서는 캐시가 깨지지 않는 것이 중요하다.

컨텍스트 조각 중에는 예측되는 것과 안 되는 것이 있다. 모델 지시문은 구조가 정해져 있어 크기가 잘 안 변하고 캐시를 안 깬다. 반면 스킬이 몇 개인지, 도구 레지스트리가 얼마나 큰지는 예측이 안 된다. MCP를 깔수록 늘어나기 때문이다.

그래서 상한을 둘 걸었다.

컨텍스트가 부푸는 것을 막는 두 장치

장치무엇을 하나
지연 로딩 도구일부 도구를 지연으로 표시해 컨텍스트 창에 아예 안 넣는다. 모델은 도구 검색으로만 그것을 찾는다
스킬 목록 2퍼센트 상한스킬 목록이 최대 컨텍스트 창의 2퍼센트를 넘지 않게 묶고, 넘치면 설명 분량을 조금씩 줄인다

지연 로딩은 코덱스만의 것이 아니라고 한다. GPT-5.4부터 리스폰시스 API에서 어떤 도구든 지연으로 표시할 수 있고, 내장 도구 검색을 쓰거나 직접 만든 검색을 붙여도 된다.

3. 에이전트가 하는 행동 셋

컨텍스트를 조립했다고 에이전트가 되지는 않는다. 행동을 해야 에이전트다.

세 갈래 행동과 그 장치

행동어떻게 하나
비동기서브에이전트를 띄우는 도구와 거기에 입력을 보내는 도구를 준다. 기다리게 하거나 내릴 수도 있다. 백그라운드 터미널도 같은 방식으로 다룬다
컴퓨터 조작동작 하나씩 노출하던 방식을 버리고 코드 실행으로 바꿨다. 에이전트가 자기 조작을 스크립트로 쓴다
파일 시스템디프를 주는 어플라이 패치 도구로 고치고 만든다. 나머지는 셸 도구로 훑는다

컴퓨터 조작의 변화가 눈에 띈다. 브라우저 조작이 그 예다. 코덱스는 턴을 넘어 살아 있는 노드 REPL 안에 플레이라이트 코드를 써서 크로미움을 움직인다. 한 페이지의 구조를 파악한 다음 스크립트를 짜서 나머지 페이지를 훑는 식이라 같은 일을 훨씬 빨리 끝낸다.

파일 시스템 쪽에는 훈련의 흔적이 남아 있다. GPT-5부터 모델이 어플라이 패치 도구에 익숙해지도록 훈련됐고, 파일을 찾을 때는 자연스럽게 립그렙을 쓰려 든다. 그래서 하니스가 립그렙을 같이 배포한다. 윈도우에서는 파워셸을 그대로 쓰도록 따로 훈련했다.

모든 파일 시스템 조작은 샌드박스를 지난다. 맥OS는 시트벨트, 리눅스는 버블랩을 쓴다. 윈도우는 마땅한 것이 없어 직접 만들어 같은 저장소에 오픈소스로 열어 뒀다고 한다.

4. 위험한 행동을 누가 판단하나

위험한 행동을 누가 판단하나

코덱스
오토 리뷰
사람

하려는 도구 호출과 대화 기록을 넘긴다

사용자 권한과 위험 분류로 판단한다

괜찮으면 자동으로 승인한다

아니면 사람에게 올라간다

샌드박스가 막아선 행동을 사람 대신 판단하는 장치다. 오토 리뷰는 따로 돌고, 읽기 권한만 갖고, 다른 서브에이전트를 못 띄운다. 맥락이 판단을 나눈다 — 지우라고 시킨 파일이면 괜찮고, 시키지 않은 .git 폴더면 아니다. 다만 발표는 자동 승인 쪽만 설명하고 승인이 안 났을 때를 따로 다루지 않는다.

샌드박스에는 늘 따라오는 불만이 있다. 승인 피로다. 긴 작업일수록 승인 요청이 성가셔서 전체 접근을 켜 버리게 되고, 보안 담당은 그것을 싫어한다.

모델이 좋아져도 사고는 남는다고 발표자는 말한다. 높은 자율성을 프롬프트로 밀어붙이면 엉뚱하게 해석될 수 있다. 파일을 메일로 보내라고 했는데 첨부가 안 되니 파일 공유에 올려 버리거나, 이스케이프를 잘못해 데이터를 너무 많이 지우는 일이 그렇다.

그래서 오토 리뷰를 만들었다. 샌드박스가 막아선 행동이 올라오려 할 때 판단을 대신할 서브에이전트를 띄운다. 이 서브에이전트는 따로 돌고 읽기 권한만 가지며 다른 서브에이전트를 못 띄운다.

받는 것은 넷이다. 사용자 권한이 무엇인지, 위험을 어떻게 분류하는지, 어떻게 판단하기를 바라는지, 그리고 대화 기록과 실제로 일어나려는 도구 호출이다. 여기서 맥락이 판단을 정한다. 지우라고 시킨 파일이면 지워도 되고, 시키지 않은 `.git` 폴더면 이력을 통째로 날리는 일이라 건드리면 안 된다.

파일 시스템만의 이야기도 아니다. 인터넷이 되는지 보려고 구글을 부르는 것은 괜찮지만 파일을 올리는 것은 다를 수 있다.

발표자는 이 설명이 엄청난 단순화라고 스스로 밝히며 자세한 것은 따로 쓴 글로 넘긴다.

5. 병목이 추론에서 네트워크로 옮겨갔다

에이전트는 도구 호출을 많이 한다. 추론을 아무리 빠르게 해도 그것만으로는 안 된다는 것이 이 대목이다.

GPT 5.3 코덱스 스파크를 세레브라스에서 초당 1,000토큰으로 돌리자 그것이 드러났다. 도구 호출과 오가는 상호작용이 쌓이니 느린 자리가 추론이 아니라 네트워크였다.

그래서 웹소켓 모드를 넣었다. 리스폰시스 API가 서버 전송 이벤트와 HTTP 대신 끊기지 않는 웹소켓 연결을 쓴다. 네트워크 오버헤드를 아끼는 것에 더해 연결이 상태를 갖게 되므로 바뀐 것만 보내면 된다. 도구 호출이라면 그 결과만 보내고 전체 항목을 다시 보내지 않는다. 발표에서 든 예로는 아홉 개를 되보내던 자리에서 하나만 보낸다.

6. 끝났다고 누가 말하나

슬래시 골로 도는 루프의 구조는 단순하다. 목표에 닿을 때까지 하니스가 이어가는 프롬프트를 자동으로 밀어 넣고, 그 프롬프트 안에 사용자가 정한 목표가 들어간다. 모델이 목표 갱신 도구를 불러 다 됐다고 선언할 때까지 그것이 반복된다.

여기서 나오는 조언이 실용적이다. 목표에 긴 글을 쓰면 안 된다. 끝났는지 판정할 수 있어야 루프가 멈추므로 구체적이고 확인 가능한 문장으로 써야 한다.

시간이 길어지면 컨텍스트가 문제가 된다. 작년 말에 넣은 자동 컴팩션이 그것을 맡는다. 서버 쪽에서 발동하고, 모델이 그렇게 훈련돼 있어 성능이 유지된다고 한다. 이전 컨텍스트 창을 새 창으로 바꾸면서 필요한 정보를 담은 항목 하나를 그 안에 넣는 방식이다.

7. 발표가 밝히지 않은 것

숫자가 거의 없다. 웹소켓으로 얼마나 빨라졌는지가 대표적이다. 상당히 빨라졌다는 말과 큰 영향이 있다는 말만 나오고 측정값은 없다. 시연하려던 데모 서버가 발표 중에 죽어 미리 녹화한 화면으로 대신했다.

오토 리뷰가 얼마나 맞히는지도 없다. 자동으로 승인해서는 안 될 것을 승인한 비율이나 반대로 사람에게 괜히 올린 비율이 이 장치의 값어치를 정하는데, 발표자 스스로 엄청난 단순화라고 밝히며 글로 넘긴다.

스킬 2퍼센트 상한에서 무엇을 먼저 줄이는지도 안 나온다. 넘치면 설명을 조금씩 줄인다고만 한다. 어느 스킬 설명이 먼저 깎이느냐가 어떤 스킬이 안 불리느냐를 정하는데 그 순서가 없다.

마지막으로 이 발표는 오픈AI 제품 안내이기도 하다. 앱 서버·리스폰시스 API·코덱스를 쓰라는 이야기가 뼈대에 섞여 있다. 다만 하니스가 오픈소스라 말한 것을 코드로 확인할 수 있다는 점은 다른 제품 발표와 다르다.

발표자는 이것이 현재 상태일 뿐이고 새 모델이 나올 때마다 API도 하니스 동작도 자주 바뀐다고 먼저 밝힌다. 날짜를 붙여 읽어야 하는 발표다.

용어

*하니스
모델을 감싸고 앉아 컨텍스트와 도구와 권한을 관리하는 운영 계층. 영어로 harness