← AI Engineer
에이전트 · MCP

판단은 모델에 맡기고 방법은 정하지 않는다 — 6억 알렉사와 3주짜리 Q 개발자의 설계

알렉사가 6억 대 기기에서 수백 개 전문가 시스템과 수만 개 파트너 서비스를 오케스트레이션하는 규모, AWS 내부 팀이 아마존 Q 디벨로퍼 CLI 에이전트를 3주 만에 만들어 낸 이야기를 다룸. 그 속도의 비결로 내놓은 것이 모델에게 계획·판단·행동을 맡기고 개발자는 '무엇을' 시킬지만 정하는 모델 중심 설계이고, 이를 코드로 편 것이 오픈소스 SDK 스트랜즈 에이전트(Strands Agents)임. 도구 6,000개를 가진 내부 에이전트가 이를 지식베이스에 넣고 검색해 필요한 것만 모델 컨텍스트로 끌어오는 방식과, MCP 서버를 람다(Lambda)로 배포해 원격에서 규모를 키우는 방법도 구체적으로 나옴.

Antje Barth AWS발표 2025-08-2619분 1초AI Engineer

한줄 코멘트. 옮겨 쓸 것은 도구가 많아졌을 때의 처리다. 사내 에이전트 하나가 도구 6,000개를 다루는데 그것을 한 컨텍스트 창에 다 넣고 모델에게 고르라 할 수는 없다고 발표자가 먼저 인정한다. 그래서 도구 설명을 지식 베이스에 두고 검색으로 관련된 것만 꺼내 온다. 나머지는 AWS 제품 안내이고 성능도 비용도 지연도 재 본 값이 하나도 없다.

1. 어느 규모의 이야기인가

AWS에서 클라우드 규모로 에이전트를 만드는 이야기를 한다. 먼저 규모를 깔아 둔다.

발표가 든 규모

무엇얼마
아마존이 만들었거나 만들고 있는 생성 AI 애플리케이션1,000개가 넘는다
세상에 나가 있는 알렉사 기기6억 대가 넘는다
알렉사 플러스가 거치는 전문 시스템수백 개
그것이 엮는 파트너 서비스와 기기수만 개
사내 에이전트 하나가 다루는 도구6,000개가 넘는다

알렉사 대목은 미리 만든 영상으로 보여 준다.

2. 방법을 정하지 않는 설계

아마존 Q 디벨로퍼의 CLI 에이전트를 3주 만에 만들어 내보냈다고 한다. 발표자는 청중에게 얼마나 걸렸을지 손을 들어 보게 한 뒤 이 숫자를 밝힌다.

그 속도를 내려고 만드는 방식을 근본부터 다시 생각했다는 것이 이 발표의 주장이다. 요즘 모델이 판단하고 계획하고 행동하는 데 훨씬 나아졌으니 그 힘을 쓰자는 것이다. 개발자는 에이전트가 무엇을 할지에 집중하고 어떻게 할지는 일러 주지 않는다.

이것을 코드로 편 것이 오픈소스 파이썬 SDK 스트랜즈 에이전트다. 모델과 도구 둘을 잇는 것이 전부라고 설명하며 DNA의 두 가닥에 빗댄다. 미리 만들어 둔 도구가 20개 넘게 딸려 오고, *MCP를 안에 넣어 두었고, *A2A 지원도 곧 붙는다고 한다. 모델은 클로드 3.7 소네트를 쓰는 화면을 보이고 다른 제공자도 붙일 수 있다고 말한다.

3. 도구가 6,000개일 때

도구가 6,000개일 때

도구 설명지식 베이스에 넣어 둔다
검색지금 일에 맞는 것을 찾는다
컨텍스트찾은 것만 넣는다
모델그 안에서 고른다

이 발표에서 가장 옮겨 쓸 만한 대목이다. 사내 에이전트 하나가 도구를 6,000개 넘게 다루는데, 발표자는 그 수를 한 컨텍스트 창에 넣고 모델 하나에게 고르라고 하기는 어렵다고 그대로 인정한다.

그래서 목록을 넣는 대신 찾아오게 만든다. 도구 설명을 *지식 베이스에 넣어 두고, 의미로 검색하는 도구를 하나 두고, 지금 일에 맞는 것만 꺼내 컨텍스트에 넣는다. 모델은 그 안에서 고른다.

4. MCP를 바깥으로 내보내기

MCP를 바깥으로 내보내기

로컬표준 입출력으로 붙였다
람다함수로 올린다
배포주소가 나온다
원격 호출토큰을 들고 붙어 도구를 부른다
MCP가 한 대 안에서 붙던 것을 바깥으로 내보내는 순서다.

MCP는 원래 한 대 안에서 클라이언트와 도구를 잇는 것으로 시작했다. *표준 입출력으로 붙는 방식이다.

이것을 바깥으로 내보내는 순서를 보인다. *람다 함수로 올리고, 배포하면 주소가 나오고, 클라이언트가 토큰을 들고 붙어 도구를 부른다.

바깥으로 나가면서 붙는 것이 있다. 누가 부르는지 확인할 자리가 필요하다. 인가자와 사용자 풀과 세션을 담는 표가 함께 들어간다고 설명한다.

5. 발표가 밝히지 않은 것

성능을 잰 값이 하나도 없다. 지연도 비용도 정확도도 나오지 않는다. 6억 대와 6,000개와 3주는 규모와 기간이지 잘 돌아간다는 증거가 아니다.

3주가 빠른지 판단할 기준이 없다. 청중에게 손을 들어 보게 한 것은 추측을 모은 것이지 견줄 대상이 아니다. 같은 것을 예전 방식으로 만들면 얼마나 걸리는지가 안 나온다.

도구 검색이 얼마나 맞는지가 없다. 6,000개 중에서 관련된 것만 꺼내 온다는 설계인데, 맞는 도구를 못 찾으면 어떻게 되는지와 검색이 몇 퍼센트나 맞히는지가 나오지 않는다. 이 방식의 급소가 바로 거기다.

언제까지 유효한 이야기인지도 밝히지 않는다.

발표는 자사 오픈소스 블로그 시리즈로 더 보라며 QR 코드로 넘기고 끝난다.

용어

*MCP
에이전트가 바깥 도구나 자료에 붙는 방식을 정해 둔 규격
*지식 베이스
찾아 쓸 자료를 담아 두고 뜻으로 검색하게 해 주는 저장소
*람다
서버를 직접 두지 않고 함수 하나 단위로 코드를 돌려 주는 AWS 서비스
*표준 입출력
한 컴퓨터 안에서 프로그램끼리 글을 주고받는 가장 기본적인 통로
*A2A
에이전트끼리 서로 말을 주고받게 하려는 규격