AI Engineer — 컨퍼런스 발표 아카이브

AI Engineer

에이전트를 실제로 굴려 본 사람들이 무엇에서 막혔고 무엇으로 뚫었는지. 발표 한 편을 번호글로 옮겨 담습니다.

정리일 2026-08-26 수록 81편 소스 youtube.com/@aidotengineer

에이전트 만들기 · 운영
토큰이 아니라 예산을 준다 — 신원은 요청이 아니라 인프라가 찍는다
CI 엔지니어가 겪은 사고, 즉 필터가 빠지면서 워크로드 약 200개가 90초 만에 지워지고 엔지니어 20명 몫이 날아간 사례를 출발점 삼아, 예 아니면 아니오로만 답하는 토큰 대신 얼마나·얼마나…
2026-08-23Sachin Malhotra Anthropic
서빙 · 비용 · 인프라
토큰을 누가 다 썼나 — 죽이지 않고 예산 안에 맞추는 법
청구서를 받아도 어디서 난 값인지 되짚을 수 없다는 문제에서 출발해, 예산에 닿으면 죽이는 대신 시스템 지시문에 끼워 넣어 출력을 줄이는 조향형 통제를 시연함. 부르는 자리마다 표시를 달아 코드…
2026-08-23Tisha Chawla & Susheem Koul Microsoft
평가 · 결과물 품질
에이전트는 세대를 넘었는데 평가는 그대로다 — 아키텍처가 바뀔 때마다 평가도 갈아야 하는 이유
단일 호출에서 체인, 루프, 그래프를 거쳐 다시 루프로 돌아온 아키텍처 전환마다 평가가 놓치는 실패 자리가 어떻게 달라졌는지 짚음. 같은 평가를 K번 돌려 한 번이라도 되는지 보는 지표와 몇…
2026-08-21Ameya Bhatawdekar Braintrust
에이전트 만들기 · 운영
메시지 한 통이 코덱스 하니스를 통과하는 법 — 도구 검색부터 오토 리뷰까지
코덱스 하니스가 메시지 한 통을 처리하며 거치는 장치들이 구체적으로 나옴 — 스킬 목록을 컨텍스트 창의 2%로 묶어두는 규칙, 도구를 지연 로딩해 두었다가 도구 검색으로만 찾게 하는 방식, 파일…
2026-08-12Dominik Kundel OpenAI
에이전트 만들기 · 운영
자동화는 마크다운으로, 협업은 채팅으로 옮아간다
깃허브 넥스트(GitHub Next)가 만드는 두 프로토타입 — 가드레일을 앞머리 설정으로 못 박은 마크다운 자동화와, 클라우드 마이크로VM 위에서 팀 채팅 기록 전체를 보고 움직이는 협업…
2026-08-12Idan Gazit GitHub
서빙 · 비용 · 인프라
격리가 검사를 대신한다 — 개인용 앱을 안전하게 바이브 코딩하는 법
사용자가 자기 앱을 AI에게 시켜 직접 고쳐 쓰게 하는 판을 보여 줌. 화면 쪽과 서버 쪽을 둘 다 가둬 서로에게만 말하게 만들어 「이 코드에서 나올 수 있는 보안 결함 중 문제 되는 것은…
2026-08-12Kenton Varda Cloudflare
에이전트 만들기 · 운영
에이전트가 아니라 하니스가 실패한다 — 상태·순서·증명이라는 세 가지 약속
OpenAI에서 에이전트 인프라를 다루는 발표자가 오픈클로(OpenClaw, 오픈소스 개인 비서형 에이전트 프로젝트)에서 실제로 벌어진 이슈 다섯 건 — 상태 구멍, 겹친 기록자, 매달린 툴…
2026-08-05Vinoth Govindarajan OpenAI
모델 훈련 · 후속 학습
일하면서 배우는 에이전트 — 포스트트레이닝의 다음 단계
학습 더미가 쥐고 있던 것을 한 층씩 바깥으로 내주는 순서. 단순 문답에서 합성 환경으로, 남의 하네스로, 배포 뒤 스스로 고치는 데까지 갈 때마다 무엇을 놓고 무엇을 얻는지 짚음. 네트워크 탓에…
2026-07-31Raymond Feng Applied Compute
평가 · 결과물 품질
AI 슬롭을 끝내는 법
디자인·글쓰기·성격처럼 정답이 없는 일을 채점할 수 있는 것으로 쪼개는 방법. 수학에서는 가장 그럴듯한 답이 곧 정답인데 취향에서는 그 가운데 답이 슬롭이 되는 이유와, 전문가끼리 판단이 갈릴 때…
2026-07-31Thais Castello Branco (타이스) Taste Labs
서빙 · 비용 · 인프라
검색이 먼저 무너진다 — 모델 300만 개를 받아 낸 방법
모델이 2만 개에서 300만 개로 몇 해 만에 150배 늘면서 훑어 찾던 검색이 무너지고 색인 기반으로 갈아탄 이유. 모델 자체와 모델에 관한 것을 다른 저장소에 갈라 둔 구조, 읽기를 어디로…
2026-07-29Arek Borucki Hugging Face
에이전트 만들기 · 운영
LLM에게 운전대를 주지 마라 — 상태는 하네스가 기억한다
라이브 AI 튜터 에이스(Ace)를 인트로·티치·체크·그레이드·어드밴스·랩 여섯 단계 상태 머신으로 쪼개, 모델에게는 한 번에 한 단계만 좁은 계약으로 넘기고 다음 단계 판단은 하네스가 맡는…
2026-07-26Ornella Bahidika & Joel Allou Microsoft
에이전트 만들기 · 운영
긴 호흡 에이전트를 짜는 법 — 뇌와 손을 나누고 검증자를 세우고 재운다
앤스로픽이 매니지드 에이전트(Managed Agents)를 만들며 부딪힌 문제와 해법 네 가지를 정리함. 뇌(하니스)와 손(컨테이너)을 분리해야 하는 이유, 검증을 별도 컨텍스트로 떼어내야 하는…
2026-07-26Lance Martin Anthropic
에이전트 만들기 · 운영
페이블 현장 안내서 — 언노운을 찾아야 이 모델을 쓴다
이름이 특정 글자로 끝나는 포켓몬을 세는 물음으로 능력 과잉(capability overhang)을 설명하고, 클로드 코드 시스템 프롬프트를 80% 걷어낸 이유를 밝힘. 판이 올라갈수록 프롬프트가…
2026-07-26Thariq Shihipar Anthropic
에이전트 만들기 · 운영
AI 엔지니어가 세상을 먹는다 — 터미널 스무 개 대신 루프 하나로
오픈AI 코덱스(Codex) 팀 발표에 이어 게스트 피터 스타인버거가 자기 워크플로가 몇 달 새 어떻게 바뀌었는지 공개함. 터미널 10개 이상을 돌려 끝난 놈을 골라 쓰던 1월에서, 지금은 매니저…
2026-07-26Alexander Embiricos & Romain Huet &…
에이전트 만들기 · 운영
에이전트는 얇게, 바닥은 똑똑하게 — 온톨로지 3층으로 데이터 배선을 한 번만
은행 계좌 개설 에이전트가 신원 확인에 DMV(차량관리국) 등록부와 여권 검증 서비스 두 데이터 소스를 쓰는 예로, 팀마다 에이전트를 만들 때마다 데이터 배선을 처음부터 다시 하는 문제를 짚음.…
2026-07-26Emil Eifrem Neo4j
에이전트 만들기 · 운영
에이전트가 프로덕션에서 터지면 재현부터 안 된다 — 결정성 대신 재생 가능성을 쫓아라
에이전트가 "1,000달러어치를 팔라"는 지시를 1,000주 매도로 착각해 190,000달러짜리 사고를 냈는데 API는 200 OK를 30밀리초 만에 돌려줘 대시보드는 멀쩡했다는 사례로 시작함.…
2026-07-26Tisha Chawla & Susheem Koul Microsoft
에이전트 만들기 · 운영
코드를 쓰다가 시스템을 설계하는 일로 — 가드레일 세 겹 쌓아야 20배 개발자가 된다
20년 경력 중 19년 반을 에디터에서 보낸 개발자가 이제 에디터를 관제판으로만 쓴다고 말하며, CLI에서 시작해 에디터를 거쳐 위임으로 늘리는 세 지점을 제시함. Agents.md·스킬·커스텀…
2026-07-26Chris Noring Microsoft
코딩 에이전트 · 개발 도구
AI 인턴에게는 고삐가 필요하다 — 코드 짜기 전에 명세부터 쓰는 법
코딩 어시스턴트를 AI 인턴에 빗대며 코드 짜기 전에 요구사항·설계 문서부터 쓰는 방식을 설명함. 도구 없이 손으로 할 때의 다섯 걸음과 AWS가 만든 IDE 키로(Kiro)의 스펙 모드를 나란히…
2026-07-26Eric Hanchett AWS
코딩 에이전트 · 개발 도구
취약점 찾기는 쉬워졌다 — 병목은 검증·분류·패치로 넘어갔다
파이어폭스의 월 보안 수정이 2025년 평균 20건대에서 4월 400건으로 뛴 사례로 시작해, 찾는 일이 쉬워진 자리에서 병목이 어디로 옮겨 갔는지 짚음. 여러 팀이 모인 여섯…
2026-07-26Eugene Yan Anthropic
검색 · 컨텍스트 · 기억
벡터만으로는 기억이 안 된다 — 그래프로 되짚은 홈랩 보안 구멍
기억을 전부 마크다운에 두면 한 라운드에 최소 10만 토큰을 실어 나른다는 자기 계측에서 출발함. 같은 원본 파일로 두 벌을 만들어 한쪽엔 벡터만, 한쪽엔 그래프를 붙이고 같은 것을 물어 본…
2026-07-26Stephen Chin Neo4j
평가 · 결과물 품질
평가 없이 스킬을 내보내지 마라 — 스킬 5만 개를 뜯어본 결과
스킬 5만여 개를 색인해 보니 평가가 딸린 것이 거의 없고, AI가 쓴 스킬은 성능을 되레 떨어뜨릴 수 있다는 조사 결과. 스킬 설명이 부를 때마다 백에서 이백 토큰을 무는 상시 비용이라는 셈…
2026-07-26Philipp Schmid Google DeepMind
평가 · 결과물 품질
대응자에서 검토자로 — 신호에서 PR까지, 스스로 고치는 에이전트
관측이 사람이 화면을 클릭하는 일에서 에이전트가 먼저 이슈를 띄우는 순환으로 넘어가는 과정. 병목이 「고치는 일」에서 「이 수정이 맞는지 확신하는 일」로 옮겨 간 대목, 기록을 지금의 10배로…
2026-07-26Jason Lopatecki Arize
평가 · 결과물 품질
큰 모델 대신 30억짜리 — 프롬프트와 후처리로 기기 위에서 따라잡는다
큰 모델을 기준선(평균 지연 2.9초, 작업 열넷에 0.22달러, 하루 1달러 남짓)으로 두고 기기에서 도는 작은 모델 넷을 같은 시험으로 겨룬 기록. 가장 빠른 것도 가장 정확한 것도 아닌…
2026-07-26RL Nabors Arize
에이전트 만들기 · 운영
시니어가 에이전트에서 막히는 이유 — 목표만 주고 경로는 맡기는 법
소프트웨어를 짜던 습관이 에이전트에서는 왜 발목을 잡는지 다섯 갈래로 짚음. 고객 상담 에이전트가 같은 프롬프트로 10번 중 1번만 성공하면 왜 못 쓰는지, 5분·15분씩 도는 에이전트가 중간에…
2026-06-26Philipp Schmid Google DeepMind
에이전트 만들기 · 운영
MCP 앱, 채팅창 안에 화면을 띄우다 — 텍스트만 뱉던 MCP에 iframe UI를 더하다
MCP(모델 컨텍스트 프로토콜)가 텍스트만 돌려주던 시절엔 README에 아스키 아트와 이모지가 넘쳤다는 이야기와, 이제는 서버가 UI 리소스를 함께 돌려줘 호스트가 그걸 샌드박스 아이프레임에…
2026-06-26Marlene Mhangami & Liam Hampton GitHub
에이전트 만들기 · 운영
에이전트는 결정하지 않는다, 제안한다 — 컨텍스트 그래프의 의사결정 프레임워크
신용카드와 쇼핑 계정을 쥔 자율 에이전트에게 냉장고를 채워 두라고 시키면 집세 낼 돈이 모자란 사정은 모른 채 주문한다는 예로 왜 명시적인 결정 틀이 필요한지 보여줌. 대안과 장단점을 내는…
2026-06-26Andreas Kollegger & Zaid Zaim Neo4j
검색 · 컨텍스트 · 기억
문서가 아니라 결정의 흔적이 필요하다 — 컨텍스트 그래프로 에이전트에 선례 붙이기
지식 베이스는 물음에 답하게 하고 컨텍스트 그래프는 승인·거절과 그 까닭까지 대게 한다는 갈림점. 금융 에이전트 데모에서 지난 판단을 끌어와 선례를 그래프 구조로 찾는 순서가 나오고, 명령 한…
2026-06-26Zach Blumenfeld Neo4j
평가 · 결과물 품질
평가는 감으로 시작해 프로덕션을 되감는 데서 끝난다 — 성숙도 네 단계
고객사들에서 본 평가 성숙도를 네 단계로 정리함. 예시 입력 열 개로 감을 잡되 매긴 이유를 반드시 남기게 하는 첫 단계부터, 내보낸 자취를 되감아 다시 돌리는 순환, 바깥 시스템을 건드리는…
2026-06-26Phil Hetzel Braintrust
평가 · 결과물 품질
평가를 만드는 사람이 너무 적다 — 해커톤·시험·게임·벤치마크
평가가 왜 흩어지고 검증도 안 되며 소수만 만드는지 세 가지로 짚고, 그것을 고치려는 네 갈래 시도를 봄. 경쟁 연구소가 자기 모델에만 압축을 켜서 같은 벤치마크를 더 좋은 점수로 다시 낸 일…
2026-06-26Nicholas Kang & Michael Aaron Google…
평가 · 결과물 품질
에이전트 관측은 다른 시스템 문제다 — 트레이스가 기가바이트를 넘어설 때
에이전트 자취를 담을 저장소를 왜 처음부터 새로 짰는지 다룸. 자취 하나가 1기가바이트를 넘고 조각 하나가 20메가바이트에 이르는 사례, 쓰던 저장소를 버린 이유가 「그때는 글 색인이 안…
2026-06-26Phil Hetzel Braintrust
평가 · 결과물 품질
관측과 평가와 실험을 한 판에 — 최종 목표는 당신을 이 과정에서 빼는 것
지난해 토큰을 1000억에서 1조 사이로 썼다고 밝히는 아키텍트가 관측·평가·실험 세 층을 표준 기록 규격 하나로 묶는 방식을 설명함. 재는 범위를 걸음 하나·여러 걸음·오간 길 전체·한 자리…
2026-06-26Dat Ngo Arize
서빙 · 비용 · 인프라
금기이던 「그 자리에서 코드 돌리기」를 부품으로 — 상태를 쥔 서버리스 위에
에이전트를 한 해 넘게 만들어 온 팀이 쓰는 바닥을 풀어놓음. 상태를 그대로 쥐는 실행 단위 위에, 받은 코드 문자열을 그 자리에서 가둬 돌리는 새 부품을 얹는 구조. 가두는 방향이 흔한 방식과…
2026-06-26Sunil Pai · Matt Carey Cloudflare
서빙 · 비용 · 인프라
텍스트 디퓨전, 빠른데 안 쓰는 이유
한 자씩 뽑는 방식보다 훨씬 빠른데도 큰 모델에 아무도 안 넣는 이유를 칩의 나르는 길에서 설명함. 토큰 256개를 스물네 번 훑어 만들면 실어 나르는 횟수가 10분의 1이 된다는 셈, 실제로…
2026-06-26Brendan O'Donoghue Google DeepMind
음성 · 멀티모달
제미나이 오디오 스택 — 알아듣는 모델이 말하고 노래까지 만든다
딥마인드 오디오 쪽을 알아듣기·말하기·실시간·노래 넷으로 훑는 데모 발표. 요청 한 번으로 화자 이름표와 타임스탬프, 언어와 번역, 감정까지 한꺼번에 받아 내는 과정과, 목소리를 수백 개 쌓는…
2026-06-26Thor Schaeff Google DeepMind
에이전트 만들기 · 운영
다들 기본값만 썼다 — 깃허브가 MCP 툴을 100개에서 40개로 줄인 이유
깃허브 MCP 서버가 툴 100개를 넘기며 에이전트를 오히려 헷갈리게 만들던 시절, 툴셋과 동적 선택 같은 정교한 해법을 만들어놓고도 정작 다들 기본 설정만 썼다는 실패담부터 짚음. 목록 풀…
2026-05-26Sam Morrow GitHub
에이전트 만들기 · 운영
딥마인드가 에이전트를 구글 규모로 굴리는 법 — 지금은 몫으로 막는 게 전부
딥마인드 안에서 에이전트를 실제로 굴리는 두 사람이 사내 사정을 그대로 이야기함. 사내 한도가 고객보다 빡빡하다는 것, 큰 모델의 몫이 차면 빠른 모델로 자동으로 내려가고 그마저 다 쓰면 로컬…
2026-05-26KP Sawhney & Ian Ballantyne Google…
에이전트 만들기 · 운영
한 사람과 에이전트 스물넷, 정렬은 없다 — 깃허브가 협업 환경을 짓는 이유
코딩 에이전트(사람이 시킨 일을 스스로 여러 단계로 쪼개 도구를 불러가며 처리하는 프로그램) 여러 대를 한 사람이 돌리는 그림이 왜 팀 생산성과 무관한지부터 짚고, 깃허브 넥스트(GitHub…
2026-05-26Maggie Appleton GitHub
코딩 에이전트 · 개발 도구
1만 5천 줄짜리 워크트리 기능을 스킬 하나로 갈아치우다 — 대신 에이전트를 믿어야 한다
커서가 워크트리와 베스트오브N을 굴리던 코드 약 1만 5천 줄을 지우고 그 자리를 마크다운 지시로 채운 이야기. 베스트오브N은 코드 4천 줄에서 마크다운 마흔 줄이 됐고, 멀티레포와 대화 도중…
2026-05-26David Gomes Cursor
코딩 에이전트 · 개발 도구
손 댈 일과 맡길 일을 구분하는 기준 — 세 갈래를 한자리에서 굴리기
에이전트를 손 대는 정도로 셋으로 나누고 한 저장소에서 동시에 굴려 시험·화면·문서를 각각 맡기는 시연. 묻지 않고 진행하는 모드를 켜되 내보내기 직전에 멈추라고 미리 못 박아 두는 절차…
2026-05-26Liam Hampton Microsoft
평가 · 결과물 품질
커버리지는 통과해도 기능은 안 본다 — AI 코드에 되살린 레드-그린 TDD
커밋이 한 해 10억 건에서 주 2억 7500만 건으로 늘어난 수치를 들며, 코드량이 는 것과 생산성이 는 것은 다른 문제라는 개발자 12만 명 연구를 소개함. 어느 팀은 PR은 늘었는데 품질이…
2026-05-26Marlene Mhangami Microsoft
평가 · 결과물 품질
평가 판의 어려운 자리는 화면이 아니라 자취를 담는 층이다
평가 판이 스프레드시트에서 시작해 왜 결국 시스템 문제로 커지는지를 단계로 짚음. 여느 조각은 몇 킬로바이트인데 에이전트 자취에서 10~20메가바이트짜리를 봤다는 수, 자기네가 만든 질의 언어를…
2026-05-26Phil Hetzel Braintrust
서빙 · 비용 · 인프라
모델을 앱이 아니라 OS가 들고 있다 — 기기 위 AI 인프라 묻고 답하기
기기에서 도는 모델이 3~4기가라 앱마다 못 담고 시스템 서비스 하나로 얹어 앱들이 나눠 쓰는 구조. 앱이 백 개가 돼도 괜찮은 이유가 값을 가운데로 몰았기 때문이라는 답, 하루 열댓 번 쓰는…
2026-05-26Florina Muntenescu & Oli Gaymond Google…
서빙 · 비용 · 인프라
어디서 온 모델이든 한 파일로 — 기기 위에 얹는 길과 그 배수들
서로 다른 틀에서 만든 모델을 한 형식으로 모아 휴대폰·노트북·작은 보드까지 같은 파일로 내보내는 경로. 작은 모델에 함수 호출과 구조화 출력과 사고 과정이 기기 안에서 붙었다는 것, 전용 칩을…
2026-05-26Chintan Parikh & Weiyi Wang Google…
서빙 · 비용 · 인프라
게이트웨이 하나면 된다 — 기업 MCP는 신뢰의 뿌리 하나로 풀린다
서버가 수천 개 등록된 목록이 있어도 기업은 관측·권한·보안 셋을 못 푼다는 진단과, 보안팀이 판 하나만 승인해 주면 그 뒤로는 팀마다 각자 만들어도 된다는 처방. 법무팀이 기술팀을 안 거치고…
2026-05-26Karan Sampath Anthropic
음성 · 멀티모달
무엇이든 무엇으로 — 아직 하나의 모델은 아니다
무엇이든 넣어 무엇으로든 낸다는 슬라이드를 발표자가 스스로 정정하는 데서 시작함 — 아직 한 모델이 아니라 이해하는 모델과 만드는 모델이 따로 있고, 그 사이를 함수 호출로 잇는다. 노트북LM…
2026-05-26Patrick Löber Google DeepMind
제품 · 조직 · 도입
생성AI 에이전트, 데이터 과학자의 것인가 — 답은 다양한 팀에 있다
전통 기업에서 에이전트 일이 기존 ML·데이터 과학 팀으로 떨어지는 위임 사슬을 짚고, 그 자리가 왜 어긋나는지를 파이프라인 차이로 설명함. 모델이 이미 만들어져 있어 학습·검증 절차가 통째로…
2026-05-26Phil Hetzel Braintrust
에이전트 만들기 · 운영
코드가 말하게 한다 — 에이전트는 앱이 아니라 상태 기계에 들어간다
클라우드플레어 API 2,600개 엔드포인트를 다 노출하면 첫 호출에서만 120만 토큰이 드는데, 검색·실행 두 개 툴로 그걸 1,000토큰까지 줄인 99.9% 절감 사례와 켄턴이 캔버스에 그린…
2026-04-26Sunil Pai Cloudflare
에이전트 만들기 · 운영
MCP는 어디로 가나 — 다음은 연결성이다
MCP(모델 컨텍스트 프로토콜) 월간 다운로드가 1억 1000만 건에 이르렀다는 수치와 함께, 툴을 미리 다 컨텍스트에 넣지 않고 필요할 때만 불러오는 프로그레시브 디스커버리와 여러 툴 호출을…
2026-04-26David Soria Parra Anthropic
서빙 · 비용 · 인프라
이름은 스무 억, 실제는 마흔 억 — 빠른 자리에 올리는 몫으로 이름을 붙였다
이름이 「사실상 스무 억」인데 실제 개수는 마흔 억쯤인 이유. 층마다 붙는 임베딩을 계산이 아니라 표 찾기로 만들어 놓아 빠른 자리 대신 느린 자리나 디스크에 둘 수 있고, 그래서 빠른 자리에…
2026-04-26Omar Sanseviero Google DeepMind
음성 · 멀티모달
디퓨전은 결국 압축과 가이던스다 — 구글 딥마인드의 이미지·영상 생성 뒷단
이미지·영상 생성 모델을 크게 학습시키는 데 드는 것을 여덟 대목으로 훑는 40분짜리 강의. 생성이 픽셀 위가 아니라 따로 학습시킨 압축기가 만든 좁은 자리에서 일어나고, 텐서가 두 자릿수까지…
2026-04-26Sander Dieleman Google DeepMind
에이전트 만들기 · 운영
컨텍스트 창을 비우고 컴퓨터를 맡긴다 — 앤스로픽이 에이전트용 클로드 API를 넓히는 법
메모리 툴과 컨텍스트 편집(context editing)을 같이 썼더니 앤스로픽 내부 평가에서 성능이 39% 올랐다는 수치, 최대 100만 토큰까지 열리는 컨텍스트 창 이야기가 나옴. 클로드…
2025-12-26Katelyn Lesse Anthropic
에이전트 만들기 · 운영
에이전트 그만 짓고 스킬을 쌓아라 — 앤트로픽이 스킬을 만든 이유
앤트로픽이 스킬(skill)을 낸 지 다섯 주 만에 스킬 수천 개짜리 생태계가 생겼고, 곧바로 금융 서비스와 생명과학 분야 신사업까지 냈다는 발표. 세금 신고를 IQ 300짜리 천재 대신 경험…
2025-12-26Barry Zhang & Mahesh Murag Anthropic
에이전트 만들기 · 운영
채팅 로그 대신 아티팩트 — 안티그래비티가 에이전트를 보여주는 법
편집기와 브라우저를 사람의 자리에서 에이전트의 도구 자리로 내리고, 에이전트를 관리하는 창을 한가운데 놓은 제품 이야기. 코드 차이 대신 브라우저 녹화를 결과물로 내미는 장면, 사내 엔지니어와…
2025-12-26Kevin Hou Google DeepMind
코딩 에이전트 · 개발 도구
모델이 바뀌어도 안 무너지는 하네스 — 습관을 이기려 들지 마라
새 모델이 나올 때마다 프롬프트와 도구를 다시 맞추던 문제를 하네스 쪽에서 흡수하자는 논리. 출시 직후 남의 모델용 프롬프트를 그대로 옮겨 와 「파일마다 꼼꼼히 보라」고 시킨 탓에 느려지고 결과도…
2025-12-26Bill Chen & Brian Fioca OpenAI
모델 훈련 · 후속 학습
프롬프트로 안 풀리면 가중치를 바꾼다 — 오픈AI의 에이전트 강화 파인튜닝
오픈AI 파인튜닝 팀이 연 에이전트 강화 파인튜닝을 프롬프트·과제 최적화 다음에 꺼내는 마지막 카드로 자리매김하고, 네 회사 사례로 무엇이 달라졌는지 보여줌. 예시를 100개에서 1,000개로…
2025-12-26Will Hang & Cathy Zhou OpenAI
평가 · 결과물 품질
예시 150개로 배우는 코딩 에이전트 — 시스템 프롬프트에 규칙을 쌓는다
코딩 에이전트가 왜 실패했는지를 모델 심사에게 글로 받아 내 시스템 프롬프트에 규칙으로 쌓는 방식. 벤치마크 예시 150개만으로 한쪽은 5, 다른 쪽은 15만큼 해결률이 올랐다는 실험과, 모델을…
2025-12-26Aparna Dhinakaran Arize
제품 · 조직 · 도입
프롬프트 하나로 앱을 만드는 시대 — 제미나이 3와 AI 스튜디오 라이브 데모
제미나이 3 프로가 화요일에, 나노 바나나 프로가 발표 전날에 나온 자리에서 AI 스튜디오 데모만으로 채운 발표. 얼굴 사진 한 장으로 만화책을, 스크린샷 한 장으로 자기 제품 화면을 복제하고…
2025-12-26Kat Kampf & Ammaar Reshi Google DeepMind
검색 · 컨텍스트 · 기억
점을 잇는 건 그래프다 — 지식그래프로 짜는 컨텍스트 엔지니어링
같은 지식그래프에 두 가지로 물어 본 대조. 닮은 것을 찾고 그 옆을 한 번 더 보는 방식은 빨랐지만 얕았고, 에이전트가 먼저 구조를 물어본 뒤 질의를 여러 번 던지게 하니 번호와 심각도와 고쳐야…
2025-11-26Stephen Chin Neo4j
에이전트 만들기 · 운영
에이전시가 아니라 효과성 — 에이전트 앱을 만들 때 실제로 필요한 것들
에이전트를 만들 때 핵심은 에이전시(스스로 판단해 행동하는 정도) 자체가 아니라 효과성이라는 축을 하나 더 놓고 보는 것이라는 걸 보여줌. Y 컴비네이터 소속 스타트업 중 에이전틱을 자처하는 곳이…
2025-08-26Michael Albada Microsoft
에이전트 만들기 · 운영
에이전트를 넷으로 쪼개면 — 어려운 건 도구와 상태관리다
에이전트를 클라이언트·AI·워크플로우·도구 네 조각으로 나눠보면 실제로 막히는 지점이 어디인지 드러난다. MCP 서버를 직접 짤 때 걸리는 세 난관(전송 프로토콜·OAuth·메모리)과 신용카드…
2025-08-26Rita Kozlov Cloudflare
에이전트 만들기 · 운영
판단은 모델에 맡기고 방법은 정하지 않는다 — 6억 알렉사와 3주짜리 Q 개발자의 설계
알렉사가 6억 대 기기에서 수백 개 전문가 시스템과 수만 개 파트너 서비스를 오케스트레이션하는 규모, AWS 내부 팀이 아마존 Q 디벨로퍼 CLI 에이전트를 3주 만에 만들어 낸 이야기를 다룸.…
2025-08-26Antje Barth AWS
에이전트 만들기 · 운영
코파일럿 에이전트에 MCP 붙이기 — 읽기 전용으로 시작해 매번 허락을 받게 짠다
리드미(README) 파일 하나만 채워두고 코파일럿 에이전트 모드에 맡겨 8분 만에 동작하는 여행 예약 앱을 만드는 시연과, 포스트그레스(Postgres) MCP를 읽기 전용으로 붙여 실제 DB…
2025-08-26Jon Peck Microsoft
에이전트 만들기 · 운영
모델과 도구, 그거면 된다 — 스트랜즈가 스캐폴딩을 걷어낸 법
파일을 읽어 요약하고 마크다운으로 쓴 뒤 소리 내어 읽어주는 데모가 기본 도구 세 개만으로 돌아가는 과정과, MCP(모델 컨텍스트 프로토콜) 서버를 붙여 3blue1brown 스타일 수학…
2025-08-26Suman Debnath AWS
에이전트 만들기 · 운영
주사위 굴리는 에이전트로 보는 프로덕션행 — 로컬 파이썬에서 AWS 베드록까지
노트북에서 돌아가는 라마(Llama) 3.1 8B 다이스 롤러 에이전트를 똑같이 아마존 베드록(Amazon Bedrock) 콘솔에서 다시 만들어 클라우드 스케일로 올리는 전 과정을 실시간으로…
2025-08-26Mike Chambers AWS
에이전트 만들기 · 운영
더 큰 모델보다 데이터 플라이휠 — 라우터 에이전트를 70B에서 1B로 줄인 이야기
NVIDIA 사내 지원 에이전트(NV Info Agent)의 라우터를 사례로, 파인튜닝 없이 배포한 70B 모델의 96% 정확도를 685개 피드백 데이터로 파인튜닝한 1B 모델이 94%까지…
2025-08-26Sylendran Arunagiri NVIDIA
에이전트 만들기 · 운영
에이전트에게 믿고 맡기려면 — 블렌더로 검증한 반자율 UX 네 원칙
프레임워크 없이 자연어로 3D 장면을 만드는 블렌더 엘엠(Blender LM)을 처음부터 만들어 본 과정을 통해, 결정론적 워크플로 대신 자율 탐색형 에이전트를 고른 이유와 능력 발견·관측…
2025-08-26Victor Dibia Microsoft
코딩 에이전트 · 개발 도구
모델은 지수로 크는데 제품은 못 따라간다 — 클로드 코드를 일부러 헐겁게 두는 이유
클로드 코드(Claude Code)를 만든 보리스가 제품을 일부러 최소한으로 두는 이유를 밝힘. 프로그래밍 언어는 서로 닮아 가며 멈췄는데 UX와 모델은 계속 올라간다는 것이 그 근거고…
2025-08-26Boris Cherny Anthropic
검색 · 컨텍스트 · 기억
지식그래프 RAG, 언제 써야 하나 — 트리플 만들기와 하이브리드 판단
그래프를 쓸지 말지를 두 가지로 나눈다. 자료가 원래 짜여 있느냐와, 물음이 관계를 여러 칸 건너야 답이 되느냐다. 온톨로지를 바로잡는 데 전체 시간의 80%가 든다는 자백과, 트리플 추출…
2025-08-26Mitesh Patel NVIDIA
검색 · 컨텍스트 · 기억
데이터가 차이를 만든다 — RAG는 평가 없이 최적화할 수 없다
발표의 절반이 자사 제품 이름을 순서대로 늘어놓는 자리이고, 남는 것은 순서 하나다. 검색 결과가 쓸 만한지부터 재고 그다음에 모델로 넘긴다. 무엇이 잘못됐는지 모르면서 최적화할 수 있느냐고…
2025-08-26Mani Khanuja AWS
검색 · 컨텍스트 · 기억
그래프RAG로 컨텍스트 창을 짜야 하는 이유 — 둠에 점프를 넣은 에이전트 이야기
이백 줄짜리 게임과 십만 줄짜리 둠에서 같은 것이 두 번 갈렸다. 코드를 통째로 밀어 넣으면 러스트 번역이 컴파일도 안 됐고, 그래프를 얹으니 그대로 돌았다. 삼십 년 된 둠에 원작에 없던 점프를…
2025-08-26Jonathan Larson Microsoft
모델 훈련 · 후속 학습
병목을 풀 때마다 똑똑해졌다 — 제미나이가 생각하는 법
언어 모델의 역사를 병목 하나씩 뚫어 온 자국으로 다시 읽고, 지금 걸린 것이 답하기 전에 쓰는 계산량이 요청마다 고정돼 있다는 점임을 보여줌. 생각 단계를 고리로 끼워 수천에서 수만 번 돌게…
2025-08-26Jack Rae Google DeepMind
평가 · 결과물 품질
평가는 그냥 오지 않는다 — 새 모델이 판을 바꿀 때 24시간 안에 올라타는 법
새 모델이 나올 때마다 24시간 안에 반영한다는 노션(Notion) 사례로 평가 성숙도의 기준을 셋으로 정리하고, 새 모델이 나온 지 2주 만에 전에는 10% 수준이라 못 쓰던 기능을 내보냈다는…
2025-08-26Ankur Goyal Braintrust
평가 · 결과물 품질
레드팀을 에이전트에게 맡긴다 — 가드레일은 모델 밖에 있다
거르개를 다 뗀 모델을 직접 두드리니 폭력 갈래의 25%, 여러 수를 겹친 공격의 20%가 뚫렸고, 거르개를 켠 쪽에서는 160번 중 한 번도 안 뚫렸다는 대비를 보여줌. 사내 레드팀이 쓰던…
2025-08-26Nagkumar Arkalgud & Keiji Kanazawa…
평가 · 결과물 품질
모델은 안전의 일부일 뿐이다 — 에이전트를 단계로 채점하기
행사 페이지에 참석자 수가 없었는데 에이전트가 링크를 따라간 다른 페이지에서 269명을 찾아 두 페이지를 합쳐 답한 실제 데모. 폭력적인 그림에 5점 만점 중 4점이 나와 기본 문턱으로는 탈락한…
2025-08-26Cedric Vidal Microsoft
평가 · 결과물 품질
코드는 명세의 손실 압축본이다 — 명세를 쓰는 사람이 새 프로그래머다
코드는 의도를 적은 명세에서 떨어져 나온 손실 압축본일 뿐이고 그 명세를 쓰는 사람이 진짜 프로그래머라는 주장. 아첨하는 성향을 내보낸 사고를 「명세에 이미 하지 말라고 적혀 있었으니 버그다」로…
2025-08-26Sean Grove OpenAI
서빙 · 비용 · 인프라
추론 파레토 경계를 미는 법 — 나누기만 해도 GPU당 처리량이 두 배
답을 만드는 두 단계를 다른 기계로 갈라 놓는 것만으로 같은 H100 열여섯 장에서 고정 지연 기준 GPU당 처리량이 최대 두 배가 된 사례. 그것이 안 통하는 구간까지 함께 밝히는 대목, 작은…
2025-08-26Kyle Kranen NVIDIA
서빙 · 비용 · 인프라
새로 만든 것은 가운데뿐 — 있던 것을 이어 붙인 기기 위 실행 판
이미 널리 쓰이던 실행기 위에 「기기에 모델을 얹고 챙기는 서비스」 한 겹을 새로 얹어 만든 판. 작은 모델을 돌려 초당 90토큰쯤이 나온 실측, 같은 코드가 두 운영체제에서 각기 다른 모델로…
2025-08-26Emma Ning Microsoft
서빙 · 비용 · 인프라
웹소켓이든 이메일이든 상관없다 — MCP를 사내 표준으로 삼은 이유
같은 메시지를 웹소켓으로도 유닉스 소켓으로도, 심지어 메일로도 실어 날라 보이며 「어디로 나르느냐는 사소한 구현 세부」라고 못 박음. 쓰임마다 창구가 늘어 옮기는 데 몇 주씩 걸리던 상태에서…
2025-08-26John Welsh Anthropic
음성 · 멀티모달
밀리초 안에 답하라 — 카르티시아가 음성 AI를 상태공간모델로 다시 만든 이유
클라우드 배치가 500~600밀리초에 답하는 것으로는 대화가 안 된다는 데서 시작해, 음성 합성을 빠르게 해서 번 시간을 언어 모델 몫으로 넘긴다는 구조를 짚음. 소닉 2가 초기 모델보다 2.5배…
2025-08-26Arjun Desai (Cartesia) & Rohit Talluri…
에이전트 만들기 · 운영
에이전트 스케일링 — 블룸버그가 프로덕션에서 배운 것
리서치 애널리스트용 에이전트를 400명·50개 팀이 매일 고쳐 내보내며 겪은 것. 「최근 5개 분기」에서 글자 하나가 빠져 월간 값이 분기 값으로 나간 사고, 위에서 에이전트를 바꾸면 아래가…
2025-04-01Anju Kambadur Bloomberg
평가 · 결과물 품질
프롬프트 짜기는 글쓰기다 — 태그로 붙잡고 쪼개서 묻는다
태그로 감싸는 것을 빠뜨려 성능을 못 내는 흔한 실수, 긴 문서에서 물을 때 물음을 맨 끝에 두는 쪽이 맨 앞보다 훨씬 잘 맞았다는 사내 실험, 적어 놓은 추론이 실제 추론과 어긋날 수 있어…
2024-08-26Karina Nguyen Anthropic

발표 한 편이 카드 한 장입니다. 글의 형식은 둘입니다. 논지가 앞의 말에서 뒤의 말로 굴러가는 발표는 한 생각에 번호 하나를 매겨 늘어놓고, 구조를 설명하는 발표는 그림을 앞세운 보고서로 씁니다. 어느 쪽이든 맨 위의 「한줄 코멘트」가 판단이고 그 아래가 거기까지 가는 걸음입니다.

자막 전문에서 옮겼고, 발표자가 자기 회사를 파는 대목은 그렇다고 밝혀 두었습니다. 숫자는 발표에 나온 것만 싣습니다.