← AI Engineer
RAG · 평가

데이터가 차이를 만든다 — RAG는 평가 없이 최적화할 수 없다

발표의 절반이 자사 제품 이름을 순서대로 늘어놓는 자리이고, 남는 것은 순서 하나다. 검색 결과가 쓸 만한지부터 재고 그다음에 모델로 넘긴다. 무엇이 잘못됐는지 모르면서 최적화할 수 있느냐고 청중에 되묻는 대목과, 관측 없이는 파일럿도 하지 말라고 말을 바꿨다는 대목이 뼈대다. 여행 에이전트·사내 챗봇·마케팅 셋으로 앱마다 데이터 요구가 갈리는 것도 보인다. 잰 값은 하나도 없다.

Mani Khanuja AWS발표 2025-08-2620분 11초AI Engineer

한줄 코멘트. 발표의 절반이 자사 제품 나열인데 남는 알맹이는 순서 하나다. 검색 결과가 쓸 만한지부터 재고 그다음에 모델로 넘긴다는 것이다. 관측 없이는 파일럿도 하지 말라고 말을 바꿨다는 대목도 같은 이야기다. 잰 값은 하나도 없고, 견준 상대도 없다. 발표자는 자기 이름도 소속도 자막에서 밝히지 않는다.

1. 기초를 데이터라고 부른다

발표자가 자기를 소개하지 않는다. 자막 어디에도 이름과 소속을 밝히는 문장이 없고, 제품을 설명할 때만 「우리」라고 말한다. 화면에 띄운 춤추는 코코넛 영상은 자기 회사 모델로 만들었다고 밝힌다.

여는 말이 이렇다. 생성형 AI가 사업에 값을 더하기는 하는데 「제대로 했을 때」라는 조건이 붙는다는 것이다. 사용자가 앱을 쓰는 방식을 바꿀 만큼 큰 것을 지으려면 그 밑을 봐야 하고, 그 밑이 데이터라고 말한다. 데이터가 회사와 브랜드와 조직을 대신하기 때문이라는 것이다.

자료를 옮기고 싣고 뜯는 일은 여전히 중요하다고 하면서도 더 중요한 것을 따로 든다. 자료가 기술과, 그리고 사람과 어떻게 맞닿아 있느냐다. 아직 자료가 부서마다 따로 놀고 있지 않은지도 묻는다.

2. 앱 셋, 요구가 다르다

데이터 요구가 앱마다 어떻게 갈리는지 셋으로 보인다.

세 앱이 각각 무엇을 필요로 하나

앱무엇이 있어야 하나
여행 에이전트고객 프로필. 환불 자격은 항공사 여행 정책이 정한다
사내 생산성 챗봇회사 자료. 직원이 제 권한보다 더 보지 않게 막는 일
브랜드 마케팅요구가 또 다르다고만 말하고 넘어간다

여행 에이전트에 붙는 단서가 있다. 개인에 맞춘 경험은 개인 자료를 요구하고, 그만큼 *PII를 흘리지 않을 책임이 따라온다. 사내 챗봇 쪽은 붙는 자리가 여럿이라는 점을 짚는다. 슬랙에 붙을 수도 있고 따로 만든 앱에 붙을 수도 있으며, 자료도 여기저기 흩어져 있다는 것이다.

3. 매 단계가 데이터다

여행 에이전트로 돌아와 어디까지가 데이터인지 넓힌다. 시스템 프롬프트도 데이터고 사용자가 던진 물음도 데이터다. 상황에 따라 골라 쓰도록 프롬프트를 목록으로 두거나 틀로 만들어 둘 수도 있다고 말한다.

맥락도 더 이상 붙박이가 아니라고 말한다. 그때그때 여러 자료 서비스에서 온다는 것이다. 모델을 손질해 쓰려면 회사를 대신하는 자료가 거기서 또 필요하다.

그래서 못 박는 한 줄이 이렇다. 쓸 만한 답이 나오기까지 모든 단계에 데이터가 들어간다.

4. 여기부터 제품 이름이다

문제를 다 세운 뒤 답으로 자기 회사 플랫폼 하나를 든다. 그다음부터는 챗봇 하나를 예로 삼아 데이터가 지나는 자리마다 제품 이름을 붙인다.

챗봇 하나가 서기까지

자료를 손질한다영상도 글도 그림도 한 어귀로
지식 베이스에 넣는다잘라 두고 벡터로 바꿔 쌓는다
검색 어귀로 꺼낸다재정렬과 질의 쪼개기까지 딸려 온다
가드레일을 씌운다개인정보와 막을 말을 걸러 낸다
챗봇 하나를 만드는 순서로 그렸지만 칸마다 붙는 것은 전부 발표자 회사의 제품 이름이다. 직접 짜지 않아도 된다는 것이 매 칸의 주장이고, 다른 회사 것과 견준 대목은 없다.

*청킹 이야기는 조금 더 자세하다. 계층으로 자르는 방식과 뜻으로 자르는 방식이 이미 들어 있고, 그것으로 안 되면 자르는 규칙을 직접 짜 넣을 수 있다고 말한다. 임베딩 모델과 벡터 저장소도 고를 수 있고, 자료를 들이는 일과 바뀐 것만 덧붙이는 일은 따로 짜지 않아도 딸려 온다고 한다.

꺼내는 어귀는 둘이다. 하나는 닮은 것을 찾아 오는 쪽이고, 여기에 *하이브리드 검색을 값으로 넘길 수 있다. 다른 하나는 재정렬과 뒤처리와 질의 쪼개기까지 한 번에 하는 쪽이다. 직접 짜지 말고 값만 넘기라는 것이 이 대목 내내 반복되는 말이다.

가드레일 쪽은 개인정보와 막을 말을 걸러 내고, 자기 정책을 직접 세워 둘 수 있다고 말한다. 답을 근거에 묶어 지어내기를 줄이는 것도 여기서 한다. 걸린 것이 전부 기록으로 남아 사용자가 어떤 자리에서 걸리는지도 보인다고 덧붙인다.

5. 다 만든 것처럼 보이는데

여기까지 오면 챗봇이 다 선 것처럼 보인다고 스스로 말한다. 그러고서 진짜 이야기는 이제부터라고 한다.

먼저 청킹을 다시 든다. 어떻게 자르느냐가 나오는 답의 정확도를 정한다는 것이다. 그러면서 그것은 한 걸음일 뿐이고 다음이 최적화라고 말한다. 재정렬과 뜯기와 하이브리드 검색 말고도 질의를 다시 쓰거나 쪼개는 방법이 더 있다고 든다.

그다음에 청중에게 되묻는다. 무엇이 잘못됐는지도 모르면서 최적화할 수 있느냐는 것이다. 손을 들어 보라고 하고, 아무도 안 든다.

6. 순서를 앞뒤로 바꾼다

최적화가 걸린 세 갈래를 든다. 정확도와 값과 지연이고, 이 셋이 어떤 생성형 앱에서든 성능을 이루는 기둥이라고 말한다.

값과 지연을 함께 줄이는 방법으로 *시맨틱 캐시를 든다. 생성형 AI에서는 물음도 답도 똑같은 낱말로 되풀이되지 않으므로, 똑같은 물음이 아니라 닮은 물음이 앞서 있었는지를 찾는다. 있으면 모델을 다시 부르지 않아도 되니 값이 덜 들고, 새로 지어낼 시간이 빠지니 지연도 준다.

관측 이야기에서 말이 세진다. 예전에는 중요한 요소라고 말했는데 지금은 관측 없이 프로덕션은 물론 파일럿도 하지 말라고 한다는 것이다. 물음도 검색 결과도 답도 전부 남겨 두지 않으면, 문제가 들어와도 무엇이 잘못됐는지 찾을 길이 없기 때문이다.

평가를 앞에 두면

전부 남긴다물음도 검색 결과도 답도
검색부터 잰다쓸 만한지 여기서 나눈다
자료나 방식을 고친다오래된 자료면 답도 오래된다
자동으로 다시 돌린다손으로 다시 보지 않는다
고칠 때마다 이 길을 다시 지난다
발표에서 값을 하는 대목이다. 검색 결과가 쓸 만한지부터 재고 그다음에 모델로 넘긴다 — 나쁜 것을 앞에 놓고 값을 내 가며 나쁜 답을 받을 까닭이 없다는 것이다.

무엇을 재느냐도 앱마다 갈린다고 말한다. RAG면 *컨텍스트 관련성부터 보고, 요약하는 앱이면 요약에 맞는 지표를 쓴다. 재서 문제가 나오면 자료를 고치거나 방식을 고치는데, 자료가 오래돼서 답이 오래된 경우가 그 예다. 고친 뒤에는 다시 재야 하고, 그 재기가 손이 아니라 자동으로 돌아가는 틀 위에 있어야 한다고 말한다.

7. 발표가 밝히지 않은 것

잰 값이 하나도 없다. 정확도와 값과 지연을 세 기둥이라고 부르면서 퍼센트도 시간도 금액도 대지 않는다.

견준 상대가 없다. 자사 제품으로 짠 방식이 직접 짜는 것보다 얼마나 빠르고 싼지, 다른 회사 것과 어떻게 다른지가 나오지 않는다.

돌려 보인 것이 없다. 화면에 띄운 것은 코코넛 영상뿐이고, 이 순서로 지은 챗봇이 실제로 답하는 장면은 나오지 않는다.

청킹을 어떻게 고르는지가 없다. 자르는 방식이 정확도를 정한다고 못 박아 놓고, 어느 자료에 어느 방식이 맞는지 고르는 기준은 대지 않는다.

발표자가 자기를 밝히지 않는다. 이름도 소속도 자막에 없다. 제품을 「우리」라고 부르는 대목만 남아 있다.

시간이 모자라 다 못 다룬다고 스스로 말한다. 발표가 밝히는 한계는 이것 하나다.

용어

*PII
누구인지 알아볼 수 있는 개인 정보. 영어로 personally identifiable information
*청킹
문서를 찾아오기 좋은 크기로 미리 잘라 두는 일
*하이브리드 검색
뜻으로 닮은 것 찾기와 낱말이 든 것 찾기를 함께 돌려 결과를 합치는 방식
*시맨틱 캐시
똑같은 물음이 아니라 닮은 물음이 앞서 있었는지를 찾아 답을 되쓰는 저장고
*컨텍스트 관련성
찾아온 것이 물음에 실제로 맞는지를 재는 지표