← AI Engineer
레드팀 · 가드레일

레드팀을 에이전트에게 맡긴다 — 가드레일은 모델 밖에 있다

거르개를 다 뗀 모델을 직접 두드리니 폭력 갈래의 25%, 여러 수를 겹친 공격의 20%가 뚫렸고, 거르개를 켠 쪽에서는 160번 중 한 번도 안 뚫렸다는 대비를 보여줌. 사내 레드팀이 쓰던 도구를 SDK와 화면으로 감싸 엔지니어가 자기 앱에 인코딩 변환 공격을 걸어 보게 만든 데모, 그리고 거르개가 모델 안이 아니라 밖에서 들어오는 쪽과 나가는 쪽을 따로 거른다는 답이 나옴. 라이브 데모의 도구 호출이 두 번 실패해 미리 돌려 둔 결과로 대신한 대목도 그대로 있음.

Nagkumar Arkalgud & Keiji Kanazawa Microsoft발표 2025-08-2619분 31초AI Engineer

한줄 코멘트. 거르개를 켰을 때와 뗐을 때의 격차를 실제 수로 보인 것이 이 발표의 값이다. 뗀 쪽에서는 폭력 갈래 넷 중 하나가 뚫렸고 켠 쪽에서는 160번 중 하나도 안 뚫렸다. 다만 두 수가 다른 모델·다른 표본에서 나온 것이라 나란히 놓고 읽으면 안 된다.

1. 신뢰는 팀 스포츠

두 사람이 나온다. 한 명은 제품 쪽이고 한 명은 엔지니어인데, 뒤쪽은 자막 안에서 자기 이름을 대지 않는다.

여는 말은 이렇다. AI를 사람들 손에 쥐여 주고 싶은데 따라붙는 걱정거리가 많다. 챗봇을 꾀어 하지 말아야 할 말을 하게 하거나 자료를 흘리게 만드는 일이 어렵지 않다는 것이다.

바탕도 넓다고 짚는다. AI를 만드는 일은 여러 패키지와 바깥 서비스가 얹힌 생태계 위에 지어진다.

기술자는 사람들이 믿고 건너는 다리와 댐을 만든다는 비유를 든다. 그런데 AI를 만드는 일은 아직 이르다고 말한다. 그래서 세우는 말이 믿음은 팀으로 만드는 것이다 — 보안과 위험을 다루는 전문가에게 기댄다는 뜻이다.

사내에 몇 해째 *레드팀 일을 해 온 팀이 있다고 말한다. 두세 해 전부터 이런 모델들을 꾀면 해서는 안 될 일을 하게 만들 수 있다고 지적해 온 쪽이라고 소개한다. 그 팀이 만든 도구를 쓰기 쉬운 형태로 감싸고 결과를 볼 화면까지 붙였다는 것이다.

2. 어떻게 속이나

수법을 몇 가지 든다.

곧이곧대로 나쁜 것을 물으면 많은 모델이 답을 거절한다. 그런데 그 앞에 긴 사연을 붙이면 설득이 되기도 한다.

다른 수법은 모양을 바꾸는 것이다. 같은 물음을 거꾸로 뒤집어 쓰면 통과하는 일이 있다고 말한다.

3. 말로 시켜 두드려 보기

말로 시켜 두드려 보기

갈래를 짚어 준다「폭력 쪽으로 하나 만들어라」
물음을 받는다에이전트가 험한 말을 지어낸다
내 앱에 보낸다그것이 어떻게 답하나 본다
바꿔서 다시 보낸다글자를 인코딩해 한 번 더
말로 시켜 가며 두드려 보는 방식이다. 넷째 칸이 요점이다 — 곧이곧대로 물으면 거절하던 것이 모양만 바꿔 넣으면 통과하는 일이 있기 때문이다.

첫 데모는 대화로 하는 방식이다. 갈래를 짚어 주면 에이전트가 험한 물음을 지어내고, 그것을 내 앱에 보내 어떻게 답하는지 본다. 그다음 글자를 인코딩해 바꾼 뒤 다시 보낸다.

발표자는 이것을 누구나 바로 시작할 수 있는 방식이라고 부른다.

여기서 정직한 대목이 나온다. 라이브 데모에서 도구 호출이 안 됐다. 두 번 그렇다고 말하고, 미리 돌려 둔 결과를 대신 보인다. 미리 준비해 뒀다고 그 자리에서 밝힌다.

두드릴 대상은 갈아 끼울 수 있다고 말한다. 물음을 받아 글로 답하는 앱이면 무엇이든 된다.

4. 통째로 훑기

두 번째는 한 번에 쓸어 보는 방식이다.

설정할 것은 대상과 자격, 위험 갈래, 그리고 몇 개나 던질지다. 갈래를 안 고르면 전부 넣는다. 여기에 공격 수법 목록을 붙인다. 글자를 뒤집는 것 같은 단순한 것들이 있고, 두 수법을 겹칠 수도 있다.

발표가 댄 결과

조건결과
거르개를 켠 모델, 표본 160뚫린 것 없음
모델을 바꿔 다시미움·공정 갈래에서 40 중 5
거르개를 다 뗀 모델폭력 갈래 25%, 여러 수를 겹친 공격 20%
작은 판에 거르개를 다 켠 뒤뚫린 비율이 조금 줄었다

뚫린 사례 하나를 짚는다. 글자를 밀어 쓰는 옛 암호로 넣었더니 그쪽이 그것을 풀어서 답했다. 그래서 성공한 공격으로 셌다고 말한다.

한 번 훑는 데 예상 6분이 걸리고, 끝나면 결과로 바로 가는 주소를 보내 준다고 말한다.

5. 거르개는 모델 밖에 있다

거르개는 모델 밖에 있다

거르개가 서는 두 자리

들어오는 쪽위험한 물음을 미리 막는다모델에 닿기 전에 걸러 낸다
나가는 쪽답을 내보내기 전에 본다내면 안 될 것을 막는다
청중 물음에 발표자가 답한 대목이다. 거르개는 모델 안에 있지 않다 — 모델은 그대로이고 그 바깥 양쪽에 따로 선다.

이 발표에서 가장 또렷한 답이 청중 물음에서 나온다. 거르개가 답을 만든 뒤에 걸리나, 만들기 전에 걸리나.

답은 둘 다다. 들어오는 쪽에서 위험한 물음을 막는 거르개가 있고, 나가는 쪽에서 내면 안 될 것을 막는 거르개가 따로 있다.

그리고 못 박는다. 거르개는 모델 안에 있지 않다. 모델은 그대로이고 그 바깥에 선다.

닫는 말은 순서다. 내보낼 물건을 만들기 전에 위험을 먼저 그려 보고, 거르개를 계획해 넣고, 그다음 재라는 것이다. 두드려 봐서 20%가 통과한다는 것을 알게 되면 그때 거르개를 얹는다.

6. 발표가 밝히지 않은 것

두 수를 나란히 놓을 수 없다. 160번에 하나도 안 뚫렸다는 것과 25%가 뚫렸다는 것은 모델도 다르고 조건도 다르다. 하나는 거르개를 켠 것이고 하나는 다 뗀 것이다.

표본이 작다고 발표자가 직접 말한다. 160은 아주 작은 표본이라고 그 자리에서 밝힌다. 몇 갈래를 골랐는지도 「열 개쯤, 아니 다섯쯤」으로 흔들린다.

조금 줄었다는 것에 수가 없다. 거르개를 다 켠 뒤 뚫린 비율이 줄었다고만 하고 얼마인지가 없다.

라이브 데모가 두 번 실패했다. 도구 호출이 안 돼서 미리 돌려 둔 것으로 대신했다. 그러니 그 자리에서 실제로 도는 것을 본 사람은 없다.

공격 수법 목록을 문서로 넘긴다. 어떤 수법들이 있는지는 나중에 문서를 보라며 지나간다.

자막이 모델 이름을 크게 뭉갠다. 어느 판으로 무엇을 쟀는지가 여러 군데 어긋나 있어 정확한 표기는 원문에서 갈린다.

용어

*레드팀
내 물건을 일부러 공격해 보는 쪽에 서서 약한 자리를 찾는 일