앤트로픽이 1억 달러 넘는 보안 사업을 띄우며 「큰 도약」이라 했고 회의론자는 GPT-5.5와 같다고 했다. 공개 증거를 다 모으면 어느 쪽이 맞는지, 그리고 왜 두 진영이 서로 다른 것을 보고 있었는지를 벤치마크 값으로 확인한다.
Epoch AI Alexander Barry · Anson Ho · Jean-Stanislas Denain2026-06-11Gradient Updatesepoch.ai
▾
사이버 능력을 취약점 발견과 익스플로잇 개발로 갈라 보면 판정이 달라진다. 익스플로잇 개발에서 미소스 프리뷰는 2025년 초부터의 추세보다 약 7개월 앞섰고, 취약점 발견에서는 앞선 모델도 이미 잘하고 있었다.
핵심 포인트
두 능력을 갈라야 한다. 취약점 발견(vulnerability discovery)은 코드에서 약한 자리를 찾는 일이고, 익스플로잇 개발(exploit development)은 그 약점을 파고들어 원하는 코드를 실행시키는 일이다. 공격이 성립하려면 둘 다 있어야 한다.
공격에는 둘이 필요한데 판정은 둘이 다르다
왼쪽이 약점을 찾는 일, 오른쪽이 그 약점을 파고드는 일이다. 앤트로픽은 둘 다 도약했다고 했지만 공개 증거의 판정은 갈린다 — 파고드는 쪽은 추세보다 7개월 앞섰고, 찾는 쪽은 앞선 모델도 이미 잘했다. 구조는 Epoch AI 원문을 따랐다.
익스플로잇 개발은 도약이 맞다. 사이버 벤치마크 약 15개를 Epoch 역량지수(ECI) 방식으로 합친 Cyber-ECI에서 미소스 프리뷰가 추세보다 약 7개월 앞서 있다. GPT-5.5는 2~3개월이었다.
익스플로잇 개발은 추세보다 7개월 앞섰다
모델 공개일을 가로축에, 사이버 벤치마크 약 15개를 합친 Cyber-ECI를 세로축에 놓았다. 점선이 2025년 초부터 이어진 추세이고, 미소스 프리뷰 4월판이 그보다 6.8개월(90% 구간 3.4~12.6) 위에 있다. GPT-5.5는 2.5개월(0.7~5.2)이었다. 초기 판본이 3.0개월(1.6~5.1)로 GPT-5.5에 가까운 것이 회의론이 나온 까닭 하나다. 값은 Epoch AI 원문 도해(CC-BY)를 따랐다.
회의론이 나온 이유가 둘 있다. 미소스 프리뷰가 내부 체크포인트인 「초기」판과 훨씬 강한 「4월」판으로 갈리는데 초기 판본 평가가 GPT-5.5와 거의 같았고, 초기 비교에 쓴 벤치마크 다수가 이미 만점에 가까워 차이가 안 보였다.
덜 포화된 자에서는 차이가 보인다. CyScenarioBench에서 미소스 5가 36.7%, 미소스 프리뷰가 29.2%, GPT-5.5가 26%, 오푸스 4.8이 16.6%다. GPT-5.2·5.3과 뮤즈 스파크, 제미나이 3 프로는 0%다.
포화되지 않은 자에서는 차이가 그대로 보인다
Irregular가 만든 CyScenarioBench는 종단 과제를 끝까지 해낸 비율로 매긴다. 아래 세 모델이 0%라 바닥이 안 닫혀 있고, 그래서 위쪽 차이도 눌리지 않는다. 초기 비교에 쓰인 벤치마크들이 만점에 가까웠던 것과 대비된다. 값은 Epoch AI 원문 부록을 따랐다.
취약점 발견에는 잴 자가 없다. 소스코드에서 취약점을 찾는 능력을 재는, 포화되지 않은 벤치마크가 아예 없다. 그래서 실제로 찾아낸 취약점 수를 대신 본다.
찾아낸 수는 급증했다. 프로젝트 글래스윙에 참여한 21개 조직의 고위험·치명 CVE가 2025년 기준선 대비 4월에 142%, 5월에 262% 늘었다. 미소스 프리뷰 공개 시점과 겹친다.
찾아낸 취약점은 급증했지만 원인은 둘이다
21개 조직이 공개한 고위험·치명 CVE를 달마다 센 것이다. 고위험은 2025년 9월 371건까지 꿈틀대다가 2026년 3월 381건에서 5월 900건으로 두 달 만에 2.4배가 됐고, 치명도 55 → 96 → 141건으로 뛰었다. 세로 점선이 미소스 프리뷰 공개 시점이다. 다만 프로젝트 글래스윙에 최대 1억 달러어치 API 크레딧이 붙어 있어, 이 그림은 능력 때문인지 돈 때문인지를 구분하지 못한다. 값은 Epoch AI 원문 도해(CC-BY)를 따랐다.
그런데 능력 때문인지 돈 때문인지 모른다. 프로젝트 글래스윙에는 최대 1억 달러어치 API 크레딧이 붙어 있다. curl은 미소스 프리뷰에서 저심각도 취약점 한 건과 오탐 네 건을 얻었고, 유지관리자는 이전 도구보다 나은 증거를 못 봤다고 적었다.
실무 이득은 오탐이 적다는 데 있다. 익스플로잇을 잘 만들기 때문에 「이게 진짜 취약점인가」를 스스로 확인할 수 있고, 심각도 판정도 앞선 모델보다 낫다. 사람이 검토할 시간이 줄어든다.
주요 숫자
7개월 vs 2~3개월
추세 대비 미소스 프리뷰 · GPT-5.5
36.7% vs 26%
CyScenarioBench 미소스 5 · GPT-5.5
142% · 262%
4월 · 5월 CVE 증가(2025년 기준선 대비)
1건 · 4건
curl에서 찾은 취약점 · 오탐
"the Mythos family's cyber capabilities aren't just 'hype'." (미소스 계열의 사이버 능력은 그저 과장이 아니다)
반론 · 충돌
curl 사례는 이 글의 결론과 정면으로 부딪친다가장 많이 감사받은 코드베이스에서 미소스 프리뷰가 얻은 것은 저심각도 한 건과 오탐 네 건이다. 유지관리자는 이전 도구보다 나은 증거를 못 봤다고 적었다. 필자들도 이것을 「앞선 AI가 이미 찾을 것을 다 찾았다」는 신호로 읽는다.
CVE 급증은 능력과 예산을 못 나눈다같은 그림이 「모델이 좋아졌다」와 「돈을 많이 썼다」 둘 다와 들어맞는다. 고정 예산에서 얼마나 나아졌는지는 이 글의 어느 증거로도 나오지 않는다.
같은 대시보드의 허깅페이스 사고 편과 겹쳐 읽어야 한다이 글은 「능력이 도약했나」를 따지고, 사고 편은 「그 능력이 실제로 무엇을 했나」를 기록한다. 사고 편에서는 오픈웨이트가 아직 4~7개월 뒤에 있다는 것이 통제 조건으로 나오는데, 이 글은 그 조건이 언제까지 갈지는 다루지 않는다.
Epoch AI의 공개 리서치 글(Gradient Updates)을 요약한 카드입니다. 원문 전문을 다시 싣지 않습니다. 도해는 원문 그림(CC-BY, Epoch AI)의 구조와 값을 그대로 두고 한국어로 다시 그린 것입니다. 숫자는 필자가 공시·보도를 인용해 적은 것을 옮겼고 우리가 따로 검증하지 않았습니다. 투자 추천이 아닙니다.