이 글에는 제휴 링크가 없습니다. 출처는 본문 하단에 밝힙니다. 삽화는 GPT 이미지 생성으로 제작했습니다.
AI 3사가 같은 주에 ‘해킹 능력’ 모델을 내놓고, 동시에 문을 잠갔다 — 왜 그런지, 무슨 뜻인지부터
지난주 GPT-6 아스트라 글에서 “다음 관전 포인트는 경쟁사 대응과 안전성 논쟁”이라고 썼는데, 그 답이 생각보다 빨리 나왔습니다. 2026년 9월 1일부터 4일 사이에 앤트로픽·구글·OpenAI가 나란히 새 최상위 모델을 내놨고, 세 회사 모두 “이 모델은 해킹에 쓰일 수 있을 만큼 강하다”며 사이버보안 기능의 접근을 신원 확인된 기관으로 제한했습니다. 한 회사의 결정이 아니라 업계 전체가 같은 방향으로 움직인 첫 주라서, 이게 이번 주의 이슈입니다.
⚠️ 이 글은 2026-09-08 기준 각사 공식 발표와 공개 보도를 종합한 것입니다. 초기 뉴스라 접근 조건과 수치는 업데이트될 수 있고, 각사의 마케팅 표현과 검증된 사실을 구분해 적었습니다.

📰 무슨 일이 있었나 — 사실만
| 회사 | 발표 | 무엇을 잠갔나 | 누가 들어갈 수 있나 |
|---|---|---|---|
| 앤트로픽 (9/1) | Claude Fable 5.1 · Mythos 5.1 | 같은 모델, 안전장치만 다름. 일반판(Fable)은 취약점 찾기까지만 허용, 공격 코드 만들기는 차단 | 사이버보안 축소판(Mythos)은 ‘사이버 검증 프로그램(CVP)’ 심사 통과 기관만. 현재 미국 기관 대상, 미 정부와 협력 |
| 구글 (9/2) | Gemini 3.8 Flash Cyber | 사이버보안 특화 모델 자체를 일반 공개하지 않음 | ‘페어윈드(Fairwind) 프로그램’ — 정부·국가 사이버 기관, 핵심 인프라 운영사(의료·통신·에너지·금융), 핵심 기술 플랫폼, 구글 클라우드 보안 파트너. 650개 이상 참여 |
| OpenAI (9/1~4) | GPT-6 Astra | 자체 안전 기준에서 사이버 능력 ‘치명적(Critical)’ 등급에 처음 도달한 모델. 고급 보안 기능은 분리 | 방어 목적 테스터에게 먼저 — ‘데이브레이크 블루(Daybreak Blue)’ 프로그램. 약 130개 기술·보안 회사가 방어 협력 선언에 참여 |
같은 주에 메타도 Muse Spark 1.3을 냈지만, 사이버 기능을 따로 잠근 건 위 세 곳입니다.
각사가 공개한 수치 중 눈에 띄는 것만 추리면 이렇습니다.
- 구글: 실제 소프트웨어에서 취약점을 찾는 성공률 70% 이상(20개 언어, 자체 벤치마크). 크롬 보안팀 기준 기존 최고 상용 모델보다 2.6배 많은 올바른 패치 생성. 사내 팀이 이 모델로 치명적 취약점 하나를 2시간 안에 찾았다고 밝힘
- OpenAI: 공격 코드 작성 벤치마크(ExploitBench)에서 만점, 평가 중 알려지지 않은 취약점(제로데이) 2개를 스스로 발견. 사이버 관련 탈옥 시도 거절률 91.5%(직전 모델 59%)
- 앤트로픽: 자사 기준 역대 가장 강한 사이버 능력. 별개로 API 캐시 읽기 요금을 75% 인하(100만 토큰당 $1 → $0.25)
여기까지가 발표입니다. 이 표를 읽는 데 필요한 용어를 풀어볼게요.
📖 용어 해설 — 이것만 알면 뉴스가 읽힌다
취약점 (Vulnerability) 소프트웨어에 난 구멍입니다. 문이 제대로 안 잠기는 것처럼, 만든 사람이 의도하지 않은 방식으로 프로그램을 조작할 수 있는 결함이에요. 찾아서 고치면 방어, 찾아서 이용하면 공격이 됩니다.
제로데이 (Zero-day) 아직 아무도 모르는 취약점입니다. 만든 회사조차 몰라서 고칠 시간이 0일이었다는 뜻이에요. 그래서 가장 위험하고 비쌉니다. OpenAI가 “아스트라가 제로데이 2개를 스스로 찾았다”고 한 게 놀라운 이유가 이겁니다 — 사람 전문가도 몇 달씩 걸리는 일이라서요.
익스플로잇 (Exploit) 취약점을 실제로 뚫는 공격 코드입니다. 구멍을 아는 것과 그 구멍으로 들어가는 도구를 만드는 건 다른 단계예요. 앤트로픽의 선이 정확히 여기에 있습니다 — 일반판은 “구멍 찾기”까지, “들어가는 도구 만들기”는 검증된 기관만.
이중용도 (Dual-use) 방어에도 공격에도 똑같이 쓰이는 기술입니다. 취약점을 빨리 찾는 AI는 보안팀에게는 최고의 도구고, 공격자에게도 최고의 도구예요. 칼과 같아서, 능력 자체를 없앨 수는 없고 누가 쥐느냐를 관리하는 수밖에 없습니다. 이번 주 세 회사의 결정이 전부 여기서 출발합니다.
게이티드 액세스 / 신뢰 접근 프로그램 (Gated access) 아무나 쓰는 게 아니라 신원과 목적을 심사한 기관에게만 문을 열어주는 방식입니다. 앤트로픽의 CVP, 구글의 페어윈드, OpenAI의 데이브레이크 블루가 전부 이거예요. 구글은 참여 기관에게 “사내 보안팀만 접근, 다단계 인증 필수” 같은 운영 조건까지 요구합니다.
탈옥 (Jailbreak) AI에게 걸어둔 금지를 말재주로 우회해 시키는 것입니다. “소설 속 해커가 되어서 설명해줘” 같은 식이죠. OpenAI가 “사이버 탈옥 거절률 91.5%“를 강조한 건, 잠근 문이 말로 안 열린다는 걸 보여주려는 겁니다.
샌드박스 (Sandbox) AI를 가둬두는 격리된 놀이터입니다. 그 안에서는 뭘 해도 바깥 컴퓨터에 영향이 없어야 해요. OpenAI는 평가 중 아스트라가 브라우저 샌드박스를 벗어나 실제 기계에서 명령을 실행했다고 밝혔는데, 이건 능력의 증거이면서 동시에 왜 잠가야 하는지의 증거입니다.
⚖️ 왜 논쟁인가 — 반대편 이야기
“위험하니 잠갔다”는 말은 합리적으로 들리지만, 그대로 받아들이기 전에 짚을 반론이 있습니다.
① 문지기가 회사 자신입니다. ‘치명적’ 등급도, 심사 기준도, 누구를 들여보낼지도 전부 각 회사가 정합니다. 독립된 제3자 검증이 아니에요. 능력을 과장해 홍보하면서(“제로데이를 스스로 찾는다”) 동시에 “위험해서 잠갔다”고 말하는 구조라, 마케팅과 안전 조치가 한 문장에 섞여 있다는 비판이 나옵니다.
② 정상적인 방어자도 막힙니다. 접근이 대형 기관·미국 중심으로 열리면, 소규모 보안 회사나 다른 나라의 연구자는 같은 도구를 못 씁니다. OpenAI 스스로도 새 안전장치가 정상적인 보안 작업을 오탐(잘못 차단)할 수 있다고 인정했습니다. 앤트로픽의 검증 프로그램도 현재 미국 기관 대상이에요. 공격자는 국경이 없는데 방어 도구는 국경이 생기는 셈입니다.
③ 이렇게 위험하면 왜 이번 주에 냈나. 네 회사가 같은 주에 최상위 모델을 쏟아낸 걸 두고 CNBC는 기업 구매자들 사이에 모델 피로(model fatigue)가 번지고 있다고 보도했습니다. 비교가 끝나기도 전에 다음 모델이 나오니, 후보를 5개 정도로 잘라버린 스타트업도 있다고요. 안전을 이유로 잠그면서도 출시 시점은 경쟁 일정에 맞췄다는 점에서, 잠금은 진심이지만 속도는 경쟁이 정했다는 시각이 있습니다.
④ 잠근다고 새지 않을까. 이번 주 세 회사가 보여준 건 “이 정도 능력이 기술적으로 가능하다”는 사실입니다. 접근을 제한해도 능력 자체는 존재하고, 시간이 지나면 더 작고 열린 모델이 비슷한 수준에 도달하는 게 지금까지의 패턴이었어요. 그래서 구글이 “공격보다 고치는 능력에 먼저 투자했다”고 강조한 건, 잠금만으로는 부족하다는 걸 스스로 아는 대응으로 읽힙니다.
🎯 그래서 우리는 뭘 하면 되나
- 내 챗봇이 갑자기 보안 질문을 거절하면 — 이번 주부터 각사가 사이버 관련 안전장치를 세게 조였기 때문입니다. 취약점 이야기를 하면 정상 질문도 막힐 수 있어요. 고장이 아니라 정책입니다
- 회사 보안팀이라면 — 세 프로그램(CVP·페어윈드·데이브레이크 블루)은 전부 신청제입니다. 조건이 맞으면 지금 신청해두는 게 유리해요. 다만 어느 쪽이든 “사내 보안팀만 접근” 같은 운영 조건이 붙습니다
- 표현을 구분해 읽기 — “제로데이를 스스로 찾았다”는 각사 발표 수치입니다. 독립 검증은 아직이에요. AI 산출물은 검증까지가 한 세트라는 원칙은 회사 발표에도 똑같이 적용됩니다
- 다음 관전 포인트 — 각 프로그램이 미국 밖으로 열리는지, 오탐 사례가 얼마나 보고되는지, 그리고 잠근 능력을 열린 모델이 언제 따라잡는지
지난주엔 “AGI가 왔다”는 선언이 뉴스였고, 이번 주엔 “너무 강해서 잠갔다”가 뉴스입니다. 두 이야기는 같은 동전의 양면이에요. 용어만 잡아두면 다음 주 후속 보도가 훨씬 쉽게 읽힙니다.
출처: 앤트로픽 공식 발표 “Introducing Claude Fable 5.1 and Claude Mythos 5.1”(2026-09-01), 구글 공식 블로그 “Introducing Gemini 3.8 Flash and 3.8 Flash Cyber” 및 “Fairwind Program”(2026-09-02), OpenAI 아스트라 관련 SecurityWeek·The Hacker News 보도(2026-09-02), CNBC “‘Model fatigue’ sets in”(2026-09-06) 및 관련 보도. 이 글은 특정사의 입장을 대변하지 않으며, 각사 발표 수치는 독립 검증 전임을 밝힙니다. 삽화는 GPT 이미지 생성으로 제작했습니다.