happy_various AI 실전 기록

2026년 10월 6일 기준

이 글에는 제휴 링크가 없고 OpenAI·앤트로픽·구글과 아무 관계가 없습니다. 내용은 OpenAI(2026-09-30)·앤트로픽(2026-02-23, 2026-09-10)·구글(2026-02-13) 공식 발표 기준이며, 지목된 회사와 수치는 각 회사의 발표일 뿐 제3자가 검증한 내용이 아닙니다. 공격 방법은 큰 흐름만 적었습니다. 삽화는 GPT 이미지 생성, 도식은 직접 제작했습니다.

적대적 증류란 — OpenAI·앤트로픽이 막은 ‘AI 풀이 과정 빼내기’, AI API 쓰는 조직이 점검할 것

유명 일타강사의 수업을 떠올려 볼게요. 같은 학원이 그 강사의 강의를 바탕으로 짧은 ‘요약 강좌’를 따로 만드는 건 흔한 일이에요. 그런데 다른 학원이 가짜 이름으로 수강생 수천 명을 등록시켜, 강사가 칠판에 쓰는 답과 풀이 과정을 통째로 받아 적은 뒤 자기 학원 교재로 쓴다면 이야기가 달라지죠.

AI에서는 앞의 것을 증류(distillation), 뒤의 것을 적대적 증류라고 불러요. 2026년 9월 30일 OpenAI가 자사 모델의 ‘보호된 추론’을 빼내려던 조직적인 활동을 적발해 막았다고 발표했고, 앤트로픽도 9월 10일 위협 보고서에서 중국 기반 AI 연구소 7곳의 증류 공격을 적발·차단했다고 밝혔어요.

⚠️ 이 글은 OpenAI ‘조직적인 모델 증류 활동 차단’(2026-09-30), 앤트로픽 위협 보고서 ‘Detecting and countering misuse of AI: September 2026’(2026-09-10)과 ‘Detecting and preventing distillation attacks’(2026-02-23), 구글 위협 인텔리전스 그룹(GTIG) 보고서(2026-02-13)를 옮긴 것입니다. 지목된 회사와 수치는 각 회사의 발표이고 제3자가 검증한 내용이 아니며, 지목된 회사들의 입장은 이 글에서 확인하지 않았어요. 공격 방법은 큰 흐름만 적고 구체적인 수법은 옮기지 않았습니다.

칠판에 문제를 푸는 로봇 선생님과, 선글라스·가짜 수염으로 변장하고 몰래 받아 적는 똑같은 학생들 (GPT 이미지 생성)

결론 요약

🎓 1. ‘증류’가 뭔가 — 선생 모델과 학생 모델

증류 자체는 정상적인 학습 방법이에요. 앤트로픽은 이렇게 설명해요. 더 크고 뛰어난 ‘선생’ 모델에게 여러 질문의 답을 만들게 하고, 그 문답으로 더 작은 ‘학생’ 모델이 선생을 흉내 내도록 훈련한다고요. AI 회사들도 자기 모델을 증류해 더 작고 저렴한 버전을 만들고, 구글은 클라우드에서 증류 기능을 상품으로도 제공해요.

문제는 허락 없이 남의 모델을 선생으로 쓰는 것이에요. 세 회사가 쓰는 말은 조금씩 달라요.

세 회사 모두 이런 무단 증류를 이용 약관 위반으로 봐요.

왜 하필 ‘추론’을 노리나

요즘 AI는 답을 내기 전에 속으로 풀이 과정을 거쳐요. OpenAI는 이를 보호된 추론이라고 부르며 “모델이 작업을 수행하는 과정의 내부 기록”이라고 설명해요. 이걸 빼내면 최종 답에서 빠진 정보가 드러날 수 있고, 다른 곳이 그 모델의 능력을 재현하는 데 도움이 된대요. 그래서 회사들은 풀이 과정을 그대로 보여 주지 않고 요약하거나 암호화해서 다뤄요. 학원 비유로 치면 칠판의 답보다 강사의 ‘풀이 노트’가 더 탐나는 셈이에요.

걱정하는 이유도 같아요. OpenAI는 추출된 추론이 원래 모델의 안전장치 없이 다른 모델을 학습시키는 데 쓰일 수 있다고 했고, 앤트로픽도 무단으로 증류된 모델에는 Claude의 오남용 방지 장치가 따라가지 않는다고 했어요.

가짜 계정에서 대량 질문, 답·추론 수집, 학생 모델 학습으로 이어지는 흐름과 회사들이 막은 지점, 그리고 우리 조직이 볼 곳 (직접 제작)

🔎 2. OpenAI가 막은 것 — 9월 30일 발표

OpenAI 발표에 나온 흐름을 날짜순으로 옮기면 이래요.

무엇을 했나 — OpenAI는 공격자들이 암호화를 해독하거나 데이터베이스를 침해한 게 아니고, 저장된 사용자 대화에 직접 접근한 것도 아니라고 밝혔어요. 대신 모델과의 대화를 조작해 감춰진 추론이 요청자에게 보이는 형태로 다시 나오게 했다고 해요. 이런 조작은 OpenAI 모델만의 약점이 아니라서, 프런티어 모델 포럼(주요 AI 회사들이 만든 업계 협의체)을 통해 업계와 정보를 나눴대요. 독립 보안 연구자들이 책임 있는 공개 절차로 제보한 관련 취약점도 확인해 대응에 반영했다고 해요.

누구였나 — OpenAI는 관측된 공격자가 모두 한 주체인지는 불분명하다고 하면서도, 핵심 활동 집단을 Kimi 개발사 Moonshot AI와 연관된 개인들로 판단했어요.

어떻게 막았나

OpenAI는 남은 과제로 파트너가 호스팅하는 환경에도 같은 보호 조치를 넣는 것, 눈에 보이는 일반 텍스트 밖의 내용까지 검사하는 것을 꼽았어요.

🕵️ 3. 앤트로픽이 밝힌 것 — 2월과 9월

2월 23일 첫 공개 — 앤트로픽은 DeepSeek·Moonshot·MiniMax 세 곳이 약 2만 4,000개의 부정 계정으로 Claude와 1,600만 건이 넘는 대화를 주고받으며 능력을 빼냈다고 발표했어요. 이들이 쓴 중계 서비스는 계정 하나가 막히면 다른 계정이 자리를 채우는 구조였고, 한 중계 네트워크는 2만 개가 넘는 부정 계정을 동시에 굴리며 증류용 요청을 일반 고객 요청과 섞었대요.

9월 10일 위협 보고서 — 2월 이후 중국 기반 연구소 7곳의 증류 공격을 추가로 적발·차단했다고 밝혔어요. 모두 일반에 공개된 모델을 노렸고, 앤트로픽은 이를 특정 연구소의 소행으로 ‘높은 확신’을 갖고 판단했다고 했어요. 보고서가 지목한 곳은 이래요.

앤트로픽이 지목한 곳발표 내용 요약관측 규모
알리바바(Qwen)Opus의 풀이 과정을 겨냥, 모은 기록을 Qwen 모델 학습에 사용5월부터 7월까지 1억 5,100만 건 이상. 하루 최대 300만 건 가까이
문샷 AI(Kimi)고객 요청 일부를 알리지 않고 Claude로 넘기고, 그 기록에서 추론을 뽑아 학습에 사용5월부터 7월까지 2,300만 건 이상
딥시크문샷과 비슷한 방식으로 고객 요청을 Claude로 넘기고 추론을 빼냄7월 중 14일간 1,210만 건 이상
즈푸(Z.ai)부정 계정 273개를 돌려 추론을 모으고 학습용으로 정제6·7월 중 17일간 340만 건 이상
샤오미자사 모델 사용자의 대화를 Claude에 다시 돌려 학습 데이터 생성3·4월 중 20일간 40만 건 이상
센스타임제3자 데이터 판매자에게서 Claude 대화 기록을 사들임규모 미공개
미니맥스관계를 숨긴 회사를 통해 자체 중계 서비스를 운영규모 미공개

돋보기를 든 경비 로봇이 변장한 사람들의 줄을 막고, 사원증을 단 고객은 초록 통로로 지나가는 모습 (GPT 이미지 생성)

통로는 ‘중계소’와 도난 키 — 앤트로픽에 따르면 이 연구소들은 주로 ‘중계소’(transfer stations)라 불리는 프록시 서비스를 거쳐 Claude에 접속했어요. 이 서비스들은 지역 제한을 피하려고 가짜 신원, 가짜·도난 신용카드, 도난 API 키로 새 계정을 수천 개씩 만들고, 정상 회사나 개인에게서 훔친 API 자격 증명을 쓰는 경우도 많았대요. 앤트로픽은 이런 부정행위가 정상 고객에게 피해를 준다고 적었어요.

사용자 데이터도 문제 — 중계 서비스는 사용자 몰래 대화를 저장해 다른 연구소에 팔기도 했고, 일부 연구소는 자기 서비스 사용자의 요청을 알리지 않고 Claude로 넘겼대요. 그렇게 넘어간 대화에는 이름, 이메일 주소, 회사 데이터, 실제로 쓰이는 접속 비밀번호 같은 민감한 정보가 들어 있었다고 해요.

어떻게 막았나

🌐 4. 구글도 먼저 겪었다 — 2월 보고서

구글 위협 인텔리전스 그룹(GTIG)은 2월 13일 보고서에서 Gemini를 노린 모델 추출 시도가 늘었다고 밝혔어요. 한 사례에서는 10만 건이 넘는 프롬프트로 Gemini가 평소에는 요약해서 내놓는 추론 과정을 통째로 내놓게 하려 했는데, 구글 시스템이 실시간으로 알아채 위험을 낮췄대요. 정부 배후 해킹 조직(APT)이 프런티어 모델을 직접 공격한 사례는 관측하지 못했고, 전 세계 민간 기업과 연구자들의 추출 시도를 자주 막았다고 했어요. 앤트로픽 9월 보고서도 구글의 이 보고서와 OpenAI의 문제 제기를 함께 언급했어요.

구글 보고서에는 눈여겨볼 문장이 두 개 있어요.

🛡️ 5. AI API를 쓰는 조직이 점검할 것

세 회사의 발표에서 우리 같은 ‘이용하는 쪽’이 챙길 만한 부분을 골라 점검표로 묶었어요. 회사들이 낸 공식 체크리스트가 아니라, 발표 내용을 바탕으로 이 글이 정리한 거예요.

황금 열쇠를 목에 건 직원이 사용량 그래프의 작은 급증을 확인하고, 옆에 체크리스트가 놓인 모습 (GPT 이미지 생성)

🔑 API 키 — 사원증처럼 관리

앤트로픽 보고서에서 가장 마음에 걸리는 대목은 ‘정상 회사의 도난 API 키’가 공격 통로로 쓰였다는 점이에요. 우리 회사 키가 남의 증류 공격에 쓰일 수도 있다는 뜻이니까요.

컴퓨터 설정에 남아 있던 옛 키가 엉뚱하게 쓰인 경험담은 LLM 중계기 개발기의 ‘서랍 속 옛 열쇠’ 편에 있어요.

📈 사용량 — 평소와 다른 급증에 알림

증류 공격을 가려내는 단서는 ‘패턴’이었어요. 앤트로픽은 좁은 능력에 몰린 엄청난 양, 아주 반복적인 구조를 특징으로 꼽았고, 구글은 API 접근을 모니터링하라고 했어요. 우리 쪽에서는 이렇게 볼 수 있어요.

📜 경로·약관 — 공식 경로로, 쓰임은 확인하고

🎯 6. 무슨 뜻인가 — 도입·교육 관점

이번 발표들에서 눈에 띄는 건 공격 기술보다 통로예요. 가짜 계정, 도난 카드, 그리고 정상 회사에서 새어 나간 API 키와 대화를 몰래 저장하는 중계 서비스. 모두 AI를 ‘쓰는 쪽’의 관리와 맞닿아 있어요.

그래서 저는 이번 일로 AI 도입 교육에 API 보안 항목을 기본으로 넣어야 할 이유가 또렷해졌다고 봐요. 지금까지 도입 교육은 프롬프트 잘 쓰는 법과 업무 활용 사례가 중심이었죠. 여기에 ‘키는 누가 어디에 두는가, 사용량은 누가 보는가, 출력물은 어디까지 써도 되는가’ 세 가지를 첫 시간부터 같이 다루면 좋겠어요. 모델 회사들이 계정 인증과 신원 확인을 계속 강화하고 있으니, 정상 고객도 그 흐름에 맞춰 준비해 둘수록 덜 당황할 거예요.

비슷한 흐름은 AI 3사가 해킹 능력 모델을 내놓으며 문을 잠근 이야기에서도 봤어요. 강력한 모델일수록 ‘누가 쓰는지’를 확인하는 쪽으로 가고 있어요.

한 줄 정리

적대적 증류는 가짜·도난 계정으로 남의 AI가 내놓는 답과 풀이 과정을 대량으로 받아 적어 내 모델을 키우는 무단 행위예요. OpenAI와 앤트로픽은 계정 차단, 추론 보호, 업계 정보 공유로 막았다고 밝혔고, AI API를 쓰는 조직에는 키·사용량·약관 점검이라는 숙제가 남았어요.


2026년 10월 6일 기준입니다. OpenAI ‘조직적인 모델 증류 활동 차단’(2026-09-30), 앤트로픽 ‘Detecting and countering misuse of AI: September 2026’(2026-09-10)과 ‘Detecting and preventing distillation attacks’(2026-02-23), 구글 GTIG ‘AI Threat Tracker: Distillation, Experimentation, and (Continued) Integration of AI for Adversarial Use’(2026-02-13)에서 옮겼습니다. 지목된 회사와 수치는 각 회사의 발표이며, 지목된 회사들의 입장은 확인하지 않았습니다. 이 글은 법률 판단이 아니며, 약관 해석이 필요하면 해당 서비스의 공식 약관과 전문가 검토를 확인하세요.