happy_various AI 실전 기록

2026년 9월 25일 기준

이 글에는 제휴 링크가 없습니다. 성능·가격 수치는 앤트로픽 공식 발표(2026-09-22) 기준이며 독립 검증 전입니다. 삽화는 GPT 이미지 생성, 차트는 직접 제작했습니다.

Claude Opus 5.5 출시 — Fable 5.1급 성능을 60% 싼 값에? 벤치마크로 본 이전 버전·경쟁 모델과의 차이

휴대폰을 살 때 흔히 이런 일이 있습니다. 올해 나온 일반 모델이 작년 최고급 모델만큼 빠른데, 값은 훨씬 싸요. 그러면 고민이 시작됩니다. “비싼 거 살 이유가 남았나?”

2026년 9월 22일 앤트로픽이 내놓은 Claude Opus 5.5가 딱 그 모양입니다. 회사의 한 줄 설명은 이렇습니다. “대부분의 작업에서 Claude Fable 5.1 수준으로 작동하고, 운영 비용은 Opus 5보다 40% 적다.” Fable 5.1은 3주 전인 9월 1일에 나온, 일반 사용자가 쓸 수 있는 앤트로픽 최상위 모델이에요. 그보다 아래 등급 이름을 단 모델이 성능표에서 Fable 5.1을 앞섰다는 게 이번 발표의 핵심입니다.

⚠️ 이 글의 성능·가격 수치는 2026-09-25 기준 앤트로픽 공식 발표를 옮긴 것입니다. 회사가 직접 잰 값이라 독립 검증 전이고, 모델마다 측정 설정이 다른 항목은 따로 표시했습니다.

두 휴대폰을 들고 놀라는 로봇 — 비싼 모델과 새 모델의 칩이 똑같이 빛난다 (GPT 이미지 생성)

결론 요약

📊 1. 성능 지표 — 공식 표 그대로

앤트로픽 발표문에 실린 표입니다. 네 모델이 모두 점수를 가진 다섯 개 항목을 먼저 그림으로 보면 이렇습니다.

Opus 5.5·Fable 5.1·Opus 5·GPT-6 Astra의 벤치마크 5개 점수 비교 막대 (직접 제작)

전체 표는 이렇습니다. 칸이 비어 있는 곳은 발표문에도 값이 없는 곳이에요.

벤치마크무엇을 재나Opus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
Terminal-Bench 4.0터미널에서 일하는 에이전트 코딩66.4%55.8%52.3%57.9%37.3%
FrontierCode v1.1 (Main)어려운 코딩 과제54.4%50.3%48.0%53.3%47.5%
CursorBench 4.0코딩 도구 Cursor 안의 작업57.8%51.8%46.6%—41.7%
GDPval-AA v2.144개 직업의 실무 (Elo 점수)18461735170815421588
AutomationBench업무 자동화 (Zapier 측정)40.0%31.4%26.9%41.4%28.8%
Humanity’s Last Exam고난도 지식 문제 (도구 사용)67.7%65.6%63.6%57.2%—
Terminal-Bench-Science 0.1과학 연구 작업58.7%52.6%29.0%64.6%22.4%
OSWorld 2.0 (partial)컴퓨터 화면 조작81.8%80.7%74.0%——
Chartography차트 읽기 (도구 사용)89.0%88.4%83.4%——

표를 읽을 때 알아둘 각주 세 가지입니다.

🔁 2. 이전 버전 Opus 5와 무엇이 달라졌나

항목Opus 5Opus 5.5변화
입력 토큰 (100만 개당)$5$420% ↓
출력 토큰 (100만 개당)$25$2020% ↓
캐시 읽기 (100만 개당)$0.50$0.2060% ↓
캐시 쓰기 (100만 개당)$6.25$520% ↓
출력 속도—Opus 5보다 30% 이상 빠름
일반적인 작업 비용—약 40% 감소 (앤트로픽 추산)

성능은 표의 9개 항목이 전부 올랐는데, 오름폭이 고르지 않습니다. 가장 크게 뛴 건 과학 연구 작업(Terminal-Bench-Science)으로 29.0%에서 58.7%로 두 배가 됐어요. 에이전트 코딩(Terminal-Bench 4.0)은 14.1점, 업무 자동화(AutomationBench)는 13.1점, Cursor 작업은 11.2점 올랐습니다. 반면 차트 읽기(+5.6점)나 고난도 지식 문제(+4.1점)는 오름폭이 작습니다. 코딩과 ‘일을 끝까지 해내는’ 에이전트 작업 쪽이 크게 좋아진 세대라고 읽을 수 있어요.

빠른 응답이 필요한 경우를 위한 Fast 모드도 있습니다. Claude Code와 Claude Platform에서 최대 2.5배 속도로 쓸 수 있고, 값은 입력 $8·출력 $40으로 두 배예요.

⚖️ 3. Fable 5.1과의 비교 — 윗급 모델을 넘었나

Fable 5.1은 앤트로픽 설명으로 “미토스(Mythos)급 모델”이고, 일반에 공개된 최상위 모델입니다. 사이버보안 모델 글에서 다뤘듯, Fable 5.1과 Mythos 5.1은 같은 모델에 안전장치만 다르게 건 것이에요.

Fable 5.1Opus 5.5차이
입력 / 출력 (100만 토큰당)$10 / $50$4 / $20Opus 5.5가 60% 쌈
Terminal-Bench 4.055.8%66.4%+10.6
AutomationBench31.4%40.0%+8.6
Terminal-Bench-Science 0.152.6%58.7%+6.1
CursorBench 4.051.8%57.8%+6.0
FrontierCode v1.150.3%54.4%+4.1
Humanity’s Last Exam65.6%67.7%+2.1
OSWorld 2.0 (partial)80.7%81.8%+1.1
Chartography88.4%89.0%+0.6
GDPval-AA v2.1 (Elo)17351846+111

9개 모두 Opus 5.5가 높지만, 아래쪽 세 줄은 1~2점 차이라 오차 범위를 생각하면 사실상 비슷합니다. 차이가 뚜렷한 건 에이전트 코딩, 업무 자동화, 과학 연구, 실무 과제(GDPval) 쪽이에요.

예를 들어 입력 100만 토큰에 출력 20만 토큰을 쓰는 작업이라면, 공식 단가로 계산한 값은 이렇습니다.

모델계산비용
Fable 5.1$10 + 0.2 × $50$20
Opus 5$5 + 0.2 × $25$10
Opus 5.5$4 + 0.2 × $20$8

직접 계산해 보고 싶다면 API 비용 계산기 글의 방식과 같습니다.

막대 점수판 옆에서 어깨를 으쓱하는 로봇 — 대부분 이겼지만 두 칸은 옆 로봇이 높다 (GPT 이미지 생성)

🥊 4. 경쟁 모델 — 어디서 이기고 어디서 지나

발표 표에 나란히 실린 경쟁 모델은 OpenAI의 GPT-6 Astra와 GPT-5.6 Sol 둘입니다. 아스트라 글에서 다룬 그 모델이에요.

두 가지를 조심해서 보세요. 어려운 코딩(+1.1)과 업무 자동화(−1.4)는 차이가 작아서 오차 범위 안이에요. 그리고 업무 자동화는 앞에서 말했듯 두 모델의 측정 경로가 다릅니다. GPT-5.6 Sol은 값이 있는 모든 항목에서 Opus 5.5보다 낮습니다.

🛡️ 5. 안전성 — 발표문이 밝힌 것

앤트로픽은 이번에도 출시 전 외부 기관(Frontier Design, METR)에게 평가를 받았다고 밝혔습니다. 주요 문장을 옮기면:

즉 능력이 올라간 만큼 문도 Fable 5.1 수준으로 잠갔다는 이야기예요. 동시에 회사는 “배포 전에 모든 실패를 확실히 잡아내는 평가를 만드는 건 아직 풀리지 않은 문제”라고도 적었습니다.

유리 시험실 안의 로봇을 돋보기로 살피는 검사 로봇 (GPT 이미지 생성)

🎯 6. 그래서 누구에게 무슨 뜻인가

한 줄 정리

올해 일반 모델이 작년 최고급 모델을 따라잡은 경우와 비슷합니다. 공식 표에서 Opus 5.5는 윗급 Fable 5.1을 9개 항목 모두 넘었고 값은 60% 쌉니다. 다만 과학 연구·업무 자동화에서는 GPT-6 Astra가 앞서고, 회사 스스로도 “이제 점수 차이로는 실제 차이를 알기 어렵다”고 말합니다. 결국 내 일로 직접 돌려 보는 게 가장 정확한 벤치마크예요.


출처: 앤트로픽 공식 발표 “Introducing Claude Opus 5.5”(2026-09-22)의 벤치마크 표·각주·가격·안전성 문장, 앤트로픽 Claude Fable 페이지의 Fable 5.1 가격($10/$50). 출시일·가격은 TechCrunch·VentureBeat 보도(2026-09-22)와 교차 확인했습니다. 모든 성능 수치는 앤트로픽이 직접 측정·발표한 것으로 독립 검증 전이며, 모델마다 측정 설정이 다를 수 있습니다. 이 글은 특정 회사의 입장을 대변하지 않습니다. 삽화는 GPT 이미지 생성, 차트는 직접 제작했습니다.