happy_various AI 실전 기록

2026년 10월 1일 기준

이 글에는 제휴 링크가 없고 앤트로픽과 아무 관계가 없습니다. 성능·가격 수치는 앤트로픽 공식 발표(2026-09-28)와 공식 문서 기준이며 독립 검증 전입니다. 삽화는 GPT 이미지 생성, 차트는 직접 제작했습니다.

Claude Sonnet 5.5 출시 — 가격은 그대로, 30% 빨라졌다. Sonnet 5·Opus 5.5와 벤치마크로 비교

자동차 신형이 나왔는데 가격표가 작년과 똑같다고 해 볼게요. 그런데 보닛을 열어 보니 엔진은 윗급 모델에 들어가던 것과 거의 같은 물건이에요. 그러면 고민이 생깁니다. “윗급을 살 이유가 남았나?”

2026년 9월 28일 앤트로픽이 내놓은 Claude Sonnet 5.5가 그런 모양이에요. 사흘 전 Opus 5.5 출시 글에서 윗급 모델 이야기를 했는데, 이번에는 그 아랫급이 가격은 그대로 둔 채 성능을 끌어올렸습니다. 회사의 첫 문장은 이렇습니다. “Sonnet 5보다 확실히 나아졌고, 30% 이상 빠르며, 대부분의 일에서 비용이 최대 30% 적게 든다.”

⚠️ 이 글의 성능·가격 수치는 2026-09-28 앤트로픽 공식 발표와 공식 문서를 옮긴 것입니다. 회사가 직접 잰 값이라 독립 검증 전이고, 측정 설정이 다른 항목은 따로 표시했습니다.

새 차 옆에서 뿌듯하게 선 로봇, 열린 보닛 안에서 엔진이 빛난다 (GPT 이미지 생성)

결론 요약

🧭 1. 어떤 자리의 모델인가

앤트로픽은 두 모델의 역할을 이렇게 나눴어요.

공식 문서의 모델 비교표에서는 Sonnet 5.5를 속도와 지능의 가장 좋은 조합이라고 소개합니다. 응답 속도 칸에는 Opus 5.5가 ‘보통’, Sonnet 5.5가 ‘빠름’으로 적혀 있어요.

💰 2. 가격과 스펙 — 이전 버전과 같은 값

항목Sonnet 5Sonnet 5.5Opus 5.5
입력 토큰 (100만 개당)$2$2$4
출력 토큰 (100만 개당)$10$10$20
캐시 읽기 (100만 개당)$0.20$0.20$0.20
캐시 쓰기, 5분 (100만 개당)$2.50$2.50$5
한 번에 읽는 분량 (컨텍스트)—100만 토큰100만 토큰
한 번에 쓰는 최대 분량—12만 8천 토큰12만 8천 토큰
기본 생각 강도 (API)—highmedium

몇 가지를 짚어 둘게요.

📊 3. 성능 지표 — 공식 표 그대로

앤트로픽 발표문에 실린 표입니다. 퍼센트로 된 6개 지표를 먼저 그림으로 보면 이렇습니다.

Sonnet 5·Sonnet 5.5·Opus 5.5의 벤치마크 6개 비교 막대 (직접 제작)

전체 표예요. 칸이 비어 있는 곳은 발표문에도 값이 없는 곳입니다.

벤치마크무엇을 재나Sonnet 5.5Sonnet 5Opus 5.5GPT-6 Sol
Terminal-Bench 4.0터미널에서 일하는 에이전트 코딩70.6%10.3%66.4% ¹—
FrontierCode 1.1 (Main)사람이 손대지 않고 합칠 수 있는 코드 수정46.2% ²42.4%54.4%49.3%
CursorBench 4.0코딩 도구 Cursor 안의 작업55.5%34.1%57.8%—
GDPval-AA v2.1 ³여러 직업의 실무 (Elo 점수)1844144918461487 ⁴
AA-Briefcase v1.1 ³실무 과제 (Elo 점수, Artificial Analysis 측정)1811135918221483 ⁴
Humanity’s Last Exam고난도 지식 문제 (도구 사용)64.5%54.9%67.7%—
OSWorld 2.1 (partial)컴퓨터 화면 조작80.1%57.0%81.8%—
Chartography차트 읽기 (도구 없음)61.6%15.6%64.4%53.6% ⁴

표 아래 각주가 중요해서 옮겨 둡니다.

키를 재는 두 로봇 형제, 동생이 형과 거의 같은 키다 (GPT 이미지 생성)

🔁 4. 이전 버전 Sonnet 5와 무엇이 달라졌나

8개 지표가 모두 올랐는데, 오른 폭이 고르지 않아요.

지표Sonnet 5 → Sonnet 5.5차이
Terminal-Bench 4.010.3% → 70.6%+60.3
Chartography15.6% → 61.6%+46.0
OSWorld 2.157.0% → 80.1%+23.1
CursorBench 4.034.1% → 55.5%+21.4
Humanity’s Last Exam54.9% → 64.5%+9.6
FrontierCode 1.142.4% → 46.2%+3.8
GDPval-AA v2.1 (Elo)1449 → 1844+395
AA-Briefcase v1.1 (Elo)1359 → 1811+452

터미널에서 스스로 일하는 코딩과 차트 읽기가 크게 뛰었고, 컴퓨터 화면 조작과 두 실무 지표도 많이 올랐어요. 발표문에는 이런 문장도 있습니다. Sonnet 가운데 처음으로 화면만 보고 포켓몬 레드를 깼고, 글을 더 분명하게 쓰고, 도구를 쓸 때 거치는 단계와 토큰이 줄었다고요.

⚖️ 5. Opus 5.5와 비교 — 반값 모델은 어디까지 왔나

Opus 5.5Sonnet 5.5
입력 / 출력 (100만 토큰당)$4 / $20$2 / $10Sonnet 5.5가 절반
Terminal-Bench 4.066.4% (Xhigh)70.6%Sonnet 5.5 +4.2
GDPval-AA v2.1 (Elo)184618442점 차
AA-Briefcase v1.1 (Elo)18221811Opus 5.5 +11
OSWorld 2.181.8%80.1%Opus 5.5 +1.7
CursorBench 4.057.8%55.5%Opus 5.5 +2.3
Chartography64.4%61.6%Opus 5.5 +2.8
Humanity’s Last Exam67.7%64.5%Opus 5.5 +3.2
FrontierCode 1.154.4%46.2% (Max)Opus 5.5 +8.2

같은 일을 시켰을 때의 비용을 단순하게 계산해 보면, 입력 100만 토큰과 출력 20만 토큰짜리 일이 Opus 5.5는 $8($4 + 0.2 × $20), Sonnet 5.5는 $4($2 + 0.2 × $10)예요. 실제로는 모델마다 같은 일에 쓰는 토큰 수가 달라서 이 계산은 단가 비교일 뿐입니다.

숫자만 보면 “이제 Opus 5.5는 필요 없나?” 싶지만, 앤트로픽은 발표문에 이렇게 선을 그었어요.

“벤치마크 점수는 모델 능력의 한 면만 보여 줍니다. 우리 자체 시험과 외부 시험 모두에서, 오래 판단을 이어 가야 하는 복잡하고 열린 일에서는 Opus 5.5가 여전히 확실히 더 강합니다.”

FrontierCode처럼 범위를 지키며 정확히 고치는 일에서 차이가 가장 큰 것도 같은 이야기로 읽혀요.

🛡️ 6. 안전 조치 — 처음으로 윗급 수준을 단 Sonnet

성능이 오르면서 안전 조치도 한 단계 올렸습니다.

빛나는 생각 말풍선을 공책에 베끼려는 작은 로봇을 방패로 막는 경비 로봇 (GPT 이미지 생성)

🎯 7. 그래서 누구에게 무슨 뜻인가

한 줄 정리

Sonnet 5.5는 같은 값에 30% 빨라진 Sonnet이고, 코딩·화면 조작·실무 지표에서 Opus 5.5 바로 아래까지 올라왔어요. 다만 길게 판단해야 하는 일은 회사 스스로 Opus 5.5를 권합니다.

윗급 모델 이야기는 Opus 5.5 출시 글에, Opus 5.5에 실제로 일을 맡겨 본 기록은 실사용 후기에 있어요.


2026년 10월 1일 기준입니다. 성능·가격은 앤트로픽 공식 발표(2026-09-28)와 공식 문서(모델 비교표·가격표)에서 옮겼고, 독립 검증 전 수치입니다. 가격은 바뀔 수 있으니 쓰기 전에 공식 가격표를 확인하세요.