happy_various AI 실전 기록

2026년 10월 1일 기준

이 글에는 제휴 링크가 없고 OpenAI와 아무 관계가 없습니다. 성능·가격 수치는 OpenAI 공식 발표(2026-09-29) 기준이며 독립 검증 전입니다. 삽화는 GPT 이미지 생성, 차트는 직접 제작했습니다.

GPT-6.1 Sol 발표 — Astra에 가까운 성능을 5분의 1 값에. 무엇이 달라졌고 누구에게 맞나

이름난 식당에 저녁 코스가 있다고 해 볼게요. 맛은 확실한데 값이 꽤 나갑니다. 그런데 같은 주방, 같은 셰프가 점심 정식을 내놨어요. 접시 수는 적지만 맛은 저녁 코스에 거의 붙었고, 값은 5분의 1이에요. 그러면 매일 먹을 건 점심 정식이 되겠죠. 저녁 코스는 정말 중요한 날에만 고르고요.

2026년 9월 29일 OpenAI가 개발자 행사 DevDay에서 발표한 GPT-6.1 Sol이 그런 자리를 노린 모델이에요. 회사 설명을 그대로 옮기면 “Astra의 표준 입력·출력 토큰 가격의 5분의 1로, Astra에 가까운 지능”을 낸다고 합니다. 하루 전인 9월 28일에는 앤트로픽이 Claude Sonnet 5.5를 내놨는데, 두 모델의 API 가격이 똑같다는 점도 눈에 띄어요.

⚠️ 이 글의 성능·가격 수치는 2026-09-29 OpenAI 공식 발표문을 옮긴 것입니다. 회사가 직접 잰 값이라 독립 검증 전이고, 경쟁사 모델 값은 OpenAI가 공개 보고서에서 인용한 것입니다.

같은 셰프 로봇이 차린 저녁 코스와 점심 정식, 옆에 쌓인 동전 높이가 다르다 (GPT 이미지 생성)

결론 요약

🧭 1. 어떤 자리의 모델인가

9월 한 달 동안 OpenAI는 GPT-6 계열을 차례로 내놨어요.

Sol이 나온 지 일주일 만에 업그레이드가 나온 셈이에요. 발표문은 이 모델을 “중요한 작업을 더 자주 돌리려는 사용자와, 큰 서비스를 만들어 운영하는 API 고객을 위한 역량과 비용의 새 균형점”이라고 소개합니다. 매일 많이 쓰는 일은 6.1 Sol에, 정말 어려운 일은 Astra에 맡기라는 그림이에요.

💰 2. 가격 — 캐시된 입력이 95% 싸다

항목 (100만 토큰당)GPT-6.1 SolGPT-6 Astra (계산값)Claude Sonnet 5.5Claude Opus 5.5
입력$2$10$2$4
캐시된 입력 (캐시 읽기)$0.10—$0.20$0.20
출력$10$50$10$20

책갈피를 꽂아 둔 두꺼운 책을 바로 펼치는 로봇, 옆에는 웃는 돼지 저금통 (GPT 이미지 생성)

캐시된 입력이 뭔지 짚고 갈게요. AI 에이전트는 같은 일을 하는 동안 긴 지시문과 앞선 대화를 매번 다시 보냅니다. 두꺼운 책을 처음부터 다시 읽는 셈이에요. 캐시는 이미 읽은 부분에 책갈피를 꽂아 두는 기능이고, 그 부분은 값을 95% 깎아 줍니다.

단순한 예로, 입력 100만 토큰과 출력 20만 토큰짜리 일을 계산해 보면 이래요.

실제로는 모델마다 같은 일에 쓰는 토큰 수가 달라서 이 계산은 단가 비교일 뿐이에요. 그래도 같은 앞부분을 수십 번 다시 보내는 에이전트 작업이라면 캐시 단가가 청구서를 크게 좌우합니다.

📊 3. 성능 — 발표문이 말한 것

이번 발표문은 점수를 표로 주기보다 “누구보다 몇 %포인트 높다, 비용은 몇 분의 1이다”처럼 상대 비교로 적었어요. 그래서 그 문장을 그대로 모았습니다.

분야평가발표문 내용
코딩DeepSWE v1.1 (실제 코드베이스의 긴 개발 과제)약 5분의 1 비용으로 Astra와 대등. 더 낮은 추론 강도로도 이전 Sol의 최고 점수보다 6.4%포인트 높음
문서 이해GDP.pdf (표·차트·작은 글씨가 섞인 10개 전문 분야의 PDF)폴백을 쓰는 Claude Opus 5.5보다 높고 작업당 비용은 절반 미만. 약 5분의 1 비용으로 Astra에 근접
업무 자동화AutomationBench (영업·마케팅·재무·인사 도구 47개로 하는 여러 단계 업무)중간 추론 강도에서 Opus 5.5보다 2.2%포인트 높고 비용은 약 3분의 1. 같은 설정의 이전 Sol보다 4.8%포인트 높음
컴퓨터 사용OSWorld 2.0 오프라인 세트 (화면을 보고 프로그램을 다루는 긴 작업)최대 추론 강도에서 이전 Sol보다 7%포인트 높고 비용은 절반 미만. Astra와는 2.1%포인트 차이, 비용은 약 7분의 1
과학 연구Terminal-Bench Science 0.1 (데이터 분석·시뮬레이션·정리 증명)이전 Sol 점수의 2배 이상. 작업 1건 평균 $5.47 (Opus 5.5 $23.21, Astra $23.80). 점수 1위는 Astra 68.1%

숫자가 그대로 공개된 두 항목은 그림으로 그려 봤어요.

과학 작업 1건 비용과 검색 도구 고장 미고지율 비교 막대 (직접 제작)

읽을 때 짚어 둘 점이 몇 가지 있어요.

🛡️ 4. 사실 정확성과 정직함

틀린 사실이 섞인 답의 비율도 내려갔어요. 이전 모델이 틀렸다고 사용자가 신고한 대화들(개인 정보를 지운 것)로 잰 값인데, 추론 강도를 ‘매우 높음’으로 두었을 때 이렇습니다.

깨진 돋보기를 든 로봇이 추측하는 대신 주황 깃발을 들어 사람에게 알린다 (GPT 이미지 생성)

검색 도구가 고장 났을 때 솔직히 말하는지도 쟀어요. 검색이 안 되는데 모르는 척 추측으로 답하지 않고 “검색이 안 됩니다”라고 알리는지 보는 시험이에요. 알리지 않은 비율이 6.1 Sol 2.1%, 이전 Sol 4.9%, Astra 1.5%, Luna 28.7%였어요. 이것도 실패를 유도하도록 고른 과제라 평소 비율은 아니에요.

그 밖에 이런 내용이 있어요.

⚡ 5. 함께 나온 것 — Ultrafast와 월 500달러 Pro

🆚 6. 하루 먼저 나온 Claude Sonnet 5.5와 나란히 보면

두 모델은 하루 차이로 나왔고, 단가도 같아요.

결국 고르는 기준은 점수표보다 내가 쓰는 도구예요. ChatGPT·Codex를 쓰고 있다면 6.1 Sol, Claude 앱·Claude Code를 쓰고 있다면 Sonnet 5.5가 같은 값대의 선택지입니다. API로 둘 다 쓸 수 있다면 내 일을 직접 맡겨 비교해 보는 게 가장 정확해요.

🎯 7. 그래서 누구에게 무슨 뜻인가

한 줄 정리

GPT-6.1 Sol은 Astra의 5분의 1 값으로 Astra 바로 아래까지 온 Sol이고, 캐시된 입력을 95% 깎아 에이전트 작업의 비용을 크게 낮췄어요. 다만 종합 역량의 1등은 회사 스스로 여전히 Astra라고 말합니다.

같은 날 경쟁 소식은 Claude Sonnet 5.5 출시 글에, 그 윗급 모델은 Opus 5.5 출시 글과 실사용 후기에 있어요.


2026년 10월 1일 기준입니다. 성능·가격은 OpenAI 공식 발표(GPT-6.1 Sol 소개, DevDay 2026 주요 발표 — 2026-09-29)에서 옮겼고, 독립 검증 전 수치입니다. GPT-6 Astra 가격은 발표문의 ‘5분의 1’ 표현으로 계산한 값입니다. 가격은 바뀔 수 있으니 쓰기 전에 공식 가격표를 확인하세요.