2026년 09월 27일 Stories worth reading. Perspectives worth sharing.
GPT-6, Claude Opus 5.5, Gemini 비교 — 2026년 9월 플래그십
AI 도구 활용

GPT-6, Claude Opus 5.5, Gemini 비교 — 2026년 9월 플래그십

Caston 7월 4, 2026 1 min read

OpenAI, Anthropic, Google 셋 중 어디를 쓸지는 오래된 질문이지만 답은 몇 달마다 바뀐다. 2026년 9월에만 세 회사가 각각 새 모델을 냈고, 그중 두 개는 같은 날 90분 간격으로 나왔다.

이번 세대에서 눈에 띈 건 성능 순위가 아니라 가격이 갈라진 방식이다. 같은 회사 안에서도 모델에 따라 다섯 배 차이가 난다. 어느 회사를 고르느냐보다 그 회사의 어느 등급을 고르느냐가 비용을 정한다.

세 회사의 현재 최상위

아래는 이 블로그의 모델 비교표 기준으로 세 회사가 현재 API로 제공하는 상위 모델이다. 가격은 100만 토큰당 입력과 출력이다. 토큰은 글을 잘게 자른 조각으로, 한국어는 한 글자가 한 토큰 안팎이다.

모델회사출시입력출력컨텍스트
GPT-6 AstraOpenAI2026-09-05$10$50105만
GPT-6 SolOpenAI2026-09-23$2$10105만
Claude Fable 5.1Anthropic2026-09-02$10$50100만
Claude Opus 5.5Anthropic2026-09-23$4$20100만
Gemini 3.8 FlashGoogle2026-09-03$0.75$3.75105만
세 회사의 현재 상위 모델. 2026-09-27 기준

표를 만들다가 걸린 것이 하나 있다. Google은 OpenRouter 모델 목록 기준으로 최근 올라온 신규 모델이 전부 Flash 계열이다. 상위 등급인 Pro는 2월에 나온 미리보기 버전이 마지막이고 그 뒤로 새 버전이 없다. 같은 자리에 놓고 비교하기 어렵다는 뜻이라, 표의 Gemini는 다른 둘과 등급이 다르다는 점을 감안해야 한다.

Flash는 각 회사가 속도와 가격을 앞세워 내놓는 경량 등급을 말한다. 최상위 모델보다 답이 단순한 대신 훨씬 싸고 빠르다. Google이 이 등급에 신규 출시를 몰고 있다는 사실 자체가 하나의 신호로 읽힌다.

가격 차이가 벌어진 지점

OpenAI와 Anthropic 모두 9월 하순에 기존 최상위보다 훨씬 싼 모델을 내놨다. GPT-6 Sol은 Astra의 5분의 1, Claude Opus 5.5는 Fable 5.1의 2.5분의 1 가격이다. 컨텍스트는 그대로다. 컨텍스트는 한 번에 읽을 수 있는 글의 총량을 말한다.

성능이 그만큼 떨어졌느냐 하면 그렇지도 않다. 코딩 벤치마크 비교 자료에 따르면 Terminal-Bench 4.0에서 Claude Opus 5.5가 66.4%로 선두다. 가격이 2.5배 비싼 Fable 5.1보다 이 시험에서는 앞선다. Terminal-Bench는 모델이 터미널에서 명령을 직접 치며 여러 단계 작업을 끝내는지 보는 시험이다.

다른 시험에서는 순서가 뒤집힌다. SWE-bench Pro 집계에서는 Fable 5.1이 81.2%로 1위다. 같은 회사 모델끼리도 어느 시험이냐에 따라 순서가 바뀐다. 단일 순위가 존재하지 않는다고 보는 편이 정확하다.

GPT-6 Astra는 9월에 나왔는데도 두 순위표 모두에 점수가 없다. 측정이 아직 안 된 것이지 결과가 나쁜 게 아니다. 새 모델을 순위표만 보고 판단하면 이런 공백에 걸린다.

가격이 내려간 배경에는 경쟁이 있다. 두 회사의 신규 모델이 같은 날 90분 간격으로 나왔고, OpenAI 쪽이 절반 가격을 붙였다. 쓰는 입장에서는 몇 달 전 같은 성능에 두세 배를 냈다는 뜻이기도 하다. 계약을 오래 묶어두기보다 분기마다 다시 계산해볼 이유가 여기 있다.

컨텍스트와 실제 체감

세 회사 모두 100만 토큰 안팎으로 비슷하다. 숫자만 보면 차이가 없어 보이지만 쓰는 방식이 다르다.

100만 토큰은 한국어로 책 세 권 정도다. 코드 저장소 하나를 통째로 넣을 수 있는 크기다. 다만 컨텍스트를 가득 채우면 입력 비용도 그만큼 올라간다. Claude Fable 5.1에 100만 토큰을 한 번 넣으면 그 한 번에 10달러다. 같은 일을 Gemini 3.8 Flash로 하면 0.75달러다.

컨텍스트가 크다고 다 넣는 게 좋은 것도 아니다. 필요한 부분만 골라 넣으면 비용도 줄고 답도 정확해지는 경우가 많다. 컨텍스트 크기는 상한이지 권장량이 아니다.

체감을 가르는 다른 요소는 속도다. 최상위 모델은 답을 내기 전에 오래 생각한다. 대화형으로 주고받는 작업에서는 이 대기 시간이 품질보다 더 크게 느껴진다. 반대로 밤사이 문서를 처리하는 일이라면 속도는 의미가 없고 가격만 남는다.

무엇을 고를까

세 회사를 놓고 고르기보다 작업 종류로 나누는 편이 실제에 가깝다.

코드를 맡기고 여러 단계 작업을 시키는 일이라면 현재 순위표 기준으로 Claude Opus 5.5가 앞선다. 가격도 최상위 모델의 절반 이하다. 양이 많고 난이도가 낮은 일, 예를 들어 문서 분류나 요약이라면 Gemini 3.8 Flash가 10분의 1 가격으로 같은 일을 한다. GPT-6 Sol은 중간 자리에서 OpenAI 생태계를 쓰던 곳에 그대로 붙는다.

한 회사에만 묶이지 않는 것도 방법이다. 여러 회사 모델을 하나의 창구로 쓰는 중개 서비스를 쓰면 모델 이름만 바꿔 갈아탈 수 있다. 이번처럼 한 달에 다섯 개가 쏟아지는 시기에는 갈아타는 비용이 낮은 쪽이 유리하다.

어느 쪽을 고르든 한 달 뒤에 다시 봐야 한다. 9월 한 달에 세 회사가 낸 모델만 다섯 개다. 지금 정한 답은 다음 발표까지만 유효하다.

함께 읽기

Leave a Comment