코딩에 가장 좋은 AI 모델은? 벤치마크마다 1위가 다른 이유
코딩용 AI 모델을 고르려고 순위표를 찾아보면 오히려 더 헷갈린다. 어디서는 Claude가 1위고, 어디서는 GPT가 1위다. 같은 달에 잰 자료인데도 그렇다. 나도 처음엔 어느 하나가 틀렸다고 생각했다.
틀린 게 아니라 재는 자가 다르다. 시험 문제가 다르니 등수도 다르게 나온다. 어떤 시험이 내 상황과 가까운지 알면 순위표를 읽는 법이 생긴다.
벤치마크가 갈리는 이유
코딩 능력을 재는 시험은 크게 세 가지가 쓰인다. 이름이 낯설어도 하는 일은 단순하다.
SWE-bench Verified는 실제 깃허브에 올라온 파이썬 버그 500개를 모델에게 고치게 한다. 사람이 미리 검수한 문제들이라 답이 분명하다. 문제는 이 시험이 너무 쉬워졌다는 점이다. llm-stats 집계를 보면 상위 모델들이 90% 중반에 몰려 있다. 변별력이 사라지자 평가 기관 Vals AI는 9월 1일부터 신규 모델 측정을 멈췄다.
SWE-bench Pro는 그래서 나왔다. 실제로 관리되고 있는 저장소 41곳에서 1,865개 과제를 뽑았고, 정답이 인터넷에 떠돌지 않게 만들었다. 이 벤치마크를 만든 논문에 따르면 쉬운 시험에서 90%를 넘던 모델이 여기서는 60% 안팎으로 떨어진다. 처음 이 시험이 공개됐을 때는 최상위 모델도 23% 남짓이었다.
Terminal-Bench는 조금 다르다. 모델이 터미널에서 명령을 직접 치며 여러 단계를 밟아 일을 끝내는지 본다. 코드 한 조각을 짜는 게 아니라 작업 전체를 맡기는 상황에 가깝다. 요즘 AI에게 “이 버그 고쳐줘”라고 던지고 알아서 파일을 찾아 수정하게 하는 방식이 여기 해당한다.
같은 모델이라도 시험 성격에 따라 순서가 바뀐다. 파일 하나를 고치는 능력과, 저장소를 돌아다니며 원인을 찾아 여러 파일을 고치는 능력이 다르기 때문이다. SWE-rebench처럼 매달 새 문제로 갈아끼우며 재는 순위표도 있다. 모델이 문제를 미리 외워버리는 것을 막기 위해서다.
지금 1위로 꼽히는 모델
2026년 9월 기준 각 순위표의 선두는 아래와 같다. 같은 시기 자료인데 이름이 제각각이라는 점을 그대로 봐주면 된다.
| 순위표 | 1위 | 점수 |
|---|---|---|
| Terminal-Bench 4.0 | Claude Opus 5.5 | 66.4% |
| SWE-bench Pro | Claude Fable 5.1 | 81.2% |
| SWE-bench Verified | Claude Fable 5 | 95.0% |
| BenchAlign 코딩 종합 | Claude Opus 5.5 | 87.6 |
Anthropic 모델이 상단을 차지하고 있지만 단서가 붙는다. SWE-bench Pro 집계를 보면 9월에 나온 GPT-6 Astra와 GLM-5.3은 아직 점수 자체가 없다. 측정되지 않은 모델은 순위표에 오르지 못할 뿐, 못한다는 뜻이 아니다.
점수의 출처도 갈린다. 한 비교 자료는 SWE-bench Pro 점수 상당수가 모델을 만든 회사가 직접 신고한 값이며 제3자 검증을 거치지 않았다고 명시한다. 회사가 낸 숫자와 독립 기관이 잰 숫자가 다를 수 있다는 뜻이다. 순위표를 볼 때 누가 쟀는지 한 번 확인할 이유가 여기 있다.
같은 모델을 다른 기관이 재면 점수가 달라지기도 한다. Claude Opus 5.5의 Terminal-Bench 점수는 자료에 따라 66.4%로도, 59.6%로도 나온다. 시험 환경과 설정이 다르기 때문이다. 절대 점수를 외우기보다 같은 표 안에서의 순서만 참고하는 편이 낫다.
모델 뒤에 붙는 도구도 결과를 바꾼다. BenchLM 코딩 순위표처럼 모델만 재는 곳이 있고, 모델과 코딩 도구를 짝지어 재는 곳이 있다. 같은 모델이라도 어떤 도구에 붙이느냐에 따라 점수가 10% 넘게 벌어진다. 내가 쓰는 도구가 정해져 있다면 그 조합의 점수를 찾는 편이 정확하다.
가격까지 넣고 보면
점수만 보면 비싼 모델이 좋아 보인다. 실제로 쓸 때는 같은 작업을 몇 번 반복하느냐가 비용을 정한다. 아래는 이 블로그의 모델 비교표에 있는 2026년 9월 기준 가격이다. 100만 토큰당 입력과 출력 가격이며, 토큰은 AI가 글을 읽고 쓸 때 세는 조각 단위다. 한국어는 대략 한 글자가 한 토큰 안팎이다.
| 모델 | 입력 | 출력 | 컨텍스트 |
|---|---|---|---|
| Claude Opus 5.5 | $4 | $20 | 100만 |
| Claude Fable 5.1 | $10 | $50 | 100만 |
| GPT-6 Astra | $10 | $50 | 105만 |
| GPT-6 Sol | $2 | $10 | 105만 |
| Kimi K2.7 Code | $0.66 | $3.3 | 26만 |
| GLM 5.3 Flash | $0.04 | $0.5 | 131만 |
Claude Opus 5.5와 Claude Fable 5.1의 점수 차이는 순위표에 따라 몇 점 수준이다. 그런데 가격은 두 배 반이다. GPT-6 Sol은 Astra의 5분의 1 가격이면서 같은 컨텍스트를 쓴다. 컨텍스트는 모델이 한 번에 읽을 수 있는 글의 총량이다. 저장소 전체를 넣고 물어보려면 이 값이 커야 한다.
맨 아래 GLM 5.3 Flash를 보면 차이가 얼마나 벌어지는지 알 수 있다. Opus 5.5 대비 입력은 100분의 1, 출력은 40분의 1이다. 순위표 상단에는 못 오르지만, 반복적인 코드 정리나 주석 작성처럼 난이도가 낮고 양이 많은 일에는 이쪽이 맞는 경우가 있다.
코딩 작업은 특히 입력이 길다. 코드를 읽히려면 파일을 통째로 넣어야 하기 때문이다. 그래서 출력 가격보다 입력 가격이 총액을 좌우하는 경우가 많다. 같은 질문을 던져도 컨텍스트에 파일을 몇 개 넣었느냐에 따라 요금이 열 배씩 벌어진다.
오픈 가중치라는 선택지
모델 파일이 공개된 모델도 코딩 순위표에 이름을 올린다. 오픈 가중치란 모델 자체를 내려받아 내 서버에서 돌릴 수 있다는 뜻이다. 회사 서버를 거치지 않으니 코드가 밖으로 나가지 않는다.
회사 코드를 외부 AI에 넣는 것이 막혀 있는 곳이라면 이 조건이 성능보다 앞선다. Qwen3.8 27B, GLM 5.3 Flash, Kimi K2.7 Code, DeepSeek 계열이 여기 해당한다. 앞의 코딩 순위표에서도 오픈 가중치 모델이 상위권 바로 아래 구간에 들어와 있다.
다만 직접 돌리려면 그래픽카드가 필요하고, 모델이 클수록 요구 사양도 올라간다. 처음부터 자체 구축을 목표로 하기보다, 오픈 가중치 모델을 API로 먼저 써보고 품질이 맞는지 확인한 뒤 옮기는 순서가 실패가 적다.
고를 때 보는 순서
내가 순위표를 읽는 순서는 이렇다. 먼저 내 일이 어느 시험에 가까운지 정한다. 버그 하나를 고치는 일이면 SWE-bench 계열, 명령을 여러 번 주고받으며 작업을 맡기는 일이면 Terminal-Bench 쪽이 참고가 된다.
그 다음 상위 세 모델의 점수 차이를 본다. 차이가 몇 점 안이면 가격이 결정권을 갖는다. 마지막으로 하루에 몇 번 호출할지 어림잡아 월 비용을 계산한다. 하루 50번 호출에 회당 2만 토큰이면 한 달에 3천만 토큰이다. Opus 5.5로는 월 120달러, GPT-6 Sol로는 60달러, GLM 5.3 Flash로는 1.2달러다.
한 가지 더 있다. 순위표에 없는 조건이 실무에서는 더 크게 작용한다. 회사가 쓰는 도구에 그 모델이 붙는지, 사내 정책상 외부 API에 코드를 보내도 되는지, 응답이 느려서 작업 흐름이 끊기지 않는지 같은 것들이다. 점수 5점 차이보다 이쪽이 먼저 걸린다.
순위표는 한 달이면 바뀐다. 9월 한 달에만 선두가 세 번 바뀌었다. 모델 이름을 외우는 것보다 어느 시험을 봐야 하는지 아는 편이 오래 간다.