GPT-5.6과 Claude Sonnet 5, 모델 고르는 기준
6월 30일 Claude Sonnet 5, 7월 9일 GPT-5.6이 연달아 나왔습니다. 무엇이 달라졌는지, 가격표만 보고 고르면 안 되는 이유, 모델을 바꿔 끼울 수 있게 준비하는 방법을 정리했습니다.

2주가 채 안 되는 사이에 주력 AI 모델이 둘이나 바뀌었습니다. Anthropic은 6월 30일 Claude Sonnet 5를, OpenAI는 7월 9일 GPT-5.6을 내놓았습니다. 두 회사 모두 '사람 대신 여러 단계의 일을 처리하는 능력'을 가장 앞에 내세웠습니다. 사내 AI 서비스를 운영하는 회사 입장에서 중요한 질문은 어느 쪽이 더 좋으냐가 아닙니다. 몇 달마다 바뀌는 모델을, 매번 개발을 새로 하지 않고 바꿔 쓸 수 있느냐입니다.
두 모델 한눈에
| 항목 | Claude Sonnet 5 | GPT-5.6 |
|---|---|---|
| 발표일 | 2026년 6월 30일 | 2026년 7월 9일 |
| 구성 | 한 가지 모델 | Sol, Terra, Luna 세 가지 |
| 내세운 점 | "가장 에이전트다운 Sonnet", 상위 모델 Opus 4.8에 가까운 성능을 더 낮은 비용으로 | Sol은 고난도 추론과 긴 에이전트 작업, Terra는 일상 업무, Luna는 가장 빠르고 저렴한 모델 |
| 한 번에 읽는 분량 | 발표문에 별도 표기 없음 | 세 모델 모두 100만 토큰 |
| 그 밖에 | 무료와 Pro 요금제의 기본 모델 | 학습 데이터 기준일 2026년 2월 16일, 한 번에 최대 12만 8천 토큰 출력 |
가격도 발표됐습니다. 아래는 출력 100만 토큰당 가격입니다. Sonnet 5는 8월 말까지 출시 할인 가격이 적용됩니다.
가격표만 보고 고르면 안 되는 이유
위 그래프만 보면 답이 쉬워 보이지만, 실제 비용은 가격표대로 나오지 않습니다. 같은 일을 시켜도 모델마다 생각하는 데 쓰는 토큰 수가 크게 다르기 때문입니다. 개발자 사이먼 윌리슨은 GPT-5.6 정리 글에서 추론 토큰 수가 모델마다 달라 이제 100만 토큰당 가격은 많은 것을 말해 주지 못한다고 짚었습니다.
그래서 비교 기준은 '토큰당 가격'이 아니라 '일 한 건을 끝내는 데 드는 비용'이어야 합니다. 비싼 모델이 한 번에 맞히고, 싼 모델이 세 번 다시 시도해야 한다면 결과는 뒤집힙니다. 정확도와 속도도 마찬가지로 회사의 실제 업무로 재야 합니다.
우리 회사에 맞는 모델을 고르는 순서
- 01평가 질문 모으기
실제로 자주 들어오는 질문과 업무 50개에서 100개, 그리고 담당자가 적은 모범 답을 준비합니다.
- 02같은 조건으로 돌리기
지금 쓰는 모델과 새 후보 두세 개에 같은 질문, 같은 지시문, 같은 참고 문서를 넣습니다.
- 03세 가지를 기록하기
맞힌 비율, 답이 나오기까지 걸린 시간, 일 한 건당 비용을 함께 적습니다.
- 04데이터 조건 확인하기
입력한 데이터가 어디에 얼마나 보관되는지, 계약 조건이 사내 기준에 맞는지 봅니다.
- 05조금씩 바꾸기
일부 사용자나 일부 업무부터 새 모델로 돌리고, 결과가 기준을 넘으면 넓힙니다.
모델을 갈아 끼울 수 있게 만드는 법
모델이 바뀔 때마다 시스템을 다시 만들지 않으려면 처음부터 몇 가지를 지켜야 합니다.
- 모델 호출을 한곳으로 모읍니다. 서비스 곳곳에서 특정 회사의 API를 직접 부르지 않고, 중간에 호출을 받아 주는 계층을 하나 둡니다. 모델을 바꿀 때 이 계층만 고치면 됩니다.
- 지시문과 평가 질문을 함께 관리합니다. 모델마다 잘 듣는 지시문이 조금씩 다릅니다. 지시문을 고치면 같은 평가 질문으로 다시 재서 점수를 남깁니다.
- 결과를 모델 이름과 함께 기록합니다. 어느 답이 어느 모델에서 나왔는지 남겨 두어야 문제가 생겼을 때 원인을 찾을 수 있습니다.
- 한 회사에만 기대지 않습니다. 한 곳에 장애가 나거나 가격이 바뀌어도 다른 모델로 넘어갈 수 있게 두 번째 후보를 늘 시험해 둡니다.
회사 상황별로 보면
대기업. 이미 특정 모델에 맞춰 만든 서비스가 여러 개라면, 이번 기회에 모델 호출 계층을 하나로 정리하는 편이 장기적으로 비용을 줄입니다.
중소기업. 비싼 모델부터 쓸 필요는 없습니다. 업무 대부분은 중간 가격대 모델로 충분한 경우가 많으니, 평가 질문으로 직접 확인한 뒤 정하시기 바랍니다. 예산을 어떻게 잡는지는 AI 도입 비용 글에서 따로 다뤘습니다.
공공기관과 금융회사. 외부 API를 쓰기 어려운 환경이라면 이번 발표는 '비교 기준'으로 활용하시면 됩니다. 사내에 설치할 모델을 고를 때도 같은 평가 질문과 같은 기준을 쓰면 됩니다.
새 모델 발표 때마다 확인할 것
- 지금 쓰는 모델과 같은 평가 질문으로 비교했다
- 토큰당 가격이 아니라 일 한 건당 비용으로 계산했다
- 데이터 보관 위치와 기간, 계약 조건을 확인했다
- 모델을 바꿔도 서비스 코드를 크게 고치지 않아도 된다
- 직원들이 쓰는 무료 요금제의 기본 모델이 바뀐 사실을 사내에 알렸다
자주 묻는 질문
새 모델이 나오면 바로 바꾸는 편이 좋은가요?
평가 질문으로 지금 모델보다 낫다는 것을 확인한 뒤 바꾸는 편이 안전합니다. 모델이 바뀌면 같은 지시문에도 답의 형식이나 길이가 달라질 수 있어 서비스 화면이나 후속 처리에 영향을 줄 수 있습니다.
직원들이 쓰는 무료 AI 서비스의 기본 모델이 바뀌면 신경 써야 하나요?
네. 답의 품질과 방식이 달라지므로, 업무에 쓰는 결과물은 사람이 확인한다는 원칙을 다시 알리는 것이 좋습니다. 사내 사용 기준은 사내 생성형 AI 사용 가이드라인을 참고해 주세요.
여러 회사의 모델을 함께 쓰면 관리가 더 어렵지 않나요?
처음에는 손이 더 갑니다. 하지만 모델 호출을 한곳으로 모아 두면 한 회사의 장애나 가격 변경에 흔들리지 않고, 업무마다 맞는 모델을 고를 수 있어 오래 보면 관리가 쉬워집니다.


