모델을 바꾸면 요금이 크게 달라집니다. 확인된 단가로는 최대 20배입니다. 문제는 바꿔도 되는지를 어떻게 판단하느냐입니다.
이 글은 싼 모델로 내려도 되는지 확인하는 절차를 정리합니다.
이 글의 요금·조건은 2026년 8월 25일에 각 서비스 공식 페이지에서 확인한 값입니다. 이후 변경됐을 수 있습니다.
내리면 얼마나 아끼나
| 제공사 | 한 단계 내리면 | 맨 아래까지 내리면 |
|---|---|---|
| 오픈AI | 약 2배 | 20배 |
| 앤트로픽 | 2~2.5배 | 10배 |
코드 수정은 대체로 모델 이름 한 줄입니다. 효과 대비 비용이 가장 낮은 절감 수단인 이유입니다.
바꿔도 되는지 확인하는 절차
- 지금 결과를 20~30건 저장합니다. 비교 기준이 없으면 판단할 수 없습니다.
- 같은 입력을 싼 모델에 넣습니다. 같은 지시문, 같은 설정으로.
- 차이가 나는 건만 골라 봅니다. 전부 볼 필요 없습니다.
- 그 차이가 문제가 되는지 판단합니다. 표현이 다른 것과 틀린 것은 다릅니다.
- 문제 되는 비율을 셉니다. 30건 중 몇 건인지.
5번이 판단의 핵심
싼 모델로 내리면 일부 건에서 품질이 떨어질 수 있습니다. 문제는 “떨어지는가”가 아니라 “떨어져도 되는가”입니다.
| 작업 성격 | 허용 가능한 오차 | 판단 |
|---|---|---|
| 내부 초안 생성 | 사람이 어차피 고침 | 내려도 됨 |
| 대량 분류·태깅 | 일부 오분류 감수 가능 | 내려도 됨 |
| 고객에게 바로 나가는 답변 | 낮음 | 신중히 |
| 금액·법률 관련 판단 | 없음 | 내리지 않음 |
기준은 틀렸을 때 누가 감당하는가입니다. 사람이 어차피 확인하는 단계라면 싼 모델로 충분한 경우가 많습니다.
전부 내리지 않고 단계를 나누는 방법
양자택일이 아닙니다. 단계별로 다른 모델을 쓰는 구성이 총액이 가장 적습니다.
- 1단계(양이 많음) — 가장 싼 모델로 후보를 걸러 냅니다.
- 2단계(양이 적음) — 걸러진 것만 상위 모델로 정밀 처리합니다.
1,000건 중 100건만 정밀 처리가 필요하다면, 900건은 20분의 1 요율로 처리됩니다.
비교할 때 조건을 맞추세요
모델을 비교할 때 지시문까지 함께 바꾸면 무엇 때문에 결과가 달라졌는지 알 수 없습니다.
같은 입력, 같은 지시문, 같은 설정으로 모델만 바꿔야 비교가 됩니다.
또한 싼 모델에는 지시문을 더 구체적으로 써야 하는 경우가 있습니다. 이 경우 “모델을 내렸더니 안 된다”가 아니라 “지시문을 다듬으면 된다”일 수 있으니, 한 번 더 시도해 보시기 바랍니다.
비교 비용은 얼마인가
30건 비교의 비용을 계산했습니다. 입력 3,000 / 출력 2,000 토큰 기준입니다.
| 모델 | 30건 비용 |
|---|---|
| 앤트로픽 Opus 5 | 약 $1.95 |
| 앤트로픽 Sonnet 5 | 약 $0.78 |
| 오픈AI luna | 약 $0.09 |
비교 비용이 1~2달러 수준입니다. 월 수십 달러를 아낄 수 있는 판단을 위해 이 정도면 시험해 볼 만합니다.
확인 범위
단가는 두 제공사의 공식 요금 문서 원문과 대조했습니다. 모델별 성능 차이는 저희가 측정하지 않았으므로 적지 않습니다 — 이 글은 요금 구조와 판단 절차만 다룹니다.
어느 작업이 어느 모델로 되는지는 자기 작업으로 직접 비교하시는 것이 유일하게 정확한 방법입니다.
자주 묻는 질문
몇 건을 비교해야 하나요?
20~30건이면 경향이 보입니다. 작업이 다양하다면 종류별로 몇 건씩 섞으시기 바랍니다.
싼 모델이 아예 못 하는 작업도 있나요?
있을 수 있습니다. 다만 시험 비용이 1~2달러 수준이므로 짐작하지 마시고 해 보시는 편이 빠릅니다.
지시문을 바꿔야 하나요?
싼 모델일수록 구체적인 지시가 도움이 되는 경우가 있습니다. 다만 비교할 때는 조건을 맞추고, 그다음에 다듬으시기 바랍니다.
단계를 나누면 관리가 복잡하지 않나요?
복잡해집니다. 그 시간도 비용이므로 절감폭이 그만한지 계산해 보시기 바랍니다.