오픈AI API 요금표에는 같은 모델이 두 번 나옵니다. 한 번은 Short context, 한 번은 Long context. 요율이 정확히 두 배 안팎 차이 납니다.
긴 문서를 다루는 작업이라면 이 표를 잘못 읽고 예산을 짤 경우 실제 청구가 두 배로 나옵니다.
이 글의 요금·조건은 2026년 8월 25일에 각 서비스 공식 페이지에서 확인한 값입니다. 이후 변경됐을 수 있습니다.
두 표를 나란히 놓으면
| 모델 | 구분 | 입력 | 캐시된 입력 | 출력 |
|---|---|---|---|---|
| gpt-5.6-sol | Short | $4.00 | $0.40 | $20.00 |
| gpt-5.6-sol | Long | $8.00 | $0.80 | $30.00 |
| gpt-5.6-terra | Short | $2.00 | $0.20 | $12.00 |
| gpt-5.6-terra | Long | $4.00 | $0.40 | $18.00 |
| gpt-5.6-luna | Short | $0.20 | $0.02 | $1.20 |
| gpt-5.6-luna | Long | $0.40 | $0.04 | $1.80 |
단위는 100만 토큰당 달러입니다.
표에서 읽히는 규칙
세로로 비교하면 규칙이 하나 보입니다.
- 입력은 정확히 2배입니다. 세 모델 모두 예외 없습니다($4→$8, $2→$4, $0.20→$0.40).
- 캐시된 입력도 2배입니다. 입력과 같은 비율을 유지합니다.
- 출력은 2배가 아닙니다. sol은 $20→$30(1.5배), terra는 $12→$18(1.5배), luna는 $1.20→$1.80(1.5배)입니다.
즉 긴 컨텍스트의 부담은 입력 쪽에 집중돼 있습니다. 이해가 가는 구조입니다. 컨텍스트가 길다는 것은 곧 보내는 양이 많다는 뜻이니까요.
실전에서 무엇이 달라지나
긴 문서를 통째로 넣는 작업(계약서 검토, 논문 요약, 코드베이스 분석)은 입력이 압도적으로 많은 형태입니다. 그런데 입력이 정확히 2배가 되는 구간이므로 총액도 거의 2배가 됩니다.
gpt-5.6-sol로 긴 문서 100만 토큰을 넣고 짧게 요약(1만 토큰)받는 경우를 계산해 보겠습니다.
| 구분 | 입력 비용 | 출력 비용 | 합계 |
|---|---|---|---|
| Short 요율 | $4.00 | $0.20 | $4.20 |
| Long 요율 | $8.00 | $0.30 | $8.30 |
거의 정확히 2배입니다. 이 작업을 하루 10번 하면 월 기준으로 $1,260과 $2,490의 차이가 됩니다.
긴 컨텍스트 요율을 피하는 방향
- 문서를 쪼갠다. 통째로 넣는 대신 필요한 부분만 잘라 보내면 짧은 컨텍스트 구간에 머무를 수 있습니다.
- 먼저 검색해서 관련 부분만 넣는다. 문서 전체 대신 질문과 관련된 대목만 골라 보내는 방식입니다.
- 가벼운 모델로 먼저 걸러 낸다. luna로 관련 부분을 추린 뒤 sol에 넘기면, 비싼 모델에 들어가는 양 자체가 줄어듭니다.
세 번째가 특히 효과적입니다. luna의 긴 컨텍스트 입력이 $0.40인데 sol의 짧은 컨텍스트 입력이 $4.00이므로, 전처리를 싼 모델에 맡기는 것만으로 자릿수가 바뀝니다.
확인 범위
위 수치는 오픈AI 공식 요금 문서 원문과 대조했으며, 원문 표기는 “Prices per 1M tokens / Standard / Short context”입니다. 다만 Short와 Long을 가르는 정확한 토큰 경계는 저희가 원문에서 확정하지 못했습니다.
따라서 이 글은 “몇 토큰을 넘으면 Long이 된다”를 적지 않습니다. 그 경계는 API 문서를 직접 확인하시고, 실제 청구는 사용량 대시보드에서 어느 요율이 적용됐는지 보시는 편이 확실합니다. 모르는 경계를 숫자로 적는 것보다 모른다고 적는 편이 낫다고 판단했습니다.
자주 묻는 질문
내 요청이 Short인지 Long인지 어떻게 아나요?
사용량 대시보드에 적용된 요율이 표시됩니다. 예산이 중요한 작업이라면 소액으로 시험 호출을 해 보고 어느 쪽으로 잡히는지 확인하시는 편이 안전합니다.
캐시를 쓰면 긴 컨텍스트도 싸지나요?
캐시된 입력 요율도 함께 2배가 되지만, 여전히 일반 입력의 10분의 1입니다. 긴 지시문을 반복해 쓴다면 캐시 효과는 그대로 큽니다.
출력만 2배가 아닌 이유가 있나요?
요금표에 이유는 적혀 있지 않습니다. 다만 컨텍스트 길이가 부담을 주는 쪽이 주로 입력 처리라는 점과는 맞는 구조입니다.