보고서·계약서 같은 긴 문서를 요약시키는 작업은 입력이 크고 출력이 작은 구조입니다. 지금까지 다룬 작업들과 요금의 성격이 반대입니다.
그래서 절감 방법도 달라집니다. “답변을 짧게” 같은 조언이 여기서는 거의 듣지 않습니다.
이 글의 요금·조건은 2026년 8월 25일에 각 서비스 공식 페이지에서 확인한 값입니다. 이후 변경됐을 수 있습니다.
입출력 비율이 뒤집힌 작업
이 사이트에서 여러 번 적었듯 확인된 모델들은 출력 요율이 입력의 5~6배입니다. 그래서 대개 출력을 줄이는 것이 효과적입니다.
그런데 문서 요약은 그 전제가 성립하지 않습니다.
| 작업 | 입력 | 출력 | 어느 쪽이 요금을 지배하나 |
|---|---|---|---|
| 글쓰기 | 1,000 | 3,000 | 출력 |
| 챗봇 대화 | 2,500 | 200 | 입력 |
| 문서 요약 | 50,000 | 1,000 | 입력(압도적) |
50,000토큰짜리 문서를 요약할 때 출력을 1,000에서 500으로 줄여도 총액은 거의 안 변합니다. 줄일 자리는 입력 쪽입니다.
확인된 단가로 계산하기
50,000토큰 문서(A4 수십 장 분량) 하나를 1,000토큰으로 요약하는 작업입니다.
| 모델 | 입력 $ | 출력 $ | 합계 | 입력 비중 |
|---|---|---|---|---|
| 앤트로픽 Haiku 4.5 | $0.050 | $0.005 | $0.055 | 91% |
| 앤트로픽 Sonnet 5 | $0.100 | $0.010 | $0.110 | 91% |
| 앤트로픽 Opus 5 | $0.250 | $0.025 | $0.275 | 91% |
| 오픈AI luna | $0.010 | $0.0012 | $0.011 | 89% |
| 오픈AI terra | $0.100 | $0.012 | $0.112 | 89% |
어느 모델을 쓰든 요금의 90% 안팎이 입력입니다. 이 구조를 알면 절감 순서가 정해집니다.
긴 컨텍스트 요율에 걸리는지 확인한다
여기서 문서 요약만의 함정이 하나 있습니다. 오픈AI 요금표는 짧은 컨텍스트와 긴 컨텍스트의 요율이 다릅니다.
| 모델 | 짧은 컨텍스트 입력 | 긴 컨텍스트 입력 | 배수 |
|---|---|---|---|
| gpt-5.6-luna | $0.20 | $0.40 | 2배 |
| gpt-5.6-terra | $2.00 | $4.00 | 2배 |
| gpt-5.6-sol | $4.00 | $8.00 | 2배 |
긴 문서를 다루는 작업은 이 두 번째 표에 걸릴 가능성이 높습니다. 위 계산은 짧은 컨텍스트 요율을 쓴 것이므로, 걸린다면 입력 비용이 두 배가 됩니다.
어느 길이부터 긴 컨텍스트인지는 요금표에 함께 적혀 있습니다. 구조 설명은 긴 컨텍스트는 왜 두 배인가에 적었습니다.
입력을 줄이는 네 가지
| 방법 | 어떤 경우에 | 주의 |
|---|---|---|
| 필요한 절만 보내기 | 찾는 항목이 정해져 있을 때 | 어느 절인지 미리 알아야 함 |
| 한 번 요약해 두고 재사용 | 같은 문서에 여러 질문을 할 때 | 요약 과정에서 세부가 빠짐 |
| 캐시 적용 | 같은 문서를 5분 안에 반복해 물을 때 | 쓰기 비용이 1.25배, 2회 이상 재사용해야 이득 |
| 모델 내리기 | 요약 품질이 유지될 때 | 확인 없이 내리면 재작업이 늘어남 |
문서 요약에서는 캐시가 특히 잘 맞습니다. 같은 문서에 여러 번 묻는 방식이라면 첫 호출에서 캐시를 쓰고 이후 질문들이 10분의 1 요율로 읽습니다.
계산해 보면 이렇습니다. 50,000토큰 문서에 Sonnet 5로 질문 5개를 던지는 경우입니다.
| 방식 | 입력 비용 |
|---|---|
| 매번 전문 전송(캐시 없음) | $0.500 |
| 캐시 쓰기 1회 + 읽기 4회 | $0.165 |
계산: 캐시 없음은 50,000 × 5 ÷ 100만 × $2 = $0.50. 캐시는 쓰기 50,000 ÷ 100만 × $2.50 = $0.125에 읽기 50,000 × 4 ÷ 100만 × $0.20 = $0.04를 더해 $0.165입니다.
단 5분 안에 다 물어야 합니다. 앤트로픽 요금표에 캐시 유지 시간이 5분으로 명시돼 있습니다.
월 단위 예시
하루 20건, 월 400건의 문서를 요약하는 경우입니다(각 50,000토큰 입력, 1,000토큰 출력).
| 모델 | 월 400건 |
|---|---|
| 앤트로픽 Haiku 4.5 | $22 |
| 앤트로픽 Sonnet 5 | $44 |
| 앤트로픽 Opus 5 | $110 |
| 오픈AI luna | $4.5 |
이 규모에서는 모델 선택이 월 100달러를 가릅니다. 요약이라는 작업이 최상위 모델을 요구하는지부터 시험해 보실 만합니다.
자주 묻는 질문
왜 출력을 줄이라는 조언이 여기선 안 통하나요?
요금의 90%가 입력이기 때문입니다. 출력을 절반으로 줄여도 총액은 5% 남짓 줄어듭니다.
문서를 쪼개서 보내면 싸지나요?
총 토큰 수가 같으면 싸지지 않습니다. 다만 필요한 절만 골라 보내면 총 토큰이 줄어 싸집니다. 쪼개기 자체가 아니라 덜 보내는 것이 절감입니다.
50,000토큰이 몇 페이지인가요?
저희는 배수를 적지 않습니다. 언어와 서식에 따라 달라지기 때문입니다. 자기 문서를 실제로 넣어 사용량을 확인하시는 편이 정확합니다.
캐시 5분이 짧지 않나요?
짧습니다. 그래서 사람이 띄엄띄엄 묻는 방식에는 안 맞고, 질문들을 미리 준비해 연달아 던지는 방식에 맞습니다.