본문으로 건너뛰기
AI 구독·도구 요금과 사용법

문서 요약 비용 — 입력이 90%인 작업 (2026년 8월)

보고서·계약서 같은 긴 문서를 요약시키는 작업은 입력이 크고 출력이 작은 구조입니다. 지금까지 다룬 작업들과 요금의 성격이 반대입니다.

그래서 절감 방법도 달라집니다. “답변을 짧게” 같은 조언이 여기서는 거의 듣지 않습니다.

이 글의 요금·조건은 2026년 8월 25일에 각 서비스 공식 페이지에서 확인한 값입니다. 이후 변경됐을 수 있습니다.

입출력 비율이 뒤집힌 작업

이 사이트에서 여러 번 적었듯 확인된 모델들은 출력 요율이 입력의 5~6배입니다. 그래서 대개 출력을 줄이는 것이 효과적입니다.

그런데 문서 요약은 그 전제가 성립하지 않습니다.

작업 입력 출력 어느 쪽이 요금을 지배하나
글쓰기 1,000 3,000 출력
챗봇 대화 2,500 200 입력
문서 요약 50,000 1,000 입력(압도적)

50,000토큰짜리 문서를 요약할 때 출력을 1,000에서 500으로 줄여도 총액은 거의 안 변합니다. 줄일 자리는 입력 쪽입니다.

확인된 단가로 계산하기

50,000토큰 문서(A4 수십 장 분량) 하나를 1,000토큰으로 요약하는 작업입니다.

모델 입력 $ 출력 $ 합계 입력 비중
앤트로픽 Haiku 4.5 $0.050 $0.005 $0.055 91%
앤트로픽 Sonnet 5 $0.100 $0.010 $0.110 91%
앤트로픽 Opus 5 $0.250 $0.025 $0.275 91%
오픈AI luna $0.010 $0.0012 $0.011 89%
오픈AI terra $0.100 $0.012 $0.112 89%

어느 모델을 쓰든 요금의 90% 안팎이 입력입니다. 이 구조를 알면 절감 순서가 정해집니다.

긴 컨텍스트 요율에 걸리는지 확인한다

여기서 문서 요약만의 함정이 하나 있습니다. 오픈AI 요금표는 짧은 컨텍스트와 긴 컨텍스트의 요율이 다릅니다.

모델 짧은 컨텍스트 입력 긴 컨텍스트 입력 배수
gpt-5.6-luna $0.20 $0.40 2배
gpt-5.6-terra $2.00 $4.00 2배
gpt-5.6-sol $4.00 $8.00 2배

긴 문서를 다루는 작업은 이 두 번째 표에 걸릴 가능성이 높습니다. 위 계산은 짧은 컨텍스트 요율을 쓴 것이므로, 걸린다면 입력 비용이 두 배가 됩니다.

어느 길이부터 긴 컨텍스트인지는 요금표에 함께 적혀 있습니다. 구조 설명은 긴 컨텍스트는 왜 두 배인가에 적었습니다.

입력을 줄이는 네 가지

방법 어떤 경우에 주의
필요한 절만 보내기 찾는 항목이 정해져 있을 때 어느 절인지 미리 알아야 함
한 번 요약해 두고 재사용 같은 문서에 여러 질문을 할 때 요약 과정에서 세부가 빠짐
캐시 적용 같은 문서를 5분 안에 반복해 물을 때 쓰기 비용이 1.25배, 2회 이상 재사용해야 이득
모델 내리기 요약 품질이 유지될 때 확인 없이 내리면 재작업이 늘어남

문서 요약에서는 캐시가 특히 잘 맞습니다. 같은 문서에 여러 번 묻는 방식이라면 첫 호출에서 캐시를 쓰고 이후 질문들이 10분의 1 요율로 읽습니다.

계산해 보면 이렇습니다. 50,000토큰 문서에 Sonnet 5로 질문 5개를 던지는 경우입니다.

방식 입력 비용
매번 전문 전송(캐시 없음) $0.500
캐시 쓰기 1회 + 읽기 4회 $0.165

계산: 캐시 없음은 50,000 × 5 ÷ 100만 × $2 = $0.50. 캐시는 쓰기 50,000 ÷ 100만 × $2.50 = $0.125에 읽기 50,000 × 4 ÷ 100만 × $0.20 = $0.04를 더해 $0.165입니다.

단 5분 안에 다 물어야 합니다. 앤트로픽 요금표에 캐시 유지 시간이 5분으로 명시돼 있습니다.

월 단위 예시

하루 20건, 월 400건의 문서를 요약하는 경우입니다(각 50,000토큰 입력, 1,000토큰 출력).

모델 월 400건
앤트로픽 Haiku 4.5 $22
앤트로픽 Sonnet 5 $44
앤트로픽 Opus 5 $110
오픈AI luna $4.5

이 규모에서는 모델 선택이 월 100달러를 가릅니다. 요약이라는 작업이 최상위 모델을 요구하는지부터 시험해 보실 만합니다.

자주 묻는 질문

왜 출력을 줄이라는 조언이 여기선 안 통하나요?

요금의 90%가 입력이기 때문입니다. 출력을 절반으로 줄여도 총액은 5% 남짓 줄어듭니다.

문서를 쪼개서 보내면 싸지나요?

총 토큰 수가 같으면 싸지지 않습니다. 다만 필요한 절만 골라 보내면 총 토큰이 줄어 싸집니다. 쪼개기 자체가 아니라 덜 보내는 것이 절감입니다.

50,000토큰이 몇 페이지인가요?

저희는 배수를 적지 않습니다. 언어와 서식에 따라 달라지기 때문입니다. 자기 문서를 실제로 넣어 사용량을 확인하시는 편이 정확합니다.

캐시 5분이 짧지 않나요?

짧습니다. 그래서 사람이 띄엄띄엄 묻는 방식에는 안 맞고, 질문들을 미리 준비해 연달아 던지는 방식에 맞습니다.