본문으로 건너뛰기
AI 구독·도구 요금과 사용법

대량 처리 요금 줄이기 — 캐시·단계 분리·출력 상한 (2026년 8월)

같은 작업이라도 급하지 않게 처리하면 요금이 내려가는 경우가 있습니다. 대량 처리를 다루는 방식이 요금과 직결되기 때문입니다.

이 글은 급한 작업과 급하지 않은 작업을 나누는 것이 왜 절감으로 이어지는지 정리합니다.

이 글의 요금·조건은 2026년 8월 25일에 각 서비스 공식 페이지에서 확인한 값입니다. 이후 변경됐을 수 있습니다.

먼저 요율 구조를 다시 봅니다

모델 입력 캐시된 입력 출력
gpt-5.6-sol $4.00 $0.40 $20.00
gpt-5.6-terra $2.00 $0.20 $12.00
gpt-5.6-luna $0.20 $0.02 $1.20

단위는 100만 토큰당 달러입니다. 대량 처리에서 총액을 좌우하는 것은 모델 선택캐시 활용입니다.

대량 처리에서 실제로 효과가 큰 세 가지

1. 고정 지시문을 앞에 두어 캐시를 태운다

1,000건의 문서를 같은 지시문으로 처리한다면, 그 지시문은 1,000번 전송됩니다. 앞부분이 완전히 같으면 캐시가 걸려 입력 요율의 10분의 1이 됩니다.

gpt-5.6-sol 기준으로 지시문이 10만 토큰이라면:

  • 캐시 없이 1,000회: 10만 × 1,000 = 1억 토큰 × $4.00/100만 = $400
  • 캐시 사용: 캐시 쓰기 $0.50 + 캐시된 입력 999회 약 $39.96 = 약 $40.46

약 10분의 1입니다. 조건은 하나 — 바뀌는 값을 지시문 중간에 넣지 않는 것입니다. 고정 부분을 앞에, 문서 내용을 뒤에 두어야 합니다.

2. 단계를 나눠 싼 모델에 대부분을 맡긴다

1,000건 중 실제로 정밀한 처리가 필요한 것은 일부인 경우가 많습니다.

  1. luna로 1,000건을 훑어 처리 대상을 골라냅니다. 입력 $0.20 요율입니다.
  2. 걸러진 100건만 sol로 정밀 처리합니다.
  3. 결과적으로 비싼 모델에는 10분의 1의 양만 들어갑니다.

전부 sol로 돌리는 것과 비교하면 총액이 자릿수 단위로 달라집니다. 1단계의 판정이 완벽하지 않아도, 놓치면 안 되는 작업이 아니라면 충분히 실용적입니다.

3. 출력 길이에 상한을 둔다

출력 요율은 입력의 5~6배입니다. 1,000건 처리에서 건당 출력이 예상보다 길어지면 총액이 크게 늘어납니다.

최대 출력 길이를 지정하면 최악의 경우가 제한됩니다. “표 형식으로 세 줄” 같은 지시를 함께 주면 실제 출력도 짧아집니다.

급하지 않다면 검토할 것

여러 서비스가 즉시 응답이 필요 없는 대량 작업을 위한 별도 처리 방식을 제공합니다. 결과를 나중에 받는 대신 요율이 낮은 구조입니다.

다만 저희가 이 방식의 요율과 조건을 오픈AI 요금 문서 원문에서 확정하지 못했습니다. 그래서 이 글에서 “몇 % 싸다”를 적지 않습니다.

대량 처리를 계획 중이라면 해당 서비스의 API 문서에서 대량 처리 관련 항목을 확인해 보시기 바랍니다. 급하지 않은 작업이라면 검토할 가치가 있는 방향입니다.

대량 처리 전 반드시

1,000건을 돌리기 전에 10건으로 먼저 시험하시기 바랍니다. 건당 실제 토큰 사용량을 확인한 뒤 1,000을 곱하면 총액을 미리 알 수 있습니다.
그리고 지출 한도를 먼저 걸어 두십시오. 대량 처리는 코드 실수가 곧 요금인 영역입니다. 재시도가 무한 반복에 빠지면 상한이 없습니다.

계산해 두면 좋은 것

대량 처리는 시작 전에 총액을 계산할 수 있다는 장점이 있습니다.

  • 건당 입력 토큰 × 건수 × 입력 요율
  • 건당 출력 토큰 × 건수 × 출력 요율
  • 캐시를 쓴다면 첫 건만 정가, 나머지는 10분의 1

이 셋을 더하면 예상 총액입니다. 10건 시험에서 나온 실제 토큰 수를 쓰면 추정이 아니라 계산이 됩니다.

자주 묻는 질문

캐시는 얼마나 유지되나요?

유지 시간에 제한이 있으며 저희가 정확한 시간을 원문에서 확정하지 못했습니다. 간격을 두고 호출하면 캐시 쓰기 요금이 다시 붙을 수 있습니다.

1단계 필터링에서 놓치면 어떻게 하나요?

놓치면 안 되는 작업이라면 이 방식이 맞지 않습니다. 판정 기준을 느슨하게 잡아 후보를 넉넉히 넘기는 방법도 있습니다.

병렬로 돌리면 더 빠른가요?

빠르지만 요금은 같습니다. 호출 빈도 제한이 있을 수 있으니 문서를 확인하시기 바랍니다.

대량 처리에도 긴 컨텍스트 요율이 적용되나요?

입력이 길면 적용됩니다. 문서를 쪼개 넣으면 짧은 컨텍스트 구간에 머무를 수 있습니다.