AI 서브에이전트로 글 한 편에 95만~117만 토큰: 제작과 검수를 따로 재야 한다

답부터 말하면 2026년 9월 13일 세 편의 운영 기록에서 deep 서브에이전트 제작은 편당 95만~117만 토큰, 11~15분으로 보고됐다.
같은 기록의 짧은 이미지 교차 검수는 편당 3.5만~5만 토큰, 약 1분이었다.

다만 이 숫자는 원시 사용량 내역이나 청구서가 아니다.
당시 작업을 마친 뒤 남긴 운영 보고값이다.
그래서 달러 비용으로 바꾸지 않고, 어떤 역할에 토큰이 몰렸는지만 본다.

AI 서브에이전트로 글 한 편을 만든 토큰 운영 기록




글 한 편에 왜 100만 토큰 가까이 들었나?

이때 말한 ‘글 한 편’은 본문만 쓰는 호출이 아니었다.
1차 출처를 찾고, 계산과 표를 확인하고, 이미지와 렌더러를 만들고, 검증 자료까지 남기는 묶음 작업이었다.
여기서 deep은 조사와 검증까지 길게 맡기는 서브에이전트 작업 범주이고, 리드는 작업을 나눠 주고 결과를 검증하는 메인 에이전트다.

운영 보고에는 9월 13일 세 편이 각각 95만~117만 토큰을 썼다고 적혀 있다.
걸린 시간은 11~15분이었다.
9월 14일 정리한 결정 기록에는 deep 제작 비용이 편당 70만~184만 토큰으로 적혀 있다.

두 범위가 왜 다른지는 확인하지 못했다.
결정 기록에는 어떤 글 몇 편을 셌는지 적혀 있지 않다.
그래서 제목에는 같은 날 만든 세 편의 범위만 쓰고, 70만~184만은 작업마다 폭이 컸다는 보조 기록으로만 본다.




많이 쓴 만큼 무엇이 남았나?

같은 운영 기록은 9월 13일 deep 제작 세 편과, 9월 14일 리드가 서브에이전트 없이 직접 쓴 세 편의 산출물을 비교했다.
deep 글은 본문 1,737~1,887자, 출처 링크 2~5개였다.
리드 작성 글은 767~908자, 출처 링크 1개였다.

deep 쪽에는 evidence.md가 있었고, 예금·적금 글은 원본 HTML 9개도 보관했다.
리드 작성 쪽에는 근거 문서와 원문 아카이브가 없었다.
그래서 토큰 차이가 문장 길이만의 차이는 아니었다고 본다.

2026-09-13 deep 제작과 2026-09-14 리드 직접 작성의 당시 비교
항목deep 제작 3편리드 작성 3편
본문 분량1,737~1,887자767~908자
출처 링크2~5개1개
표1개1~2개
근거 문서있음없음
원문 보관한 글에 HTML 9개없음
정확한 토큰 비교95만~117만 보고세션 누적으로 분리 불가

그렇다고 더 긴 글이 자동으로 더 좋은 글은 아니다.
작성 주체를 가린 평가에서 deep은 사실 정확성과 유용성이 각각 5대4로 앞섰고, 리드 작성은 가독성이 4대3으로 앞섰다.
비용과 품질을 한 숫자로 묶을 수 없는 이유다.




제작보다 검수가 왜 훨씬 작았나?

짧은 검수는 새 글을 처음부터 만들지 않았다.
이미 나온 이미지 6장을 교차 확인하고 단위 오류를 찾는 좁은 역할이었다.
당시 보고값은 편당 3.5만~5만 토큰, 약 1분이다.

같은 보고에는 deep이 만든 9월 12일 환율 글 이미지의 단위 오류(‘50원’ → ‘KRW/USD’)를 검수에서 잡았다는 기록도 있다.
다만 그 오류를 이 짧은 검수가 잡았는지는 기록에서 구분되지 않는다.
어느 쪽이든 검수는 출처와 구조를 처음부터 만드는 역할을 대신하지 않는다.

제작과 짧은 검수, 두 역할의 보고 토큰 비교

이 차이는 피트스톱과 경주 전체의 차이에 가깝다.
둘 다 완주에 필요하지만 맡은 구간이 다르다.
따라서 “검수가 20배 이상 효율적이다”처럼 같은 일의 성능 비교로 읽으면 안 된다.




그렇다면 역할을 어떻게 나누면 되나?

  1. 완료 조건을 고정한다.
    본문, 출처, 이미지, evidence.md 가운데 무엇까지 한 작업인지 적는다.
  2. 제작과 검수를 별도 task로 실행한다.
    검수에는 단위, 계산, 링크, 이미지와 본문 일치처럼 찾을 오류를 좁혀 준다.
  3. task별 usage와 결과를 저장한다.
    모델, 시작·종료 시각, 입력·출력·캐시 토큰, 재시도, 최종 상태를 함께 남긴다.

지금 기록에는 총토큰 보고값만 있어 모델별 단가를 적용할 수 없다.

에이전트와 모델 라우팅 구조는 omo 하네스란? 에이전트·모델 라우팅·프롬프트 구조 읽기에 정리했다.
단일 응답에서 비용이 새는 경로는 “ok” 한 마디에 $0.07 — AI 코딩 도구 비용은 어디서 새는가에서 다뤘다.
이번 기록은 한 호출의 가격이 아니라 글 한 편의 제작 역할을 어디까지 묶었는지에 초점을 둔다.




어떤 조건에서 결론이 뒤집히나?

같은 완료 조건으로 원시 usage를 다시 수집했을 때 제작 토큰이 크게 낮아지면 95만~117만은 현재 기준으로 쓸 수 없다.
리드 작성도 evidence.md와 원문 보관까지 포함하면 당시의 ‘훨씬 적음’이라는 차이가 줄 수 있다.

당시 운영 결정에도 뒤집는 조건이 붙어 있었다.
리드가 ‘결론이 뒤집히는 조건’ 같은 필수 요건을 지켜 쓴 글이 다시 블라인드 평가에서 이기거나 비슷하면, 비용 때문에 리드 작성으로 돌린다는 조건이다.
이 재평가는 아직 하지 않았다.

또한 100만 토큰을 쓴 작업이 WebSocket 오류로 끝나 근거 문서를 남기지 못한 기록도 있다.
완료하지 못한 task는 산출물당 비용을 오히려 키운다.
토큰 총량보다 완료 상태를 함께 봐야 한다.

결국 기준은 서브에이전트를 몇 개 썼는지가 아니다.
한 task에 어디까지 맡겼고, 어떤 산출물을 남겼으며, 실패를 포함해 얼마를 썼는지가 기준이다.
다음 작업부터 역할별 usage와 완료 상태를 한 줄에 같이 남기면 된다.




결론 · 제작과 검수를 따로 잰다

이 기록의 답은 서브에이전트가 비싸다는 데서 끝나지 않는다.
선택 기준은 편당 총토큰 하나가 아니라 동일한 완료 조건에서 남긴 산출물과 완료 상태다.
지금 할 일은 다음 작업부터 제작과 검수를 분리하고 역할별 사용량과 결과를 함께 남기는 것이다.




확인 범위

이 글은 2026년 9월 13~14일 남은 로컬 운영 보고와 결정 기록을 2026년 9월 28일 다시 확인해 썼다.
수치는 API 청구서가 아닌 보고값이며, 입력·출력·캐시 구분과 모델별 가격은 확인하지 못했다.

브라우저 편집·발행의 역할별 토큰, 같은 과제의 반복 측정, 사람 검수 대비 누락률도 측정하지 않았다.
따라서 달러 비용, 절감률, 서브에이전트 일반 성능으로 확대하지 않는다.

댓글

이 블로그의 인기 게시물

AI 코딩 스킬, 많을수록 좋을까 — 자산이 부채로 바뀌는 손익분기

Opus 5는 더 잘 쓰고, 더 AI답게 쓴다 — 세 모델 첫날 실측

M4 Max 128GB 로컬 LLM 4종 속도 비교 — 실측 기록과 한계