[연재] 공짜 조수에게 일을 넘기면 얼마나 아낄까요 — 계산해 보니 1%였습니다
1%라는 숫자가 나왔습니다
계획은 단순했어요. 비싼 요금제를 한 단계 내리고, 그만큼 빠지는 일은 공짜로 쓸 수 있는 다른 모델에게 넘기자.
그래서 지난 일주일 동안 쓴 양을 뜯어봤습니다. 제가 부리는 AI는 일을 받으면 혼자 다 하지 않고, 부피 큰 일은 더 싼 모델에게 하청을 줍니다. 그 하청 몫이 전체의 17~28%였어요. 이걸 통째로 공짜 모델에게 넘기면 요금제를 내릴 수 있겠다 싶었죠.
그런데 하청을 일의 종류별로 나눠 보니 이랬습니다.
| 하청 일의 종류 | 하청 사용량 중 몫 |
|---|---|
| 브라우저 화면 조작 | 60% |
| 파일 고치기 | 24% |
| 명령 실행 | 14% |
| 글 읽기·웹 조사만 | 2% |
공짜 모델에게 넘길 수 있는 건 맨 아래 줄뿐이었어요. 전체로 치면 1% 안팎입니다.
이번 편은 이 숫자에 닿기까지의 이야기예요. 시작은 가격표였습니다.
같은 날, 가격표가 한꺼번에 흔들렸습니다
9월 22일에 Anthropic은 Claude Opus 5.5를, OpenAI는 GPT-6 Sol과 Luna를 내놨습니다. 같은 날이었어요.
가격만 보면 다 내렸습니다.
- Opus는 5에서 5.5로 오면서 20% 내렸습니다.
- GPT의 Sol은 5.6의 $4/$20에서 6의 $2/$10으로 절반이 됐습니다.
- Luna는 성능은 거의 그대로인데 값이 반 이하로 내려갔습니다.
마침 8월부터 GPT 쪽으로 옮겨 가는 사람이 많다는 얘기가 들리던 참이었어요. 한 모델 중개 사이트에서는 9월 첫 주에 두 회사에 쓴 돈이 2년 반 만에 처음 뒤집혔다는 기사도 나왔고요. 처음엔 치킨게임인가 싶었습니다.
점수표를 펴 보니, 이름이 등급을 속이고 있었어요
가격만 보면 판단이 안 서서 점수를 모았습니다. 한 평가 사이트(Artificial Analysis)가 여러 회사 모델을 같은 조건으로 재 놓은 표가 있어요.
| 모델 | 종합 점수 | 실제 쓰임새로 환산한 가격 (100만 토큰당) |
|---|---|---|
| Claude Opus 5.5 | 58 | $2.94 |
| Claude Fable 5.1 | 53 | $7.18 |
| GPT-6 Astra | 53 | $7.70 |
| GPT-6 Sol | 48 | $1.54 |
| Gemini 3.8 Flash | 41 | $0.58 |
| Claude Sonnet 5 | 38 | $1.54 |
| GPT-6 Luna | 37 | $0.08 |
여기서 두 가지가 눈에 걸렸습니다.
하나, GPT-6 Sol은 이름만 Sol이었어요. GPT-5.6 때는 Sol이 맨 위였고, 그 아래에 Terra와 Luna가 있었습니다. 6에서는 맨 위에 Astra가 새로 생기고, Terra는 사라지고, Sol이 Terra가 있던 가운데 자리로 내려왔어요. 값도 Terra와 거의 같습니다. 그러니 "절반으로 내렸다"기보다 자리를 한 칸 내려 앉은 것에 가깝습니다. 사는 쪽에서는 옛 Sol만 한 성능을 Terra 값에 사는 셈이라 이득이긴 해요.
둘, 맨 위 두 모델이 Opus 5.5보다 낮았습니다. 값이 두 배 넘는 Fable 5.1과 GPT-6 Astra가 종합 점수 53인데, Opus 5.5가 58이에요. 터미널 작업, 고난도 지식 시험, 업무 자동화, 지식 정확도까지 전부 Opus가 앞섰습니다.
결론은 싱거웠어요. 깊이 생각해야 하는 일은 떠날 수가 없더라고요.
대신 부피 큰 일은 싼 쪽으로
그렇다고 모든 일을 비싼 모델에게 시킬 필요는 없습니다. 표를 다시 보면 싼 쪽도 쓸 만해요.
- GPT-6 Luna는 종합 37점을 100만 토큰당 8센트에 냅니다. Claude Sonnet 5와 점수는 거의 같은데 값은 20분의 1이에요.
- Gemini 3.8 Flash는 41점에 58센트인데, 저는 이미 내는 구독 안에서 쓰고 있어서 사실상 공짜입니다. 모르는 걸 지어내지 않는 정도를 재는 점수(지식 정확도)는 30으로, GPT-6 Sol(27)보다도 높았어요.
그러니 판단은 Opus가 하고, 글을 읽고 정리하는 일은 Flash에게 넘기는 구성이 맞겠다 싶었습니다.
다른 도구로 섞어 쓰면 되지 않나
여기서 한 번 옆길로 샜어요. 여러 회사 모델을 한 화면에서 골라 쓰는 도구가 있거든요. 대표적인 게 OpenCode입니다. 거기서 메인을 싼 모델로 잡고 필요할 때만 Claude를 부르면 어떨까 싶었죠.
규정을 찾아보니 회사마다 달랐습니다.
| 구독 | 다른 회사 도구에서 쓰기 |
|---|---|
| ChatGPT | 됩니다. OpenCode가 공식으로 지원해요 |
| Claude | 안 됩니다. Anthropic이 명시적으로 막았어요 |
| Google (Antigravity) | 약관 위반입니다. 계정 정지 사유로 적혀 있어요 |
막힌 건 로그인 정보를 빼서 다른 도구가 직접 서버에 묻는 방식이었어요. 그 회사가 만든 명령 도구를 그대로 실행하는 건 사정이 다릅니다. 제가 지금 Claude 쪽에서 Gemini를 부르는 방식이 이거예요. Gemini가 만든 명령 도구에 질문을 넘기고, 답을 글자로 받아 옵니다.
그리고 메인을 약한 모델에게 맡기면 순서가 거꾸로 됩니다. 누구에게 무엇을 넘길지 정하고 결과를 고르는 게 메인의 일인데, 그 자리를 가장 약한 모델에게 주는 셈이니까요. 그래서 원래대로 가기로 했습니다. 메인은 Claude, 조수는 Flash.
공짜 조수에게 웹 조사를 맡긴 첫날
점수표를 모으는 일을 Flash에게 시켜 봤습니다. 모델 11개, 항목 6개, 66칸이에요.
첫 판은 10초 만에 빈손으로 돌아왔습니다. 화면 없이 돌리면 "웹페이지를 열어도 되냐"고 물을 수가 없어서 자동으로 거부된 거예요. 그 사이트만 열어 주니 이번엔 숫자를 더 뽑겠다고 명령을 이어 붙여 쓰다가 또 막혔습니다. 명령을 쓰지 말라고 적어 줘도 썼어요.
결국 권한을 통째로 열어 줬습니다. 이건 제가 정했어요. 대신 Flash가 이 컴퓨터에서 무엇이든 묻지 않고 실행할 수 있게 된다는 뜻이라, 공개된 웹페이지 조사에만 쓰기로 선을 그었습니다.
그러고 나니 결과가 나왔습니다.
- 걸린 시간: 173초
- 66칸 중 이미 원문으로 확인해 둔 46칸: 전부 일치
- Claude 쪽 한도에서 나간 양: 약 1천 토큰. 같은 일을 하청으로 돌렸을 때(18만 토큰)의 180분의 1
길을 뚫는 데 실패 네 번, 권한 설정 세 번, 15분쯤이 들었습니다. 한 번만 드는 값이에요.
그런데 왜 1%밖에 안 줄까요
180분의 1이면 엄청 아낀 것 같은데, 처음 계산으로는 전체의 1%였습니다. 이유는 두 가지예요.
첫째, 하청 대부분이 넘길 수 없는 일이었습니다. 로그인된 브라우저를 만지고, 파일을 고치고, 명령을 실행하는 일이에요. 글만 읽는 일은 2%뿐이었습니다. 다만 브라우저 작업 중에는 공개 페이지를 여는 일도 섞여 있어서, 그것까지 Flash로 넘기면 전체의 10~17%까지는 줄일 수 있습니다. 그래서 이제는 공개 페이지라면 브라우저가 필요해 보여도 Flash에게 먼저 맡겨요.
둘째, 한도를 가장 많이 먹는 건 하청이 아니라 메인이었습니다. 전체의 70~83%요. 대화가 길어질수록 앞에 쌓인 내용을 매번 다시 읽기 때문입니다. 조수를 아무리 싸게 바꿔도 이 몫은 그대로예요. 요금제를 내리려면 조수를 바꾸는 것보다 대화를 짧게 끊는 게 훨씬 크게 듭니다.
이번에 사람이 붙잡은 자리
돌아보면 이번에도 제 몫은 세 군데였어요.
- "저게 진짜 Sol이야?" 표에 모델 이름을 줄여 적었을 때, 같은 이름 아래 등급이 바뀌었다는 걸 먼저 눈치챈 건 저였습니다. 점수표는 이름을 믿고 읽으면 틀려요.
- 권한을 여는 결정. 조수가 막힐 때마다 AI는 멈추고 물었습니다. 어디까지 열지는 제가 정했어요.
- "1%"를 보고 방향을 바꾼 것. 숫자가 나오기 전까지는 조수만 바꾸면 요금제를 내릴 수 있을 줄 알았습니다.
일단 싼 요금제로 버텨 보려고요. 안 되면 한 단계 위로 돌아가면 됩니다. 그것도 해 보고 숫자로 정할 생각입니다.