터미널 출력을 90% 줄여도 청구서는 그대로다.
터미널 명령 출력을 AI 에이전트가 읽기 전에 걸러내고 압축하는 오픈소스 도구 RTK(Rust Token Killer)가 실제로 비용을 줄여주는지를 두고 검증 결과가 엇갈리고 있다. GitHub 스타 7만9천 개를 넘기며 AI 코딩 비용 절감 도구로 자리 잡았고, Claude Code 토큰을 최대 60%까지 줄일 수 있다는 X 게시물은 조회수 31만3천 회를 기록했다. 반면 큐에스마(Quesma)가 며칠간 1,500달러 이상의 토큰 비용을 들여 수행한 벤치마크에서는 뚜렷한 절감이 나타나지 않았다.
실험은 터미널 상호작용 비중이 큰 Terminal-Bench 2.1에서 진행됐다. Claude Code + Fable 5.0, OpenCode + DeepSeek V4 Pro 0813(OpenRouter 경유) 두 조합을 같은 모델 경로와 과제별 타임아웃 조건에서 각 과제당 RTK 없이 5회, RTK를 켜고 5회씩 실행했다. 거부 응답이 나온 Fable 보안 과제 4개를 제외하고 Fable 85개, DeepSeek 89개 과제, 총 1,740회 시도가 비교 대상이 됐다.
결과는 모델에 따라 방향이 갈렸다. RTK를 켰을 때 Fable은 비용이 5% 줄었지만 DeepSeek은 5% 늘었다. 통과율은 Fable 1%포인트, DeepSeek 2%포인트 낮아졌다. 실패 시도를 포함한 전체 지출을 통과 수로 나누면 Fable은 3% 저렴해지고 DeepSeek은 7% 비싸졌다. 과제마다 동일한 가중치를 준 비교에서는 Fable이 1% 더 비쌌고 0과 구분되지 않았으며, DeepSeek은 평균 17% 상승했다. 열 번 시도가 모두 통과한 DeepSeek 과제 36개만 추려도 18% 증가가 그대로 유지됐다.
Fable 쪽 절감은 사실상 단일 과제에서 나왔다. winning-avg-corewars에서 두 설정 모두 전 시도에 통과했지만 RTK 쪽이 절반 수준의 턴으로 끝났고, 나머지 과제의 절감은 1% 미만이었다. 같은 과제에서 DeepSeek은 정반대로 턴이 늘고 비용이 커졌다.
RTK가 제공하는 rtk gain 지표는 청구된 토큰 수가 아니다. 필터링 전후 명령 출력의 바이트 차이를 4로 나눈 값이다. DeepSeek RTK 시도 445회에서 RTK는 3억4,920만 토큰, 89% 절감을 보고했지만 실제 과제 비용은 오히려 더 비싸졌다. train-fasttext 과제에서는 모델이 head -1 train.txt를 두 번 요청했는데, RTK는 이 제한된 읽기를 파일 전체와 비교해 각각 1억2,050만 토큰을 아낀 것으로 계산했다. 두 호출이 비교 전체 절감 카운터의 69%를 차지했지만, 애초에 그 명령이 파일 전체를 반환할 일은 없었다.
부작용 사례도 있다. DeepSeek의 git-multibranch 시도 하나는 rtk find 0.45.0이 지원하지 않는 플래그가 들어간 find 명령을 "Use find directly" 오류로 되돌리면서 재시도마다 같은 실패를 반복해 339회 연속 오류 끝에 타임아웃됐다. 과제는 통과했지만 비용은 같은 과제의 기준 시도보다 약 9배였다. 이 문제는 이후 0.46.0에서 수정됐다.
배경에는 컨텍스트 캐싱이 있다. 에이전트 코딩에서는 턴마다 컨텍스트가 캐시되고, 이후 터미널 출력 재읽기는 대부분 캐시 읽기로 처리된다. 캐시 읽기 비용은 Fable에서 일반 입력 토큰의 1/10, DeepSeek에서 1/30 수준이다. RTK 없이 터미널 출력은 Fable 입력 토큰의 약 11%, DeepSeek의 40%를 차지했다. DeepSeek에서는 RTK가 터미널 출력 문자를 9% 줄였지만 프롬프트 토큰은 9% 늘었고, 캐시되지 않은 입력은 1% 줄고 캐시 입력은 9% 늘었다. 평균 턴의 입력은 7% 줄었으나 턴 수가 18% 늘어 총입력은 줄지 않았다. DeepSeek RTK 시도는 58개 과제에서 턴이 늘었고 그중 44개가 더 비쌌으며, 턴이 줄어든 28개 중 23개만 저렴해졌다.
실무에서 확인할 지점은 분명하다. RTK는 셸 명령만 재작성한다. Claude Code 훅은 Bash 도구를, OpenCode 플러그인은 bash 호출을 대상으로 하며 Read·Grep·Glob 같은 별도 도구는 우회한다. Claude Code의 Bash 호출 절반가량은 이미 head·tail·wc로 출력을 스스로 제한하고 있었다. 최신 프런티어 모델은 터미널을 이미 효율적으로 활용하고 있어(Fable 컨텍스트의 약 7%만 터미널 출력) 범용 비용 절감 수단으로 권하기 어렵다는 결론이다. 모델 출력과 추론이 RTK 사용 시 비용의 56%, 미사용 시 57%를 차지한다는 점도 절감 여지가 터미널 밖에 있음을 보여준다.
검증은 RTK 0.45.0, Claude Code 2.1.220, OpenCode 1.18.25, Harbor 0.20 조합에서 이뤄졌다. 3.0·4.0 대신 2.1을 쓴 이유는 비용이 통과한 과제에서만 의미를 갖기 때문이다. JetBrains의 SkillsBench도 같은 흐름을 보고했다. 낮은 노력 수준에서는 턴이 늘고, 높은 노력 수준에서는 비용이 줄지 않았다는 것이다. RTK README 자체도 출력 90% 감소가 청구서 90% 감소와 같지는 않다고 명시하고 있다.