RTK(Rust Token Killer 的缩写)是一个开源的免费命令行工具,GitHub 上已有超过 7.9 万个星标(相当于收藏数),作用是压缩 AI 编程工具读到的终端输出,从而减少 AI 的 token(计费单位)消耗。它被不少开发者当成「AI 编程省钱工具」,网上甚至有帖子宣称它能把 Claude Code 的 token 花费砍掉 60%。但独立团队 Quesma 自费 1500 多美元、实测 1740 次之后得出结论:RTK 在真实账单上几乎不省钱——Claude Code 的账单只降 5%,DeepSeek 的账单反而涨 5%,两边任务的通过率还都略有下降。「省 token」和「省账单」是两回事。

几个关键概念

token 是 AI 服务商计费的最小单位,大约相当于一个英文单词或一个汉字片段,AI 每次读写文本都按 token 计费。终端是程序员敲命令的黑色窗口,终端输出就是命令运行后打印出来的文字。AI 编程工具(也叫编码 Agent)是能自己读写文件、执行命令的 AI 助手,比如 Anthropic 的 Claude Code、开源的 OpenCode——RTK 就是给这类工具配套用的。

RTK 是怎么工作的

RTK 会改写 AI 编程工具执行的命令,把命令返回的终端输出压缩成更短的版本:比如 ls -la 原本会打印文件所有者、日期等信息,RTK 只保留文件名、权限和大小。AI 读到的文字变少,理论上要付的 token 费就变少。

Quesma 的实测

Quesma 在 Terminal-Bench 2.1(一个以终端交互为主、公开的 AI 编程能力测试基准)上,用 Claude Code 搭配 Fable 5.0 模型、OpenCode 搭配 DeepSeek V4 Pro 0813 模型,每个任务带 RTK 和不带 RTK 各跑 5 次,共 1740 次尝试,总花费超过 1500 美元。

结果和宣传相去甚远:总账单上 Fable 降了 5%(从 731 美元到 698 美元),DeepSeek 反而涨了 5%(从 51 美元到 54 美元);通过率 Fable 从 84% 降到 83%,DeepSeek 从 71% 降到 69%。按「每通过一个任务分摊的成本」算,Fable 便宜 3%,DeepSeek 贵 7%;按任务平均算,DeepSeek 每个任务成本平均涨 17%——在 36 个所有尝试都通过的任务上,涨幅仍然有 18%。

宣称的 3.49 亿 token 节省,没有变成账单上的节省

RTK 自己的统计指标 rtk gain 声称,445 次 DeepSeek 尝试共省下 3.492 亿 token(减少 89%)。但 Quesma 发现这个指标按「压缩前后输出字节差除以 4」计算,不是真正计费的 token 数;其中 69% 的「节省」来自不公平的对比——AI 只要求读文件第一行(head -1),RTK 却拿整份文件的大小做减法,把根本没读过的内容也算成节省。

终端输出在账单里的占比本来就不高:不带 RTK 时,终端输出只占 Fable 输入 token 的 7%、DeepSeek 的 26%。而且 AI 读过的内容会进入缓存,重复读取按原价的 1/10(Fable)或 1/30(DeepSeek)计费,缓存费用约占 Fable 账单的 30%、DeepSeek 账单的 26%。省下来的那点终端输出,恰好是账单里最便宜的部分。

RTK 还可能让 AI 多走往返:DeepSeek 带 RTK 时交互轮数多了 18%,每轮输入平均少 7%,但总输入反而更多;多出来的一个回合,就可能吃掉压缩省下的全部成本。JetBrains 团队在 SkillsBench 基准上的测试也得出类似结论:RTK 没有带来节省。

一次 bug 的代价

实测中 DeepSeek 有一次尝试陷入死循环:RTK 0.45.0 把一个 git-multibranch 命令改写成不支持的 find 写法,AI 每次重试都被再次改写,连续报错 339 次,耗时约 12 分钟,成本约为对照组同样通过的任务的 9 倍。该问题在 0.46.0 版本中已修复。

结论:省 token 不等于省钱

RTK 声称的大幅 token 节省,在真实账单上几乎体现不出来。对当前的主流前沿模型来说,它更像一种只在小部分场景有用的优化,而不是通用的省钱方案(对较旧的模型可能帮助更大)。如果你用它是为了省钱,先看看自己账单里终端输出和缓存的实际占比,再决定是否值得保留。