VibeCoding 省钱指南 · 保姆级教程

高效对话与省钱第 5 / 7 篇

本文由 7 集视频的语音转写稿整理而成,系统梳理了「用 AI 编程时如何省 token / 省钱」的完整方法论。 面向对象:用 Claude Code / Codex / OpenCode 等编码 agent 做 VibeCoding 的个人开发者(尤其是小白)。

阅读方式:先读第 0、1 章建立心智模型,再按第 2 章学会看账单,最后四个心法(第 3–6 章)按需实操。

写作日期:2026-08-24|复核:2026-09-07

📌 这一篇没有可机器核实的锚点,说清楚比硬编一条判据有用。

复核时按同批文章的做法找了一圈:没有可安装的包名、没有可访问的项目仓库、 没有本文自己断言的 CLI 命令 —— 它是方法论整理,正文讲的是 「缓存怎么命中」「会话怎么切」这类不随某个版本号变的东西。 ⇒ 因此正文一处未改,也没有 🔔 判据可给。

⚠️ 真正会过期的是那几个引用来的数字,而它们本来就不是本文实测的:

  • 第 2 章那组 $1.38 / $61、命中率 95%–99% 出自 Reasonix 官方案例;
  • 「命中/未命中差 120 倍」是视频口播,正文当场已用 DeepSeek 的公开定价 (命中价约为未命中价的 1/10)做过对冲,并写明「数字口径不同」。

📌 所以读它的正确姿势:记住结论的方向(缓存命中是省钱大头),别记具体倍数。 要当天的准确数字,去你实际用的那家的定价页看 —— 那是唯一权威, 而任何教程里的价格都只是某一天的快照。

目录


第 0 章:先建立一个正确的成本认知

成本公式

一次调用成本 = 输入成本 + 输出成本

  • 输出成本 = 输出 token 数 × 输出单价 → 好算。
  • 输入成本 = 受缓存命中率影响巨大。缓存命中和不命中,价格天差地别(某些模型差价可达 120 倍)。
  • (缓存写入成本一般单独计,但影响不大,通常只写一次,个人 VibeCoding 可忽略。)
  • (私有化部署 + 微调是企业级方案,个人不考虑。)

最重要的一句话:成本 ≠ 单价

这是整套指南的核心认知。

  • 同一个任务,A 模型一次就解决;B 模型来回折腾很多轮。
  • B 模型单价虽便宜,但循环轮数多,总成本反而可能更高。
  • 所以「便宜的模型」不等于「省钱」,「贵的模型」也不等于「烧钱」——要看总账,不要看单价。

📌 规律:通常 80% 的费用由 20% 的对话产生,而这 20% 对话的共性就是——循环轮数特别多。


第 1 章:四个省钱心法(全局地图)

有了成本公式,省钱就是四个方向:

# 心法 作用点 对应工具 难度
1 降低单价 杀鸡不用牛刀,按任务把请求路由到不同价位的模型 LLM 路由 / Claude Code Router ⭐⭐⭐(最难实操,省钱空间最大)
2 减少 token 输入端 + 输出端减 token,但不能丢信息 RTK / Caveman ⭐(小白最容易上手)
3 提高缓存命中率 用对厂商 agent + 做好可观测性 Reasonix(DeepSeek 专用) ⭐⭐
4 减少循环次数 砍掉不必要的往返(尤其探索阶段) CodeGraph + 工程化手段 ⭐⭐(真正的成本杀手)

建议学习顺序:先看账单(第 2 章)→ 再从最容易的减 token(第 3 章)入手 → 逐步到循环、缓存、路由。

视频 ↔ 本文章节对照(方便对着视频看)

视频集数 主题 本文章节
第 1 集 总纲:公式 + 四心法 第 0、1 章
第 2 集 怎么看每次对话消耗的 token 第 2 章(agenttrace)
第 3 集 RTK 节省 80% token 第 3.1 节
第 4 集 Caveman skill 第 3.2 节
第 5 集 CodeGraph 砍掉探索循环 第 4 章
第 6 集 Reasonix 把 DeepSeek 成本砍到 1/5 第 5 章
第 7 集 LLM 路由 第 6 章

第 2 章:先学会看账单(可观测性)

想省钱,先学会看。你得知道成本花在哪里,才能有针对性地优化。

目标产物

一份分析报告,包含:

  • token 消耗量 & 预估费用
  • 费用增长的原因
  • 健康度趋势评分
  • 最近事件列表 / 最近对话
  • 按 agent 分组统计 / 按模型分组统计
  • 最近对话的异常点

使用的工具:agenttrace

✅ 已核对:原视频语音转写为 “entrance / agentchance”,实为 agenttrace(github.com/luoyuctl/agenttrace)——一个本地优先、分析本地 agent 日志的开源 TUI 工具,支持 Claude Code / Codex / Gemini CLI / OpenCode / Aider / Cline 等的会话日志。star 较少(niche 工具)但对个人非常实用。

常用命令:

agenttrace                                   # 打开本地 TUI
agenttrace --doctor                          # 检查检测到的 agent 日志目录
agenttrace --overview -f html -o report.html # 生成 HTML 概览报告
agenttrace --overview -f json                # 生成机器可读报告(可用于 CI)

核心功能:

  1. 生成概览报告:agenttrace --overview -f html 即可生成总览页面(也支持 json / markdown)。
  2. TUI 交互界面:进入「对话列表」,可按花费或对话轮数排序。
  3. 单次对话明细:进入花费最高的那次对话,可看到:
    • 用了多少 token、调用了多少次工具
    • 输入/输出各用多少 token、缓存命中了多少 token
    • 工具使用情况、思考深度和花费
  4. 诊断功能:看不出问题没关系,它能直接帮你诊断成本为什么高。
    • 视频实例:一眼看到「上下文爆了」——模型上限 20 万,实际跑到 36 万,AI 没做好上下文压缩,由此引发大量无用工具循环。
  5. 对比(diff)功能:对比两次对话的花费、token、循环轮次、工具调用次数等,针对特定任务调优时很好用。

局限:细节还不够完善(作者自用工具,够用即止)。

本章要点

学会看每次对话的细节 → 知道钱花在哪 → 才能开始有针对性地省钱。后面四个心法,都建议配合这个观测工具使用。


第 3 章:心法一 · 减少 token

减 token 分输入端和输出端,是小白最容易上手的方向。

3.1 输入端:RTK(Rust Token Killer)

它是什么

  • 全名 Rust Token Killer。很多常用命令会输出大量无用样例/重复内容,污染上下文、增加成本,还会因为上下文被污染而降低模型输出质量。
  • RTK 用 Rust 重写了大量命令,压缩掉噪声;并以插件形式,在你的 agent 真正调用命令之前,给命令加上 rtk 前缀,换成 RTK 优化过的版本。

效果

  • 开发机器约省 80%;创意写作机器约省 52%。
  • ✅ 无损减 token——不丢信息,反而因为上下文更干净而提升推理质量。

已核对:仓库 github.com/rtk-ai/rtk,Apache-2.0,零依赖零配置单一二进制,每条命令开销 < 10ms。自动拦截压缩 100+ 常见命令(git / cargo / npm / ls / cat / find / grep 等)。可配合 Claude Code / Cursor / Codex / Aider / Cline / Gemini CLI / OpenCode 使用(不止 OpenCode)。

怎么用(保姆级步骤)

  1. 执行官方快速安装命令(见项目 GitHub)。
  2. 安装对应 agent 的接入配置:
    • OpenCode 全局接入:rtk init -g --opencode
    • 其他 agent:手动在命令前加 rtk 前缀即可获得同样效果。
    • ⚠️ 注意:Claude Code 内置的 Read / Grep / Glob 不走 hook,想要同样压缩效果请用 shell 等价命令(rtk read / rtk grep / rg)。
  3. 装完第一件事:执行
    rtk discover        # 预估「你没用 RTK 亏了多少 token」
    rtk gain            # 实时追踪已节省的 token
    discover 会统计比如 1000 多个命令没走 RTK、少省约 100K token,就约等于亏了 100K。

建议:✅ 推荐全局开启。 局限:只针对命令。其他减 token 场景需要别的工具(见 3.2)。

官方实测参考:cargo test 省 91.8%、git status 省 80.8%、grep 省 49.5%;基于 2900+ 真实命令平均去除 89% 噪声。与视频里「开发机 ~80%、创意机 ~52%」一致。


3.2 输出端:Caveman skill

它是什么

  • 一个 skill,宣称能节省 75% 输出 token。
  • 本质是提示词工程,核心就一句话:「像一个聪明的原始人一样简洁地回答,保留所有技术内容,只删掉无关紧要的废话。」
  • 和 RTK(要装命令/插件)不同,它只是让大模型简洁输出的提示词,实际效果取决于你用的模型。

⚠️ 关键区别:这是「有损」的

  • RTK 是无损省 token;Caveman 是有损的,不适合所有场景。
  • ✅ 适合:生成代码等你根本不会去读中间过程的场景。
    • 例:用 SuperPowers 之类的框架定好计划后,让 subagent 干活时——你不会看 subagent 说了啥,废话越少越好,只要结果对。
  • ❌ 不适合:思维风暴、技术选型、计划制定、创意协作。这些场景绝对不能开。
  • 📌 拿不准什么时候开、什么时候关?那就别开。(对比:RTK 推荐全局开。)

彩蛋:同仓库的 caveman-compress(推荐用)

  • 作用:压缩 CLAUDE.md / AGENTS.md 这类给 agent 看的上下文文件。
  • 虽然省的 token 不多,但能提升模型的推理和生成质量。
  • 背景理念:少即是多。init 命令生成的 CLAUDE.md 往往又臭又长,建议一定要处理。

延伸:上下文要做减法

  • 大模型自己知道的、能根据已知推导的、自己能探索到的,就不要往 CLAUDE.md 里塞。
  • 上下文不是越多越好。像那些号称「记忆化」的 agent,设计时最重要的其实不是「记住什么」,而是**「忘记什么」**。加法谁都会做,优雅地做减法才是难点。
  • ⚠️ 软件工程没有银弹,「记忆化」不能一劳永逸;真做生产力工具,还是要靠编码。

第 4 章:心法二 · 减少循环次数(CodeGraph)

为什么循环是「成本杀手」

回看公式,它只写了单次调用成本。因为每次调用成本不同,所以:

一次对话总成本 = 每轮调用成本相加之和(≠ 单次成本 × 轮数)

循环轮数看上去不在公式里,所以最容易被忽略——但它才是真正的成本杀手。你看账单会发现:循环轮数和成本基本成正比。

  • 循环轮数 = 你自己发消息的轮数 + agent 自身的工具循环轮数。
  • 引入一个参数:任务难度。正常情况下,任务难度 ∝ 循环轮数 ∝ 成本。
  • ⚠️ 最难受的情况:因为爱用「目标驱动 + 无人值守」偷懒,睡一觉起来账单爆炸——一个简单任务烧了大量 token。目标驱动里,目标定错了,对钱包是致命的(SuperPowers 定计划那期就是教你避免这个)。

优化原则:像优化 MySQL 一样——不要过早优化。别每个都看,专挑循环轮数特别高的对话来处理。

CodeGraph 解决的是「探索阶段」的循环

  • 现在的大模型基本都内化了「先探索 → 再澄清 → 最后干活」的流程。
  • 在大型项目里,最浪费 token 的就是探索阶段:为了找到一个小需求的修改点,agent 反复 grep / ls / read,产生大量工具调用、往返通信和噪声。

业界两种方案:

  1. 语义化(向量)检索——如 Cursor 走的路线。
  2. 知识图谱——CodeGraph 走的路线(本章重点)。

CodeGraph 原理:先把代码关系建成图谱,使用时一次性把所有相关内容返还给 agent,省掉反复探索的往返。

适用边界(重要):

  • 📈 项目规模越大越省、越值得用;很小的项目没必要用。
  • 支持常见框架和开发语言(具体见项目文档)。

第 5 章:心法三 · 提高缓存命中率(Reasonix)

小白版策略:选对 agent

每个模型提供商的缓存策略都不一样。自己做 AI 应用要按模型设计缓存架构;但对小白,提高缓存命中率就一条:用哪家的模型,就用哪家的 agent。

你用的模型 就用的 agent
GPT Codex
Claude(Opus 等) Claude Code
豆包 豆包自家 agent

道理:虽然都是「套壳」,但各家针对自家模型一定会做针对性的缓存优化。

⚠️ 两个大坑

  1. Codex 不要接第三方模型。 Codex 和 GPT 系列耦合很深,接 DeepSeek 之类费半天劲、发挥不出效果、还一堆问题。想用便宜模型请换 agent。
  2. 接第三方模型要对产出有预期。 参考评分:
组合 效果评分 成本
Codex + GPT 80 分 基准
Codex + DeepSeek 50 分(❌ 不推荐) —
Claude Code / OpenCode + DeepSeek 70 分 基准
Reasonix + DeepSeek 70 分 便宜 5 倍 ✅

纯小白建议:老老实实 Codex + GPT。想用便宜模型,用下面的 Reasonix。

主角:Reasonix(DeepSeek-Reasonix)

✅ 已核对:语音转写出现 “razon NYX / linux / unix / union ux” 等多种听写,实为 Reasonix / DeepSeek-Reasonix——开源终端编码 agent,MIT 协议,TypeScript 实现,GitHub ~13.6k★。 安装:npx reasonix code(需 Node ≥ 22)。只支持 DeepSeek,不能切换其他模型(用 Claude / GPT 就不适用)。

  • 定位:低成本优先,专为 DeepSeek 缓存策略设计。整体架构以「保证更高缓存命中」为一切前提(其他 agent 通常以「解决问题」为第一优先,不太考虑成本)。
  • 效果:
    • 普通 agent 缓存命中约 80%–90%(部分框架实测甚至只有 20%–60%);
    • Reasonix 能做到 95%–99%(官方实测单日曾达 99.82%);
    • 号称把输入 token 成本降到 1/5,实际可能不止(官方案例:单日 4.35 亿输入 token,命中后花 $1.38,不命中要 $61)。

    📌 关于「差价」:视频里说命中/未命中差价 120 倍;而 DeepSeek 官方前缀缓存的公开定价是命中价 ≈ 未命中价的 1/10(约 10 倍差),实际综合节省常见为几十倍量级。数字口径不同,理解「差价巨大、缓存命中是省钱大头」即可。

  • 原理(了解即可):
    • 每次请求逐字复用完全相同的前缀,模型只计算新增部分;
    • 冻结前缀,只追加不修改;
    • 还包括:临时内容隔离、智能压缩、CoT/工具调用的治愈机制等。

一句话结论:用 DeepSeek,就配 Reasonix 省钱。


第 6 章:心法四 · 降低单价(LLM 路由)

四个心法里最灵活、省钱空间最大,但也最难——需要你对不同模型的能力边界有判断。

核心矛盾

便宜模型能力不够,贵模型烧钱。成年人不做选择——通过「路由」两者都要。

路由(编程术语):按一定策略,把不同种类的任务发给不同的模型执行。要做的就是搭建适合自己的路由策略。

两种可组合的工作流

① 执行者 ⇄ 顾问者 模式

  • 弱模型干活,遇到拿不准的问题才去咨询强模型;强模型只负责关键决策,体力活交给便宜模型。
  • 实测(某评测):Haiku(执行) + Opus(顾问),得分 41.2%,是单用 Haiku 的两倍多;相比 Solo(全程强模型)得分低 29%,但每次任务成本降低 85%。

② 调度者 → 执行者 模式

  • 当前 agent 执行任务最主流的编排方式:调度者理解需求、拆解任务分给执行者;执行者干完汇报,调度者再决定下一步。
  • ⚠️ 注意:agent 默认用这个模式是为了「更好管理上下文/解决问题」,不是为了省钱——默认派出的 subagent 和主 agent 用同一个模型,并不省钱。
  • 所以要自定义路由规则,让调度者、执行者用不同模型。

补充:现在 agent 会按任务复杂度自动选三种工作流——① 直接干(最简单)② TODO 流程(拆成 1-2-3-4-5)③ 调度者-执行者(特别复杂的长任务派 subagent)。

各角色用什么模型(标准:成本优先,够用就行)

角色 选型建议
顾问者 最好选——你能用的最强模型即可
执行者 能完成当前任务的最便宜模型就是最好的
调度者 需要推理/规划/进度把控,对推理深度要求高;但不必最贵,中档模型已够。小白直接用最强模型;进阶者:只在「澄清 + 定计划目标」阶段用强模型,目标定好后用一般模型即可

提醒:强模型不是讲得越细越好——讲太细会限制它、只会照做;讲太粗它会选平庸方案。要把握好度。

另一个坑:模型是边干边想的。就算一开始用最强模型定好了计划,执行者干活时仍可能碰到低质模型解决不了的新问题——这时结合顾问者模式,让调度者发现执行者卡住后,调用最强模型「擦屁股」。

怎么实现路由

前提:你的 agent 能同时调用多个提供商的模型。

Agent 路由能力
Claude Code ✅ 原生支持多提供商,可给不同 subagent 分配不同模型(调度者一个、执行者一个),开箱即用
OpenCode 默认同时只能用一个提供商;需自定义的两个 agent 是 explore 和 general。仅用 switch 切提供商不够,要借助 Claude Code Router 做中间层,按任务类型转发到不同模型
CLI 脚本串联 Claude Code / Codex / OpenCode 都有 CLI → 写脚本把不同 agent 串起来。例:探索/计划阶段用 Codex+GPT,编码执行阶段切到 Reasonix+DeepSeek;再引入顾问者:Reasonix+DeepSeek 解决不了时,调 Codex+GPT。缺点:跨 agent 的上下文传递麻烦一点,但省钱效果真的好

路由策略方向

  • 本指南是成本优先(够用就行)。
  • 反例:all-hands / OpenAgent 那类框架核心也是路由,但策略是能力优先——不计成本、把任务路由到特定场景下最强的模型,和省钱思路正好相反。目标不同,策略不同。

建议:多用第 2 章的观测工具看账单,发现哪类任务在烧钱,再针对性做路由。


第 7 章:组合拳 & 推荐配置

四个心法可以叠加使用。按上手难度和收益,推荐这样落地:

  1. 先装观测工具(第 2 章):看清账单,找到烧钱的 20% 对话。
  2. 全局开 RTK(3.1):无痛无损,立刻省输入 token。
  3. 压缩 CLAUDE.md(用 caveman-compress,3.2):提升质量。
  4. 有明确「不用读中间过程」的代码生成场景 → 开 Caveman(3.2);其余场景关闭。
  5. 大型项目 → 上 CodeGraph(第 4 章):砍掉探索阶段循环(最大成本杀手之一)。
  6. 用 DeepSeek → 配 Reasonix(第 5 章):缓存命中拉满,输入成本降到 1/5。
  7. 进阶:搭路由(第 6 章):执行者用最便宜模型、顾问者用最强模型,组合调度者-执行者 + 执行者-顾问者两种工作流。

一个典型的省钱路由示例:

探索 + 计划阶段:Codex + GPT(或强模型定目标)→ 编码执行阶段:Reasonix + DeepSeek(便宜)→ 卡住时:回到强模型当顾问擦屁股。


附录 A:一页速查表

心法 工具 作用 无损? 适用场景 开关建议
观测 (待核对) 看账单、诊断、对比 — 所有 全程配合使用
减 token(输入) RTK 压缩命令噪声 ✅ 无损 命令类,尤其开发机 全局开
减 token(输出) Caveman 让模型简洁输出 ❌ 有损 只在「不读中间过程」的代码生成 拿不准就别开
减 token(上下文) caveman-compress 压缩 CLAUDE.md — 上下文文件臃肿时 推荐用
减循环 CodeGraph 知识图谱砍探索循环 — 大型项目 项目越大越用
提高缓存命中 Reasonix DeepSeek 专用低成本 agent — 用 DeepSeek 时 用 DS 就配它
降低单价 LLM 路由 / Claude Code Router 按任务路由到不同模型 — 想既省钱又要效果 进阶必做

三条黄金认知:

  1. 成本 ≠ 单价;循环轮数才是成本杀手。
  2. 少即是多;上下文要做减法。
  3. 杀鸡不用牛刀;路由是省钱空间最大的心法。

附录 B:名词还原表(需核对)

原文是语音识别稿,以下专有名词是我按上下文还原的,标 ⚠️ 的请务必核对真实名称/仓库地址后再使用。

文档采用 语音转写里的错误写法 说明 可信度
RTK (Rust Token Killer) IDK / RDK / 阿里K / 套k 减输入 token 的命令重写工具 · github.com/rtk-ai/rtk ✅ 已核对
Caveman skill kill man / q man / KM / 蹄子 减输出 token 的提示词 skill 高
caveman-compress calman compress / 卡曼 压缩 CLAUDE.md 的 skill 高
CodeGraph cot graph / color graph / code graph 知识图谱砍探索循环 高
Reasonix (DeepSeek-Reasonix) razon NYX / reasonix / linux / unix / union ux DeepSeek 专用低成本 agent · npx reasonix code ✅ 已核对
agenttrace entrance / agentchance 分析本地 agent 日志的 TUI 工具 · github.com/luoyuctl/agenttrace ✅ 已核对(发音+功能全合致)
Claude Code Router 克乐寇的 root 由 / 克乐寇 OpenCode 路由中间层 高
Claude Code cloud code / 克乐寇 Anthropic 官方编码 agent 高
Codex codex / code code OpenAI 编码 agent 高
OpenCode open code 开源编码 agent 高
Haiku / Opus 还酷 / haco · oppos / office Claude 模型(执行者/顾问者示例) 高
DeepSeek deep sik / DB sik / muc 国产模型 高
SuperPowers suu per powers / super powers 计划/工作流框架 高
all-hands / OpenAgent all my open agent 能力优先的路由框架 中
VibeCoding web coding / 外部搞定 / 外部靠定 本系列主题 高

整理自《VibeCoding 省钱指南》1–7 集视频转写稿 · 生成于 2026-07-14 配套速查:《VibeCoding省钱指南-一页速查.md》 · 工具名已联网核对(agenttrace / RTK / Reasonix)