VibeCoding 省钱指南 · 保姆级教程
本文由 7 集视频的语音转写稿整理而成,系统梳理了「用 AI 编程时如何省 token / 省钱」的完整方法论。 面向对象:用 Claude Code / Codex / OpenCode 等编码 agent 做 VibeCoding 的个人开发者(尤其是小白)。
阅读方式:先读第 0、1 章建立心智模型,再按第 2 章学会看账单,最后四个心法(第 3–6 章)按需实操。
目录
- 第 0 章:先建立一个正确的成本认知
- 第 1 章:四个省钱心法(全局地图)
- 第 2 章:先学会看账单(可观测性)
- 第 3 章:心法一 · 减少 token
- 第 4 章:心法二 · 减少循环次数(CodeGraph)
- 第 5 章:心法三 · 提高缓存命中率(Reasonix)
- 第 6 章:心法四 · 降低单价(LLM 路由)
- 第 7 章:组合拳 & 推荐配置
- 附录 A:一页速查表
- 附录 B:名词还原表(需核对)
第 0 章:先建立一个正确的成本认知
成本公式
一次调用成本 = 输入成本 + 输出成本
- 输出成本 = 输出 token 数 × 输出单价 → 好算。
- 输入成本 = 受缓存命中率影响巨大。缓存命中和不命中,价格天差地别(某些模型差价可达 120 倍)。
- (缓存写入成本一般单独计,但影响不大,通常只写一次,个人 VibeCoding 可忽略。)
- (私有化部署 + 微调是企业级方案,个人不考虑。)
最重要的一句话:成本 ≠ 单价
这是整套指南的核心认知。
- 同一个任务,A 模型一次就解决;B 模型来回折腾很多轮。
- B 模型单价虽便宜,但循环轮数多,总成本反而可能更高。
- 所以「便宜的模型」不等于「省钱」,「贵的模型」也不等于「烧钱」——要看总账,不要看单价。
📌 规律:通常 80% 的费用由 20% 的对话产生,而这 20% 对话的共性就是——循环轮数特别多。
第 1 章:四个省钱心法(全局地图)
有了成本公式,省钱就是四个方向:
| # | 心法 | 作用点 | 对应工具 | 难度 |
|---|---|---|---|---|
| 1 | 降低单价 | 杀鸡不用牛刀,按任务把请求路由到不同价位的模型 | LLM 路由 / Claude Code Router | ⭐⭐⭐(最难实操,省钱空间最大) |
| 2 | 减少 token | 输入端 + 输出端减 token,但不能丢信息 | RTK / Caveman | ⭐(小白最容易上手) |
| 3 | 提高缓存命中率 | 用对厂商 agent + 做好可观测性 | Reasonix(DeepSeek 专用) | ⭐⭐ |
| 4 | 减少循环次数 | 砍掉不必要的往返(尤其探索阶段) | CodeGraph + 工程化手段 | ⭐⭐(真正的成本杀手) |
建议学习顺序:先看账单(第 2 章)→ 再从最容易的减 token(第 3 章)入手 → 逐步到循环、缓存、路由。
视频 ↔ 本文章节对照(方便对着视频看)
| 视频集数 | 主题 | 本文章节 |
|---|---|---|
| 第 1 集 | 总纲:公式 + 四心法 | 第 0、1 章 |
| 第 2 集 | 怎么看每次对话消耗的 token | 第 2 章(agenttrace) |
| 第 3 集 | RTK 节省 80% token | 第 3.1 节 |
| 第 4 集 | Caveman skill | 第 3.2 节 |
| 第 5 集 | CodeGraph 砍掉探索循环 | 第 4 章 |
| 第 6 集 | Reasonix 把 DeepSeek 成本砍到 1/5 | 第 5 章 |
| 第 7 集 | LLM 路由 | 第 6 章 |
第 2 章:先学会看账单(可观测性)
想省钱,先学会看。你得知道成本花在哪里,才能有针对性地优化。
目标产物
一份分析报告,包含:
- token 消耗量 & 预估费用
- 费用增长的原因
- 健康度趋势评分
- 最近事件列表 / 最近对话
- 按 agent 分组统计 / 按模型分组统计
- 最近对话的异常点
使用的工具:agenttrace
✅ 已核对:原视频语音转写为 “entrance / agentchance”,实为 agenttrace(
github.com/luoyuctl/agenttrace)——一个本地优先、分析本地 agent 日志的开源 TUI 工具,支持 Claude Code / Codex / Gemini CLI / OpenCode / Aider / Cline 等的会话日志。star 较少(niche 工具)但对个人非常实用。常用命令:
agenttrace # 打开本地 TUI agenttrace --doctor # 检查检测到的 agent 日志目录 agenttrace --overview -f html -o report.html # 生成 HTML 概览报告 agenttrace --overview -f json # 生成机器可读报告(可用于 CI)
核心功能:
- 生成概览报告:
agenttrace --overview -f html即可生成总览页面(也支持 json / markdown)。 - TUI 交互界面:进入「对话列表」,可按花费或对话轮数排序。
- 单次对话明细:进入花费最高的那次对话,可看到:
- 用了多少 token、调用了多少次工具
- 输入/输出各用多少 token、缓存命中了多少 token
- 工具使用情况、思考深度和花费
- 诊断功能:看不出问题没关系,它能直接帮你诊断成本为什么高。
- 视频实例:一眼看到「上下文爆了」——模型上限 20 万,实际跑到 36 万,AI 没做好上下文压缩,由此引发大量无用工具循环。
- 对比(diff)功能:对比两次对话的花费、token、循环轮次、工具调用次数等,针对特定任务调优时很好用。
局限:细节还不够完善(作者自用工具,够用即止)。
本章要点
学会看每次对话的细节 → 知道钱花在哪 → 才能开始有针对性地省钱。后面四个心法,都建议配合这个观测工具使用。
第 3 章:心法一 · 减少 token
减 token 分输入端和输出端,是小白最容易上手的方向。
3.1 输入端:RTK(Rust Token Killer)
它是什么
- 全名 Rust Token Killer。很多常用命令会输出大量无用样例/重复内容,污染上下文、增加成本,还会因为上下文被污染而降低模型输出质量。
- RTK 用 Rust 重写了大量命令,压缩掉噪声;并以插件形式,在你的 agent 真正调用命令之前,给命令加上
rtk前缀,换成 RTK 优化过的版本。
效果
- 开发机器约省 80%;创意写作机器约省 52%。
- ✅ 无损减 token——不丢信息,反而因为上下文更干净而提升推理质量。
已核对:仓库 github.com/rtk-ai/rtk,Apache-2.0,零依赖零配置单一二进制,每条命令开销 < 10ms。自动拦截压缩 100+ 常见命令(git / cargo / npm / ls / cat / find / grep 等)。可配合 Claude Code / Cursor / Codex / Aider / Cline / Gemini CLI / OpenCode 使用(不止 OpenCode)。
怎么用(保姆级步骤)
- 执行官方快速安装命令(见项目 GitHub)。
- 安装对应 agent 的接入配置:
- OpenCode 全局接入:
rtk init -g --opencode - 其他 agent:手动在命令前加
rtk前缀即可获得同样效果。 - ⚠️ 注意:Claude Code 内置的 Read / Grep / Glob 不走 hook,想要同样压缩效果请用 shell 等价命令(
rtk read/rtk grep/rg)。
- OpenCode 全局接入:
- 装完第一件事:执行
rtk discover # 预估「你没用 RTK 亏了多少 token」 rtk gain # 实时追踪已节省的 tokendiscover会统计比如 1000 多个命令没走 RTK、少省约 100K token,就约等于亏了 100K。
建议:✅ 推荐全局开启。 局限:只针对命令。其他减 token 场景需要别的工具(见 3.2)。
官方实测参考:cargo test 省 91.8%、git status 省 80.8%、grep 省 49.5%;基于 2900+ 真实命令平均去除 89% 噪声。与视频里「开发机 ~80%、创意机 ~52%」一致。
3.2 输出端:Caveman skill
它是什么
- 一个 skill,宣称能节省 75% 输出 token。
- 本质是提示词工程,核心就一句话:「像一个聪明的原始人一样简洁地回答,保留所有技术内容,只删掉无关紧要的废话。」
- 和 RTK(要装命令/插件)不同,它只是让大模型简洁输出的提示词,实际效果取决于你用的模型。
⚠️ 关键区别:这是「有损」的
- RTK 是无损省 token;Caveman 是有损的,不适合所有场景。
- ✅ 适合:生成代码等你根本不会去读中间过程的场景。
- 例:用 SuperPowers 之类的框架定好计划后,让 subagent 干活时——你不会看 subagent 说了啥,废话越少越好,只要结果对。
- ❌ 不适合:思维风暴、技术选型、计划制定、创意协作。这些场景绝对不能开。
- 📌 拿不准什么时候开、什么时候关?那就别开。(对比:RTK 推荐全局开。)
彩蛋:同仓库的 caveman-compress(推荐用)
- 作用:压缩
CLAUDE.md/AGENTS.md这类给 agent 看的上下文文件。 - 虽然省的 token 不多,但能提升模型的推理和生成质量。
- 背景理念:少即是多。
init命令生成的 CLAUDE.md 往往又臭又长,建议一定要处理。
延伸:上下文要做减法
- 大模型自己知道的、能根据已知推导的、自己能探索到的,就不要往 CLAUDE.md 里塞。
- 上下文不是越多越好。像那些号称「记忆化」的 agent,设计时最重要的其实不是「记住什么」,而是**「忘记什么」**。加法谁都会做,优雅地做减法才是难点。
- ⚠️ 软件工程没有银弹,「记忆化」不能一劳永逸;真做生产力工具,还是要靠编码。
第 4 章:心法二 · 减少循环次数(CodeGraph)
为什么循环是「成本杀手」
回看公式,它只写了单次调用成本。因为每次调用成本不同,所以:
一次对话总成本 = 每轮调用成本相加之和(≠ 单次成本 × 轮数)
循环轮数看上去不在公式里,所以最容易被忽略——但它才是真正的成本杀手。你看账单会发现:循环轮数和成本基本成正比。
- 循环轮数 = 你自己发消息的轮数 + agent 自身的工具循环轮数。
- 引入一个参数:任务难度。正常情况下,任务难度 ∝ 循环轮数 ∝ 成本。
- ⚠️ 最难受的情况:因为爱用「目标驱动 + 无人值守」偷懒,睡一觉起来账单爆炸——一个简单任务烧了大量 token。目标驱动里,目标定错了,对钱包是致命的(SuperPowers 定计划那期就是教你避免这个)。
优化原则:像优化 MySQL 一样——不要过早优化。别每个都看,专挑循环轮数特别高的对话来处理。
CodeGraph 解决的是「探索阶段」的循环
- 现在的大模型基本都内化了「先探索 → 再澄清 → 最后干活」的流程。
- 在大型项目里,最浪费 token 的就是探索阶段:为了找到一个小需求的修改点,agent 反复
grep/ls/read,产生大量工具调用、往返通信和噪声。
业界两种方案:
- 语义化(向量)检索——如 Cursor 走的路线。
- 知识图谱——CodeGraph 走的路线(本章重点)。
CodeGraph 原理:先把代码关系建成图谱,使用时一次性把所有相关内容返还给 agent,省掉反复探索的往返。
适用边界(重要):
- 📈 项目规模越大越省、越值得用;很小的项目没必要用。
- 支持常见框架和开发语言(具体见项目文档)。
第 5 章:心法三 · 提高缓存命中率(Reasonix)
小白版策略:选对 agent
每个模型提供商的缓存策略都不一样。自己做 AI 应用要按模型设计缓存架构;但对小白,提高缓存命中率就一条:用哪家的模型,就用哪家的 agent。
| 你用的模型 | 就用的 agent |
|---|---|
| GPT | Codex |
| Claude(Opus 等) | Claude Code |
| 豆包 | 豆包自家 agent |
道理:虽然都是「套壳」,但各家针对自家模型一定会做针对性的缓存优化。
⚠️ 两个大坑
- Codex 不要接第三方模型。 Codex 和 GPT 系列耦合很深,接 DeepSeek 之类费半天劲、发挥不出效果、还一堆问题。想用便宜模型请换 agent。
- 接第三方模型要对产出有预期。 参考评分:
| 组合 | 效果评分 | 成本 |
|---|---|---|
| Codex + GPT | 80 分 | 基准 |
| Codex + DeepSeek | 50 分(❌ 不推荐) | — |
| Claude Code / OpenCode + DeepSeek | 70 分 | 基准 |
| Reasonix + DeepSeek | 70 分 | 便宜 5 倍 ✅ |
纯小白建议:老老实实 Codex + GPT。想用便宜模型,用下面的 Reasonix。
主角:Reasonix(DeepSeek-Reasonix)
✅ 已核对:语音转写出现 “razon NYX / linux / unix / union ux” 等多种听写,实为 Reasonix / DeepSeek-Reasonix——开源终端编码 agent,MIT 协议,TypeScript 实现,GitHub ~13.6k★。 安装:
npx reasonix code(需 Node ≥ 22)。只支持 DeepSeek,不能切换其他模型(用 Claude / GPT 就不适用)。
- 定位:低成本优先,专为 DeepSeek 缓存策略设计。整体架构以「保证更高缓存命中」为一切前提(其他 agent 通常以「解决问题」为第一优先,不太考虑成本)。
- 效果:
- 普通 agent 缓存命中约 80%–90%(部分框架实测甚至只有 20%–60%);
- Reasonix 能做到 95%–99%(官方实测单日曾达 99.82%);
- 号称把输入 token 成本降到 1/5,实际可能不止(官方案例:单日 4.35 亿输入 token,命中后花 $1.38,不命中要 $61)。
📌 关于「差价」:视频里说命中/未命中差价 120 倍;而 DeepSeek 官方前缀缓存的公开定价是命中价 ≈ 未命中价的 1/10(约 10 倍差),实际综合节省常见为几十倍量级。数字口径不同,理解「差价巨大、缓存命中是省钱大头」即可。
- 原理(了解即可):
- 每次请求逐字复用完全相同的前缀,模型只计算新增部分;
- 冻结前缀,只追加不修改;
- 还包括:临时内容隔离、智能压缩、CoT/工具调用的治愈机制等。
一句话结论:用 DeepSeek,就配 Reasonix 省钱。
第 6 章:心法四 · 降低单价(LLM 路由)
四个心法里最灵活、省钱空间最大,但也最难——需要你对不同模型的能力边界有判断。
核心矛盾
便宜模型能力不够,贵模型烧钱。成年人不做选择——通过「路由」两者都要。
路由(编程术语):按一定策略,把不同种类的任务发给不同的模型执行。要做的就是搭建适合自己的路由策略。
两种可组合的工作流
① 执行者 ⇄ 顾问者 模式
- 弱模型干活,遇到拿不准的问题才去咨询强模型;强模型只负责关键决策,体力活交给便宜模型。
- 实测(某评测):Haiku(执行) + Opus(顾问),得分 41.2%,是单用 Haiku 的两倍多;相比 Solo(全程强模型)得分低 29%,但每次任务成本降低 85%。
② 调度者 → 执行者 模式
- 当前 agent 执行任务最主流的编排方式:调度者理解需求、拆解任务分给执行者;执行者干完汇报,调度者再决定下一步。
- ⚠️ 注意:agent 默认用这个模式是为了「更好管理上下文/解决问题」,不是为了省钱——默认派出的 subagent 和主 agent 用同一个模型,并不省钱。
- 所以要自定义路由规则,让调度者、执行者用不同模型。
补充:现在 agent 会按任务复杂度自动选三种工作流——① 直接干(最简单)② TODO 流程(拆成 1-2-3-4-5)③ 调度者-执行者(特别复杂的长任务派 subagent)。
各角色用什么模型(标准:成本优先,够用就行)
| 角色 | 选型建议 |
|---|---|
| 顾问者 | 最好选——你能用的最强模型即可 |
| 执行者 | 能完成当前任务的最便宜模型就是最好的 |
| 调度者 | 需要推理/规划/进度把控,对推理深度要求高;但不必最贵,中档模型已够。小白直接用最强模型;进阶者:只在「澄清 + 定计划目标」阶段用强模型,目标定好后用一般模型即可 |
提醒:强模型不是讲得越细越好——讲太细会限制它、只会照做;讲太粗它会选平庸方案。要把握好度。
另一个坑:模型是边干边想的。就算一开始用最强模型定好了计划,执行者干活时仍可能碰到低质模型解决不了的新问题——这时结合顾问者模式,让调度者发现执行者卡住后,调用最强模型「擦屁股」。
怎么实现路由
前提:你的 agent 能同时调用多个提供商的模型。
| Agent | 路由能力 |
|---|---|
| Claude Code | ✅ 原生支持多提供商,可给不同 subagent 分配不同模型(调度者一个、执行者一个),开箱即用 |
| OpenCode | 默认同时只能用一个提供商;需自定义的两个 agent 是 explore 和 general。仅用 switch 切提供商不够,要借助 Claude Code Router 做中间层,按任务类型转发到不同模型 |
| CLI 脚本串联 | Claude Code / Codex / OpenCode 都有 CLI → 写脚本把不同 agent 串起来。例:探索/计划阶段用 Codex+GPT,编码执行阶段切到 Reasonix+DeepSeek;再引入顾问者:Reasonix+DeepSeek 解决不了时,调 Codex+GPT。缺点:跨 agent 的上下文传递麻烦一点,但省钱效果真的好 |
路由策略方向
- 本指南是成本优先(够用就行)。
- 反例:
all-hands / OpenAgent那类框架核心也是路由,但策略是能力优先——不计成本、把任务路由到特定场景下最强的模型,和省钱思路正好相反。目标不同,策略不同。
建议:多用第 2 章的观测工具看账单,发现哪类任务在烧钱,再针对性做路由。
第 7 章:组合拳 & 推荐配置
四个心法可以叠加使用。按上手难度和收益,推荐这样落地:
- 先装观测工具(第 2 章):看清账单,找到烧钱的 20% 对话。
- 全局开 RTK(3.1):无痛无损,立刻省输入 token。
- 压缩 CLAUDE.md(用
caveman-compress,3.2):提升质量。 - 有明确「不用读中间过程」的代码生成场景 → 开 Caveman(3.2);其余场景关闭。
- 大型项目 → 上 CodeGraph(第 4 章):砍掉探索阶段循环(最大成本杀手之一)。
- 用 DeepSeek → 配 Reasonix(第 5 章):缓存命中拉满,输入成本降到 1/5。
- 进阶:搭路由(第 6 章):执行者用最便宜模型、顾问者用最强模型,组合调度者-执行者 + 执行者-顾问者两种工作流。
一个典型的省钱路由示例:
探索 + 计划阶段:Codex + GPT(或强模型定目标)→ 编码执行阶段:Reasonix + DeepSeek(便宜)→ 卡住时:回到强模型当顾问擦屁股。
附录 A:一页速查表
| 心法 | 工具 | 作用 | 无损? | 适用场景 | 开关建议 |
|---|---|---|---|---|---|
| 观测 | (待核对) | 看账单、诊断、对比 | — | 所有 | 全程配合使用 |
| 减 token(输入) | RTK | 压缩命令噪声 | ✅ 无损 | 命令类,尤其开发机 | 全局开 |
| 减 token(输出) | Caveman | 让模型简洁输出 | ❌ 有损 | 只在「不读中间过程」的代码生成 | 拿不准就别开 |
| 减 token(上下文) | caveman-compress | 压缩 CLAUDE.md | — | 上下文文件臃肿时 | 推荐用 |
| 减循环 | CodeGraph | 知识图谱砍探索循环 | — | 大型项目 | 项目越大越用 |
| 提高缓存命中 | Reasonix | DeepSeek 专用低成本 agent | — | 用 DeepSeek 时 | 用 DS 就配它 |
| 降低单价 | LLM 路由 / Claude Code Router | 按任务路由到不同模型 | — | 想既省钱又要效果 | 进阶必做 |
三条黄金认知:
- 成本 ≠ 单价;循环轮数才是成本杀手。
- 少即是多;上下文要做减法。
- 杀鸡不用牛刀;路由是省钱空间最大的心法。
附录 B:名词还原表(需核对)
原文是语音识别稿,以下专有名词是我按上下文还原的,标 ⚠️ 的请务必核对真实名称/仓库地址后再使用。
| 文档采用 | 语音转写里的错误写法 | 说明 | 可信度 |
|---|---|---|---|
| RTK (Rust Token Killer) | IDK / RDK / 阿里K / 套k | 减输入 token 的命令重写工具 · github.com/rtk-ai/rtk |
✅ 已核对 |
| Caveman skill | kill man / q man / KM / 蹄子 | 减输出 token 的提示词 skill | 高 |
| caveman-compress | calman compress / 卡曼 | 压缩 CLAUDE.md 的 skill | 高 |
| CodeGraph | cot graph / color graph / code graph | 知识图谱砍探索循环 | 高 |
| Reasonix (DeepSeek-Reasonix) | razon NYX / reasonix / linux / unix / union ux | DeepSeek 专用低成本 agent · npx reasonix code |
✅ 已核对 |
| agenttrace | entrance / agentchance | 分析本地 agent 日志的 TUI 工具 · github.com/luoyuctl/agenttrace |
✅ 已核对(发音+功能全合致) |
| Claude Code Router | 克乐寇的 root 由 / 克乐寇 | OpenCode 路由中间层 | 高 |
| Claude Code | cloud code / 克乐寇 | Anthropic 官方编码 agent | 高 |
| Codex | codex / code code | OpenAI 编码 agent | 高 |
| OpenCode | open code | 开源编码 agent | 高 |
| Haiku / Opus | 还酷 / haco · oppos / office | Claude 模型(执行者/顾问者示例) | 高 |
| DeepSeek | deep sik / DB sik / muc | 国产模型 | 高 |
| SuperPowers | suu per powers / super powers | 计划/工作流框架 | 高 |
| all-hands / OpenAgent | all my open agent | 能力优先的路由框架 | 中 |
| VibeCoding | web coding / 外部搞定 / 外部靠定 | 本系列主题 | 高 |
整理自《VibeCoding 省钱指南》1–7 集视频转写稿 · 生成于 2026-07-14 配套速查:《VibeCoding省钱指南-一页速查.md》 · 工具名已联网核对(agenttrace / RTK / Reasonix)