VibeCoding 省钱指南 · 保姆级教程

本文由 7 集视频的语音转写稿整理而成,系统梳理了「用 AI 编程时如何省 token / 省钱」的完整方法论。 面向对象:用 Claude Code / Codex / OpenCode 等编码 agent 做 VibeCoding 的个人开发者(尤其是小白)。

阅读方式:先读第 0、1 章建立心智模型,再按第 2 章学会看账单,最后四个心法(第 3–6 章)按需实操。


目录


第 0 章:先建立一个正确的成本认知

成本公式

一次调用成本 = 输入成本 + 输出成本

最重要的一句话:成本 ≠ 单价

这是整套指南的核心认知。

📌 规律:通常 80% 的费用由 20% 的对话产生,而这 20% 对话的共性就是——循环轮数特别多


第 1 章:四个省钱心法(全局地图)

有了成本公式,省钱就是四个方向:

# 心法 作用点 对应工具 难度
1 降低单价 杀鸡不用牛刀,按任务把请求路由到不同价位的模型 LLM 路由 / Claude Code Router ⭐⭐⭐(最难实操,省钱空间最大)
2 减少 token 输入端 + 输出端减 token,但不能丢信息 RTK / Caveman ⭐(小白最容易上手)
3 提高缓存命中率 用对厂商 agent + 做好可观测性 Reasonix(DeepSeek 专用) ⭐⭐
4 减少循环次数 砍掉不必要的往返(尤其探索阶段) CodeGraph + 工程化手段 ⭐⭐(真正的成本杀手)

建议学习顺序:先看账单(第 2 章)→ 再从最容易的减 token(第 3 章)入手 → 逐步到循环、缓存、路由。

视频 ↔ 本文章节对照(方便对着视频看)

视频集数 主题 本文章节
第 1 集 总纲:公式 + 四心法 第 0、1 章
第 2 集 怎么看每次对话消耗的 token 第 2 章(agenttrace)
第 3 集 RTK 节省 80% token 第 3.1 节
第 4 集 Caveman skill 第 3.2 节
第 5 集 CodeGraph 砍掉探索循环 第 4 章
第 6 集 Reasonix 把 DeepSeek 成本砍到 1/5 第 5 章
第 7 集 LLM 路由 第 6 章

第 2 章:先学会看账单(可观测性)

想省钱,先学会看。你得知道成本花在哪里,才能有针对性地优化。

目标产物

一份分析报告,包含:

使用的工具:agenttrace

已核对:原视频语音转写为 “entrance / agentchance”,实为 agenttrace(github.com/luoyuctl/agenttrace)——一个本地优先、分析本地 agent 日志的开源 TUI 工具,支持 Claude Code / Codex / Gemini CLI / OpenCode / Aider / Cline 等的会话日志。star 较少(niche 工具)但对个人非常实用。

常用命令:

agenttrace                                   # 打开本地 TUI
agenttrace --doctor                          # 检查检测到的 agent 日志目录
agenttrace --overview -f html -o report.html # 生成 HTML 概览报告
agenttrace --overview -f json                # 生成机器可读报告(可用于 CI)

核心功能:

  1. 生成概览报告:agenttrace --overview -f html 即可生成总览页面(也支持 json / markdown)。
  2. TUI 交互界面:进入「对话列表」,可按花费对话轮数排序。
  3. 单次对话明细:进入花费最高的那次对话,可看到:
    • 用了多少 token、调用了多少次工具
    • 输入/输出各用多少 token、缓存命中了多少 token
    • 工具使用情况、思考深度和花费
  4. 诊断功能:看不出问题没关系,它能直接帮你诊断成本为什么高。
    • 视频实例:一眼看到「上下文爆了」——模型上限 20 万,实际跑到 36 万,AI 没做好上下文压缩,由此引发大量无用工具循环。
  5. 对比(diff)功能:对比两次对话的花费、token、循环轮次、工具调用次数等,针对特定任务调优时很好用。

局限:细节还不够完善(作者自用工具,够用即止)。

本章要点

学会看每次对话的细节 → 知道钱花在哪 → 才能开始有针对性地省钱。后面四个心法,都建议配合这个观测工具使用。


第 3 章:心法一 · 减少 token

减 token 分输入端输出端,是小白最容易上手的方向。

3.1 输入端:RTK(Rust Token Killer)

它是什么

效果

已核对:仓库 github.com/rtk-ai/rtk,Apache-2.0,零依赖零配置单一二进制,每条命令开销 < 10ms。自动拦截压缩 100+ 常见命令(git / cargo / npm / ls / cat / find / grep 等)。可配合 Claude Code / Cursor / Codex / Aider / Cline / Gemini CLI / OpenCode 使用(不止 OpenCode)。

怎么用(保姆级步骤)

  1. 执行官方快速安装命令(见项目 GitHub)。
  2. 安装对应 agent 的接入配置:
    • OpenCode 全局接入:rtk init -g --opencode
    • 其他 agent:手动在命令前加 rtk 前缀即可获得同样效果。
    • ⚠️ 注意:Claude Code 内置的 Read / Grep / Glob 不走 hook,想要同样压缩效果请用 shell 等价命令(rtk read / rtk grep / rg)。
  3. 装完第一件事:执行
    rtk discover        # 预估「你没用 RTK 亏了多少 token」
    rtk gain            # 实时追踪已节省的 token
    discover 会统计比如 1000 多个命令没走 RTK、少省约 100K token,就约等于亏了 100K。

建议:✅ 推荐全局开启局限:只针对命令。其他减 token 场景需要别的工具(见 3.2)。

官方实测参考:cargo test 省 91.8%、git status 省 80.8%、grep 省 49.5%;基于 2900+ 真实命令平均去除 89% 噪声。与视频里「开发机 ~80%、创意机 ~52%」一致。


3.2 输出端:Caveman skill

它是什么

⚠️ 关键区别:这是「有损」的

彩蛋:同仓库的 caveman-compress(推荐用)

延伸:上下文要做减法


第 4 章:心法二 · 减少循环次数(CodeGraph)

为什么循环是「成本杀手」

回看公式,它只写了单次调用成本。因为每次调用成本不同,所以:

一次对话总成本 = 每轮调用成本相加之和(≠ 单次成本 × 轮数)

循环轮数看上去不在公式里,所以最容易被忽略——但它才是真正的成本杀手。你看账单会发现:循环轮数和成本基本成正比

优化原则:像优化 MySQL 一样——不要过早优化。别每个都看,专挑循环轮数特别高的对话来处理。

CodeGraph 解决的是「探索阶段」的循环

业界两种方案:

  1. 语义化(向量)检索——如 Cursor 走的路线。
  2. 知识图谱——CodeGraph 走的路线(本章重点)。

CodeGraph 原理:先把代码关系建成图谱,使用时一次性把所有相关内容返还给 agent,省掉反复探索的往返。

适用边界(重要):


第 5 章:心法三 · 提高缓存命中率(Reasonix)

小白版策略:选对 agent

每个模型提供商的缓存策略都不一样。自己做 AI 应用要按模型设计缓存架构;但对小白,提高缓存命中率就一条:用哪家的模型,就用哪家的 agent。

你用的模型 就用的 agent
GPT Codex
Claude(Opus 等) Claude Code
豆包 豆包自家 agent

道理:虽然都是「套壳」,但各家针对自家模型一定会做针对性的缓存优化。

⚠️ 两个大坑

  1. Codex 不要接第三方模型。 Codex 和 GPT 系列耦合很深,接 DeepSeek 之类费半天劲、发挥不出效果、还一堆问题。想用便宜模型请换 agent。
  2. 接第三方模型要对产出有预期。 参考评分:
组合 效果评分 成本
Codex + GPT 80 分 基准
Codex + DeepSeek 50 分(❌ 不推荐)
Claude Code / OpenCode + DeepSeek 70 分 基准
Reasonix + DeepSeek 70 分 便宜 5 倍

纯小白建议:老老实实 Codex + GPT。想用便宜模型,用下面的 Reasonix。

主角:Reasonix(DeepSeek-Reasonix)

已核对:语音转写出现 “razon NYX / linux / unix / union ux” 等多种听写,实为 Reasonix / DeepSeek-Reasonix——开源终端编码 agent,MIT 协议,TypeScript 实现,GitHub ~13.6k★。 安装:npx reasonix code(需 Node ≥ 22)。只支持 DeepSeek,不能切换其他模型(用 Claude / GPT 就不适用)。

一句话结论:用 DeepSeek,就配 Reasonix 省钱。


第 6 章:心法四 · 降低单价(LLM 路由)

四个心法里最灵活、省钱空间最大,但也最难——需要你对不同模型的能力边界有判断。

核心矛盾

便宜模型能力不够,贵模型烧钱。成年人不做选择——通过「路由」两者都要。

路由(编程术语):按一定策略,把不同种类的任务发给不同的模型执行。要做的就是搭建适合自己的路由策略

两种可组合的工作流

① 执行者 ⇄ 顾问者 模式

② 调度者 → 执行者 模式

补充:现在 agent 会按任务复杂度自动选三种工作流——① 直接干(最简单)② TODO 流程(拆成 1-2-3-4-5)③ 调度者-执行者(特别复杂的长任务派 subagent)。

各角色用什么模型(标准:成本优先,够用就行)

角色 选型建议
顾问者 最好选——你能用的最强模型即可
执行者 能完成当前任务的最便宜模型就是最好的
调度者 需要推理/规划/进度把控,对推理深度要求高;但不必最贵,中档模型已够。小白直接用最强模型;进阶者:只在「澄清 + 定计划目标」阶段用强模型,目标定好后用一般模型即可

提醒:强模型不是讲得越细越好——讲太细会限制它、只会照做;讲太粗它会选平庸方案。要把握好度。

另一个坑:模型是边干边想的。就算一开始用最强模型定好了计划,执行者干活时仍可能碰到低质模型解决不了的新问题——这时结合顾问者模式,让调度者发现执行者卡住后,调用最强模型「擦屁股」。

怎么实现路由

前提:你的 agent 能同时调用多个提供商的模型。

Agent 路由能力
Claude Code ✅ 原生支持多提供商,可给不同 subagent 分配不同模型(调度者一个、执行者一个),开箱即用
OpenCode 默认同时只能用一个提供商;需自定义的两个 agent 是 exploregeneral。仅用 switch 切提供商不够,要借助 Claude Code Router 做中间层,按任务类型转发到不同模型
CLI 脚本串联 Claude Code / Codex / OpenCode 都有 CLI → 写脚本把不同 agent 串起来。例:探索/计划阶段用 Codex+GPT,编码执行阶段切到 Reasonix+DeepSeek;再引入顾问者:Reasonix+DeepSeek 解决不了时,调 Codex+GPT。缺点:跨 agent 的上下文传递麻烦一点,但省钱效果真的好

路由策略方向

建议:多用第 2 章的观测工具看账单,发现哪类任务在烧钱,再针对性做路由。


第 7 章:组合拳 & 推荐配置

四个心法可以叠加使用。按上手难度和收益,推荐这样落地:

  1. 先装观测工具(第 2 章):看清账单,找到烧钱的 20% 对话。
  2. 全局开 RTK(3.1):无痛无损,立刻省输入 token。
  3. 压缩 CLAUDE.md(用 caveman-compress,3.2):提升质量。
  4. 有明确「不用读中间过程」的代码生成场景 → 开 Caveman(3.2);其余场景关闭。
  5. 大型项目 → 上 CodeGraph(第 4 章):砍掉探索阶段循环(最大成本杀手之一)。
  6. 用 DeepSeek → 配 Reasonix(第 5 章):缓存命中拉满,输入成本降到 1/5。
  7. 进阶:搭路由(第 6 章):执行者用最便宜模型、顾问者用最强模型,组合调度者-执行者 + 执行者-顾问者两种工作流。

一个典型的省钱路由示例:

探索 + 计划阶段:Codex + GPT(或强模型定目标)→ 编码执行阶段:Reasonix + DeepSeek(便宜)→ 卡住时:回到强模型当顾问擦屁股。


附录 A:一页速查表

心法 工具 作用 无损? 适用场景 开关建议
观测 (待核对) 看账单、诊断、对比 所有 全程配合使用
减 token(输入) RTK 压缩命令噪声 ✅ 无损 命令类,尤其开发机 全局开
减 token(输出) Caveman 让模型简洁输出 ❌ 有损 只在「不读中间过程」的代码生成 拿不准就别开
减 token(上下文) caveman-compress 压缩 CLAUDE.md 上下文文件臃肿时 推荐用
减循环 CodeGraph 知识图谱砍探索循环 大型项目 项目越大越用
提高缓存命中 Reasonix DeepSeek 专用低成本 agent 用 DeepSeek 时 用 DS 就配它
降低单价 LLM 路由 / Claude Code Router 按任务路由到不同模型 想既省钱又要效果 进阶必做

三条黄金认知:

  1. 成本 ≠ 单价;循环轮数才是成本杀手
  2. 少即是多;上下文要做减法。
  3. 杀鸡不用牛刀;路由是省钱空间最大的心法。

附录 B:名词还原表(需核对)

原文是语音识别稿,以下专有名词是我按上下文还原的,标 ⚠️ 的请务必核对真实名称/仓库地址后再使用。

文档采用 语音转写里的错误写法 说明 可信度
RTK (Rust Token Killer) IDK / RDK / 阿里K / 套k 减输入 token 的命令重写工具 · github.com/rtk-ai/rtk ✅ 已核对
Caveman skill kill man / q man / KM / 蹄子 减输出 token 的提示词 skill
caveman-compress calman compress / 卡曼 压缩 CLAUDE.md 的 skill
CodeGraph cot graph / color graph / code graph 知识图谱砍探索循环
Reasonix (DeepSeek-Reasonix) razon NYX / reasonix / linux / unix / union ux DeepSeek 专用低成本 agent · npx reasonix code ✅ 已核对
agenttrace entrance / agentchance 分析本地 agent 日志的 TUI 工具 · github.com/luoyuctl/agenttrace ✅ 已核对(发音+功能全合致)
Claude Code Router 克乐寇的 root 由 / 克乐寇 OpenCode 路由中间层
Claude Code cloud code / 克乐寇 Anthropic 官方编码 agent
Codex codex / code code OpenAI 编码 agent
OpenCode open code 开源编码 agent
Haiku / Opus 还酷 / haco · oppos / office Claude 模型(执行者/顾问者示例)
DeepSeek deep sik / DB sik / muc 国产模型
SuperPowers suu per powers / super powers 计划/工作流框架
all-hands / OpenAgent all my open agent 能力优先的路由框架
VibeCoding web coding / 外部搞定 / 外部靠定 本系列主题

整理自《VibeCoding 省钱指南》1–7 集视频转写稿 · 生成于 2026-07-14 配套速查:《VibeCoding省钱指南-一页速查.md》 · 工具名已联网核对(agenttrace / RTK / Reasonix)


← 返回 AI 编程