成本透明 · 截至 2026-09-12 实测 · n=46
跑一个 Issue 到底花多少钱
我们不在你的 token 上赚差价。对我们自己的仓库实测 46 次真实交付:单次中位 2,220,637 tokens、均值 4,742,066;按 DeepSeek V4.1 Flash 官方牌价,均值单次约 $0.06–0.12,跑 100 个 issue 约 $6–12。你的 key、你的账单、你在 Provider 后台看得见每一分钱。
想自己部署?交付核心永久免费 —— 自己运行 Orbi ↗
实测数据
46 次真实交付,在我们自己的仓库上实测
Orbi 的每次交付跑两个 Agent session —— 实现,外加一个能修分支、能重跑测试的独立审查。截至 2026-09-12,我们聚合了 orbi 仓库自身 n=46 次交付(Python、完整 CI、Issue 写得规范)的 session 日志。样本就是当天磁盘上还在的 worktree —— 会随 worktree 清理而变化 —— 所以 n 是截至标注日期的快照,不是永久事实。下面是按次统计的 totalTokens 完整分布 —— 也就是 Provider 实际计费的口径,含缓存读取:
| 分位 | 单次 totalTokens |
|---|---|
| p50(中位) | 2,220,637 |
| p75 | 3,961,248 |
| p90 | 13,290,932 |
| p95 | 16,555,250 |
| 最大 | 37,627,783 |
| 均值 | 4,742,066 |
数据来源,任何人可按此复核:orbi-build/orbi 仓库各 git worktree 的 Agent session 日志(<repo>/.worktrees/*/.pi-session/*.jsonl),聚合于 2026-09-12。一次交付 = 一个 worktree 的 implement + review session;单次 totalTokens = 该 worktree 全部记录的 usage.totalTokens 之和;n = 日志中含至少一条 usage 记录的 worktree 数(不记 usage 的新旧 session 不计);分位用 nearest-rank。样本会随 worktree 清理而变化。token 的去向:95.9% 缓存读取、3.4% 输入、0.7% 输出。
折算成钱
按 DeepSeek V4.1 Flash 官方牌价,一次交付几分钱
DeepSeek 公布价格 —— deepseek-flash(DeepSeek-V4.1-Flash):off-peak 时段缓存命中 $0.003/1M tokens、未命中 $0.15/1M、输出 $0.60/1M。peak 时段(工作日 01:00–04:00 与 06:00–10:00 UTC)恰好翻倍。把官方牌价套到实测分布上:
| 场景 | Off-peak | Peak |
|---|---|---|
| 单次交付(均值,474 万 tokens) | $0.058 | $0.115 |
| 单次交付(实测最大,3760 万 tokens) | $0.46 | $0.92 |
| 100 个 issue(按均值结构) | ~$5.77 | ~$11.55 |
金额按实测 token 构成(95.9% / 3.4% / 0.7%)对照 DeepSeek 公布的 deepseek-flash 官方牌价计算 —— api-docs.deepseek.com/quick_start/pricing,核实于 2026-09-11。
先说清楚三条限定
这一页不承诺的三件事
-
只测了我们自己
这是我们仓库的实测区间,不是对所有人的承诺
Python、完整 CI、Issue 写得规范,让我们的上下文保持很短。上下文更长、测试更慢、Issue 更模糊的仓库,分布会落在别处。上面的表格是什么就是什么:我们仓库的实测区间。
-
缓存是承重墙
95.9% 缓存读取,前提是 Provider 支持 prompt caching
整个成本结构压在缓存命中上。换到不支持 prompt caching 的端点 —— 每个 token 都按 miss 计价 —— 同样的工作成本大约要涨一个数量级。外推之前先查你的 Provider。
-
按计费口径统计
数字是 totalTokens,含缓存读取
这才是 Provider 实际计费的口径。只算 input + output 会漏掉约 96% 的真实消耗,把数字做好看 —— 那恰恰是这一页反对的事。
为什么这么便宜
缓存命中单价是 miss 的 1/50,而 95.9% 的工作都是命中
每次交付都在重读同一批仓库上下文:目录树、约定、Issue、失败的测试。prompt caching 把这些重复阅读变成按 $0.003/1M 计价的命中,而不是按 $0.15/1M 计价的 miss。就这一个比值,让一整次交付 —— 实现加上能修能重跑的独立审查 —— 只要几分钱。这也是问任何 BYOK Agent 厂商时唯一诚实的问题:你的 token 里命中占比多少?你的 Provider 对命中收多少钱?
$200 档,供对照
竞品报的是额度,我们报的是 token 和价格
$200 档的托管 Agent 不公布你的钱买到了什么。以下说法对照他们的官方文档核实:
-
DEVIN
"A daily and weekly usage quota" —— 没有数量,没有单价
Pro($20/月)包含 "a daily and weekly usage quota";Max($200/月)是 "a significantly larger weekly usage quota (with no daily cap)"。整个页面上,Cognition 没有写出任一档包含多少 ACU、一个 ACU 值多少钱。
来源:docs.devin.ai/admin/billing/self-serve —— 核实于 2026-09-11。
-
FACTORY
"~5x Pro usage" / "~10x Pro usage" —— 没有任何绝对值
Plus($100/月)是 "~5x Pro usage";Max($200/月)是 "~10x Pro usage"。页面上找不到任何绝对 token 量,也没有 per-token 价格。
来源:docs.factory.ai/pricing/individuals —— 核实于 2026-09-11。
| 订阅 | 模型费 | 总计 | 产出打 Tag 的 Release | |
|---|---|---|---|---|
| Orbi + DeepSeek | 自托管 $0;Cloud US$79/月,含 300M token(Founding 券 100% off,限量) | 实测约 $6–12(自托管);Cloud 已含 | 自托管 $6–12;Cloud US$79 | 是 —— 审查过的 PR、精确合并、打 Tag 发 Release |
| Devin Max | $200 | 额度未公布 | $200+ | 文档止于 PR("from prompt to PR") |
| Factory Max | $200 | "~10x Pro usage",无绝对值 | $200+ | 无打 Tag/Release 流程记载 |
Devin 行依据 docs.devin.ai/admin/billing/self-serve;Factory 行依据 docs.factory.ai/pricing/individuals —— 均核实于 2026-09-11。Orbi 模型费即上文的实测区间。
你的 key,你的账单
拿你自己的后台对一遍这些数字
用你自己的 DeepSeek key 跑 Orbi,Provider 的用量页会显示每一次交付、每一个 token、每一分钱。这就是全部主张:我们和你和账单之间,什么都没有。