成本优化 · 2026 · 官方实测图号 GP-COST-01 · 记账单位

成本按每个任务算,
几种省钱做法的实测结论反转

这份 Anthropic 官方实测回答的不是“哪个模型单价最低”,而是完成一个合格任务到底花多少钱。换成这个口径后,答案很清楚:先清理缓存和旧提示词造成的浪费,再测同一个模型的 effort;有可靠验收时,低档先跑、只重试失败任务,成本可以降到约一半。多模型反而要最后考虑。

主料Claude Platform Docs《Optimizing for cost and intelligence》 实测Anthropic 内部运行 · 2026 年 7 至 8 月 审核数字逐条核对 · 19 张原图逐张开图复核 日期2026-08 · 版次 v1
按 token 计价 按每个任务计价 贵 省 Fable 5 · 5 倍单价 低档 $0.76 Sonnet 5 · 基准价 默认档 $0.84 Opus 5 · 2.5 倍 这批运行早于它 DeepResearch Bench II · 50 题子集 · 换记账单位后顺序反过来

GenAI Playbook · 忠实还原官方文档 · 全部实测数字均为 Anthropic 内部运行,原文写明结果是方向性的、不构成保证

第一类 · 质量不变

先拿掉不影响质量的多余成本

成本优化先分两层。缓存、批处理和提示词清理是在减少浪费;换模型、调参数则是在成本和质量之间做取舍。第一层里,提示缓存的影响最大。

agent 会带着工具连续工作很多回合。每进入下一回合,系统提示、工具定义和此前的对话都要再次提交。一个任务跑 40 回合,第一回合的内容就会提交 40 次。

提示缓存不会减少这些重复提交,只会降低它们的价格。请求开头连续不变的部分命中缓存后,按普通输入价的十分之一计费。agent 的相邻回合通常只隔几秒,缓存仍然有效,因此大部分旧内容都能按低价读取。

0.1×
前缀命中后的缓存读取,按输入价的十分之一计费
3.7×
WideSearch 上开缓存后每题成本降为原来的 1/3.7
12%
缓存加输入裁剪后,分诊账单只剩基线的 12%
50%
批处理每个 token 打五折,缓存过的也打折
$0$5$10 $15$20 Claude Fable 5 · WideSearch Claude Fable 5 · DeepResearch Bench II Claude Sonnet 5 · DeepResearch Bench II $5.5 $20 降为 1/3.7 $2.4 $6.0 降为 1/2.5 $0.80 $2.8 降为 1/3.4 关缓存 开缓存
图 1 · 每题成本,按同一批逐请求计费记录重新计价 · 这几次运行的命中率是 81% 到 90% · WideSearch 要求广泛搜索网页并填出一张多行表格,按完整度和准确度打分;DeepResearch Bench II 要求写研究报告,按专家定的细则逐条判分 · 重画自官方图

在一组 issue 分诊实验里,claude-sonnet-5 处理 20 个带截图的真实 bug 报告。只开缓存就省掉 83%;再缩放图片、减少无关工具输入,账单一共下降 88%。这组降幅来自缓存和输入裁剪,与把请求路由给小模型无关。

长任务还有第二层节省:对话足够长时,上下文压缩会缩短早期内容。图 2 右侧显示,缓存后的 $1.34 又降到 $0.83。但短任务达不到触发门槛,不能把这 38% 当成普遍收益。

20 个 issue 那轮(基线 $3.32) 长任务那轮,token 量 2.6 倍(基线 $8.56) 0$1$2$3 $3.32$0.58$0.39 占基线 17%占基线 12% 基线 加提示缓存 再加输入裁剪 图片缩放 · 工具搜索 0$0.4$0.8 $1.2$1.6 $1.34$0.83 又少 38% 开提示缓存 加上下文压缩 触发一次
图 2 · 同一个分诊任务,跑在某大型公开仓库的冻结快照上 · 每根柱子是一次运行,同一面板内逐级累计 · 两个面板刻度不同 · 重画自官方图

改 effort、中途调整任务预算或清理上下文,都会使已有缓存失效。这些变化应放在自然断点上,变更后还要检查缓存读取量是否下降。

不需要即时结果的请求可以走批处理,每个 token 五折,缓存过的 token 也打折。代价是结果可能在 24 小时内的任意时刻返回。Anthropic 托管的 agent 运行环境 Claude Managed Agents 不支持这种方式,因为它面向交互会话。

名义免费,实测不免费

上下文清理会移除过期的工具返回结果,但也会重写已经缓存的对话。在这次实测里,重写缓存的成本高于清理带来的节省。它用于腾出上下文空间;这组数据不支持把它当作降本手段。

同一类 · 但常被漏掉

旧提示词会让新模型多花钱

上一代模型可能需要“核对两遍”“尽可能详尽”或强制分步流程。新模型会更认真地执行这些旧要求,增加工具调用和输出。模型升级了,提示词没有升级,额外能力就可能变成额外账单。

这组对照使用 44 张客服工单和六份旧提示词。下表中的准确率变化若小于约 5 点,按运行噪声处理。

配置准确率每工单成本这一步换到了什么
Claude Opus 4.8 + 旧提示词89.5%2.52 分起点
Claude Opus 5 + 同一份旧提示词91.8%3.43 分贵 36% 准确率没有变化
Claude Opus 5 + 审计后的提示词97.0%2.93 分便宜 14% 准确率升到 97%
Claude Sonnet 4.6 + 旧提示词81.1%1.72 分起点
Claude Sonnet 5 + 同一份旧提示词83.9%1.61 分准确率差异在噪声内
Claude Sonnet 5 + 审计后的提示词85.6%1.39 分省 14% 准确率不变
1.01.52.0 2.53.03.5 808590 95100 每工单成本(分) 正确处理的工单占比(%) Claude Opus 4.8 · 旧提示词 Claude Opus 5 · 同一份旧提示词 Claude Opus 5 · 审计后 Claude Sonnet 4.6 · 旧提示词 Claude Sonnet 5 · 同一份旧提示词 Claude Sonnet 5 · 审计后 旧模型 · 旧提示词 新模型 · 同一份旧提示词 新模型 · 审计后的提示词 圆点 = Opus 迁移线 · 菱形 = Sonnet 迁移线
图 3 · 客服工单评测,44 张工单、确定性判分,每个点是跨提示词与工单的均值 · 重画自官方图

Claude Opus 5 沿用 Claude Opus 4.8 的旧提示词后,每张工单贵 36%,准确率没有变化。审计提示词后,成本比使用未审计提示词时低 14%,准确率从 92% 升到 97%。36% 的比较基准是新旧模型使用同一份旧提示词;审计前后的降幅是 14%。

逐条实验显示,旧提示词会产生两种税:有些要求只增加工具调用和输出,有些要求已经不适合新模型,会导致准确率下降。

成本变化(每工单的分,负数是省钱) 准确率变化(点,正数是提升) 灰带内 = 小于约 5 点,属噪声 -1.5-1.0-0.50+0.5 -50+5+10+15 "Verify twice before submitting" "Be maximally thorough" 强制六步流程 自建的思考草稿区 互相矛盾的规则 已废弃的 thinking 设置 −1.43 −0.44 −1.19 −0.12 −0.53 −0.72 −0.31 −0.23 +0.20 +0.01 +0.31 +0.10 −2.3 −2.3 +6.8 +1.1 +0.0 +2.3 +9.1 −5.7 +6.8 +13.6 +11.4 +1.1 Opus 5 Sonnet 5
图 4 · 每份提示词各带一种陈旧写法 · 柱子是审计后减审计前的差值,44 张工单取均值 · 重画自官方图

去掉“核对两遍”和“尽可能详尽”后,Claude Opus 5 的工单成本明显下降;清除冲突规则、旧 thinking 设置和自建思考草稿区后,准确率恢复。同类旧要求也可能藏在工具描述和 skill 中。

缓存、批处理和提示词审计解决的是重复计费与无效指令造成的浪费。接下来的模型与参数选择,开始涉及成本和质量之间的取舍。

换一个记账单位

别看单价,先看任务总成本

完成任务的总成本同时受单价、回合数、搜索量和返工次数影响。能力更强的模型虽然每 token 更贵,却可能用更少步骤完成同一件事。比较模型时要计算任务通过验收之前的全部花费,包括失败和重试。

DeepResearch Bench II 用研究报告任务测试了这种差异。完整点值见下表。

配置评分每个任务的完成成本
Claude Fable 5 · 低档60.2 分$0.76
Claude Sonnet 5 · 默认档56.0 分$0.84

Claude Fable 5 低档的每 token 价格约为 Claude Sonnet 5 的 5 倍,但它完成一个任务反而便宜约 10%,得分也更高。这批运行早于 Claude Opus 5 发布,因此图里没有 Claude Opus 5。

另一项测试给出了不同结果。SWE-bench Pro 测的是在真实仓库中修复代码并通过测试。在这页使用的子集上,Claude Opus 5 单跑 91.7%,Claude Fable 5 单跑 91.3%,差距落在运行噪声内;前者成本约为后者的 60%。

任务类型一变,排序就可能改变。价目表无法提前告诉工程团队结果,只能在自己的任务样本上比较每个候选的完成成本。

官方要求跟着改的另一条口径

官方建议重点看最难的那一成任务。典型任务往往谁都能完成,差距不大;真正拉高账单的,是会失败、会重试、会反复搜索和验证的尾部任务。

即使全部任务都成功,成本也可能高度集中。20 题 WideSearch 跑 3 次后,最贵两题只占题量的 10%,却占总成本的 43%。

$0 $20 $40 $60 $80 $100 $120 1 5 10 15 20 20 道 WideSearch 题目,按成本从高到低排 · Claude Fable 5 成本($,三次运行合计) 最贵的两题(占题数 10%)合计占 43% 其中最贵的那一题单独占 30% 最便宜的一半合计只占 10%
图 5 · 按每一次任务的计费记录算,三次运行合计 $421 · 重画自官方图

模型选择之前还少一步:先把同一个模型的 effort 曲线画出来。

同一个模型内部

effort 没有通用的省钱档

effort 控制模型思考、调用工具和自我核对的程度,默认档就是 high。调低它,有时几乎只减少成本;有时会明显降低任务完成率。区别取决于任务是否真的需要更高强度的推理。

实测出现两种曲线。研究和知识工作的曲线接近平坦;长周期编码的曲线更陡。两种形状对应相反的选档结论。

WideSearch (Claude Fable 5) 74 76 78 80 82 84 3 4 5 6 每个任务的完成成本($) low medium default 每点 3 次运行 DeepWideSearch (Claude Fable 5) 60 62 64 66 68 70 3 4 5 6 每个任务的完成成本($) low medium default 协调者 + 一个 Sonnet 5 worker 每点 3 次运行 BrowseComp (Claude Fable 5) 74 76 78 80 82 84 4.0 4.5 5.0 5.5 6.0 6.5 每个任务的完成成本($) low medium default 图注 3 次,出处清单 1 到 3 次 GDPval (Claude Fable 5) 78 80 82 84 86 88 1.0 1.5 2.0 2.5 3.0 3.5 每个任务的完成成本($) low medium default 每点 1 次运行,成本含判分 SWE-bench Pro (Claude Opus 5) 80 85 90 95 0.4 0.8 1.2 1.6 每个任务的完成成本($) low medium default 默认档 2 次运行,其余 1 次 准确率(%) 两种形状 研究与知识工作(上排与 GDPval):线近乎 水平,低档已经买到大部分准确率,只花 三分之一到一半的成本。 长周期编码(SWE-bench Pro):线是陡的, 更高档确实能提高这类任务的准确率。 每个点按计量 token 现价计价;default 按 high 档提供。各面板刻度不同,跨度 10 到 15 点。
图 6 · 每个面板画的是一个模型在一个基准、同一批任务上的三档 effort · 纵轴均不从零起 · 重画自官方图
基准低档中档默认档
WideSearch
广泛搜网页并填出一张多行表格
78.5% / 约 $2.979.8% / 约 $4.280.0% / 约 $5.9
DeepWideSearch
同时要求收集很多行与多跳检索
64.9% / 约 $3.465.9% / 约 $4.666.4% / 约 $6.1
BrowseComp
浏览类 agent 找难找的事实
78.5% / 约 $4.281.5% / 约 $5.381.3% / 约 $6.15
GDPval
真实经济价值的知识工作交付物
83.5% / 约 $1.4584.0% / 约 $2.2583.1% / 约 $3.2

四个基准均使用 Claude Fable 5。WideSearch 与 DeepWideSearch 每点 3 次运行;BrowseComp 的图注写 3 次,而出处清单写的是每档 1 到 3 次;GDPval 每点 1 次运行且成本含判分。

四组研究与知识工作测试的结论接近:中档与默认档分数相近,成本却明显更低。BrowseComp 和 GDPval 的默认档甚至略低于中档,但这点差异不能解释为“档位越高越差”。

低档通常也更快。DeepWideSearch 上,低档每题 4.5 分钟,默认档 7.9 分钟。

长周期编码是另一种情况。Claude Opus 5 跑 SWE-bench Pro 时,中档成绩降低约 2 点,成本约为一半;低档成绩降低约 8 点,成本约为四分之一。这里的降档是在明确交换成本和任务完成率。

如果任务已经接近模型的能力上限,每升一档都可能买到分数。图 7 中,每档约增加 2.4 点,没有免费的降本空间。

586062 6466 0.51.01.5 2.02.5 每任务成本($,牌价) 细则评分(%) low · 60.2 分 / $0.77 medium · 62.7 分 / $1.48 high(默认)· 65.1 分 / $2.38 每上一档约买到 2.4 点 这条曲线上没有免费的成本削减
图 7 · Claude Fable 5,DeepResearch Bench II 的 50 题子集,每档 3 次运行 · 纵轴从 58 起 · 重画自官方图

曲线形状无法从任务名称直接判断,只能从真实样本测出来。每个档位应放在独立会话中运行,避免中途改 effort 导致缓存失效,扭曲成本对比。

文档把这条单模型曲线作为多模型方案的比较基线。如果同一个模型使用较低 effort 已经达标,就没有必要先增加架构复杂度。

允许它花到什么程度

三种限制,三种作用

这三种做法都会限制单次任务的花费,但机制不同。失败重试把高成本留给少数失败任务;任务预算让模型主动收敛;max_tokens 只会截断单次响应。模型能不能看见限制,决定了它会主动节省,还是被动失败。

有可靠验收时,先跑低档,只重试失败任务

官方测试的策略是:如果结果可以自动验收,不必给所有任务购买同一档能力。先用低档处理全部任务,只把明确失败的部分交给默认档重试,高成本就只落在少数任务上。

828486 88909294 0.20.40.6 0.81.01.2 1.41.6 每任务成本($,已含失败的那次便宜尝试) pass@1(%) low 单跑 · 84.0% / $0.37 medium 单跑 · 89.4% / $0.72 default 单跑 · 91.7% / $1.39 low 全跑,失败的用默认档重跑 93.1% / $0.70 medium 全跑,失败的用默认档重跑 94.0% / $0.95 固定档单跑(小点 = 默认档的两次运行) 全跑低档或中档,只重试失败的
图 8 · Claude Opus 5,SWE-bench Pro 的 482 题子集 · 结果按任务逐一汇总自同一批 effort 测试 · 纵轴从 82 起 · 重画自官方图

图 8 中,低档加失败重试达到 93.1% / $0.70;默认档单跑是 91.7% / $1.39。通过率相当,前者成本约为一半,而且已经把第一次失败的费用算在内。官方把小幅提分主要归因于“多一次尝试”,高档并非主要原因。

这套策略还会增加失败任务的延迟,因为它们需要完整运行两次。成本下降来自按需购买高档能力,同时牺牲了部分任务的响应时间。

任务预算能省钱,因为模型看得见它

任务预算向模型显示整个任务还剩多少 token。模型会减少低价值搜索和重复验证,并在预算内收尾。这种限制从任务开始就影响执行过程。

86889092 1.01.41.82.2 每任务成本($,牌价) pass@1(%) 20,000 token 35,000 token 无预算 最紧的预算:让出 4.4 点,换来 47% 的成本下降 输出 token 沿这条阶梯下降 41% 到 64%
图 9 · Claude Fable 5,SWE-bench Pro,每个预算档 482 题全部计分 · 运行次数在原文两处的说法不一致,见文末口径 · 重画自官方图

最紧的实测设置省下 47% 的成本,同时使成绩降低 4.4 点。较低成本来自减少搜索和验证,质量也随之下降。

官方建议从循环的 90 分位 token 用量附近起步,再逐步收紧。任务预算是建议性的,只引导模型,不会强制停止任务;预算过紧时,模型还可能表现出类似拒答的行为。

max_tokens 只截断响应,不会让模型主动节省

max_tokens 是模型看不见的单次响应上限。达到上限后,响应会被截断;模型不会提前规划,也不会主动删除低价值步骤。被截断的尝试仍然产生费用。

Claude Opus 5:16k 上限下解出 53%,64k 下解出 58% Claude Fable 5:16k 上限下解出 33%,64k 下解出 55% $0$10$20 $30$40$50 $18 $19 $34 $33 每次尝试每解出一题 $17 $29 $53 $53 每次尝试每解出一题 max_tokens 16,384 max_tokens 64,000 被 16k 上限截断的尝试,没有一次解出
图 10 · 一套约 130 个仓库任务的内部基准,2026 年 8 月,纯 API agent 循环,每题一次尝试 · 16,384 那组是两次运行均值,64,000 那组是单次运行 · 重画自官方图

Claude Fable 5 的上限从 64,000 压到 16,384 后,每次尝试的成本从 $29 降到 $17,但成功率也下降,每解出一题的成本仍然是 $53。较低上限还截断了三分之一的尝试,而且这些被截断的尝试没有一次成功。

问题来自极少数很长的关键回合。它们在所有回合中占比很低,却决定了大量任务能否完成。

1001,000 10,000100,000 单回合输出 token(对数刻度) 16k 上限 32k 64k 128k 最大值 Claude Opus 5 Claude Fable 5 中位245 90 分位1,894 99 分位8,813 最长一回合33,363 只有 0.22% 的回合超过 16,384 token,而这个上限终止了 15% 的尝试 中位293 90 分位2,134 99 分位13,005 最长一回合59,499 0.55% 的回合超过 16,384 token,而这个上限终止了三分之一的尝试
图 11 · 同一套内部仓库任务 · Claude Opus 5 那次运行的上限是 64,000,Claude Fable 5 是 128,000,两次运行都没有任何回合撞到自己的上限 · 重画自官方图

官方因此把 max_tokens 定位为安全阀,并建议把 stop_reason: max_tokens 当作失败处理。省钱应交给模型看得见的任务预算,以及有验收信号的失败重试。

控制项模型看得见吗负责哪件事撞线时
任务预算
建议性,beta
看得见让模型主动收敛,能省钱引导而非强行停住,需验证遵守情况
max_tokens
单次响应上限
看不见防止单次响应无限增长的安全阀,本身省不到钱返回 stop_reason: max_tokens,当失败处理
会话预算
Claude Managed Agents
平台侧强制硬性美元停止,按牌价对 token、搜索和会话时长计算会话暂停并返回 stop_reason: budget_reached,抬高预算可继续
官方的建议

会话预算对任何有牌价的模型都生效,包括 Claude Sonnet 5,并且能和建议性的任务预算叠加。官方建议三者一起设置,并以工作区花费上限作为最终保护。这些单模型控制仍无法满足目标时,再评估第二个模型。

加第二个模型

多模型只在很窄的条件下省钱

多模型的省钱条件很具体:顾问式要求执行模型真的开口求助;协调者式要么压住例行任务偶发的高成本,要么处理大到单个上下文装不下的语料。如果单模型调低 effort 已经达标,加第二个模型通常只会增加编排成本。

两种架构的区别在于主循环由谁控制。顾问式让便宜模型负责执行,只在需要判断时调用强模型;协调者式让强模型拆分任务,再由便宜 worker 处理各个分片。

顾问式 · 便宜模型握住主循环 主循环 执行者 Claude Sonnet 5 每回合都跑 工具调用 交回一份方案 顾问 Claude Fable 5 按需调用 只为实际发生的咨询支付强模型费用,效果取决于能力差距和求助率。 协调者式 · 强模型握住主循环 主循环 协调者 Claude Fable 5 拆分与合并 派活 worker 1 Claude Sonnet 5 worker 2 Claude Sonnet 5 worker 3 Claude Sonnet 5 大部分 token 按 worker 价计价,代价是要为一次规划、一次交接和一次合并付费。
图 12 · 官方给出的两种多模型形状,区别在主循环握在谁手里 · 重画自官方两张架构图

顾问式:模型间有能力差距,而且执行者确实会求助

文档把顾问式的成败归结为两个条件。第一,顾问必须拥有执行者缺少的能力;两个模型越接近,可借到的能力越少。第二,执行者必须知道何时求助。顾问只有被实际调用,其能力才会作用于任务结果。

求助率记录实际调用顾问的任务占比。图 13 的六组配对显示,实际提升大体跟着求助率变化。

0 10 20 30 -5 准确率点数 Claude Haiku 4.5 执行 + Claude Opus 5 顾问 · GPQA Diamond +26 点 / 可得 29 点 求助率 90% Claude Opus 5 低档执行 + Claude Fable 5 顾问 · 读图 +18 点 / 可得 25 点 求助率 86% Claude Sonnet 5 执行 + Claude Opus 5 顾问 · SWE-bench Pro +9.5 点 / 可得 16 点 求助率 73% Claude Sonnet 5 执行 + Claude Opus 5 顾问 · GPQA Diamond +4.5 点 / 可得 5 点 求助率 37% Claude Opus 5 执行 + Claude Fable 5 顾问 · 编码任务 +1.3 点,可得差距几乎为零 求助率 100% Claude Sonnet 5 低档执行 + Claude Opus 5 顾问 · SWE-bench Pro −5.4 点 / 可得 16 点 求助率只有 7%,成绩低于执行者单跑 可得差距(顾问那个模型单跑减执行者单跑) 配对实际提升
图 13 · 每一行是这页测到的一组配对 · GPQA 与读图每种配置各跑两次;SWE-bench Pro 与编码任务的运行次数在原文两处说法不一致,见文末口径 · 重画自官方图

求助率达到 90% 时,执行者拿到了大部分可借用的能力;73% 时仍有明显增益。到了 7% 那组,顾问原本比执行者高 16 点,但执行者几乎没有调用它,最终成绩反而下降 5.4 点。

求助率可以受提示词影响。只提供工具说明时,执行者可能很少调用顾问;测试使用的系统提示要求在动手前和收尾前各问一次,平均每个任务产生两到三次咨询。

顾问式能否省钱,取决于少数几次短咨询能否替代强模型执行完整任务。如果执行者不问,或者每个回合都需要强模型,配对就没有价格优势。

内部编码基准(370 个仓库任务)解出每次尝试
Claude Opus 5 执行 + Claude Fable 5 顾问85.7%$8.40
Claude Opus 5 单跑默认档84.4%$8.50
Claude Fable 5 单跑中档83.4%$8.20
Claude Opus 5 单跑低档74.3%$1.9
Claude Opus 5 单跑中档82.1%$4.5
Claude Fable 5 单跑低档78.7%$5.4
Claude Fable 5 单跑默认档85.1%$11.9

纯 API agent,2026 年 8 月。默认档设置与配对都是每题五次尝试,降档设置各一次。配对平均每次尝试约两次顾问咨询。一两点的差异在运行间噪声内。

Chartography(读图)低档中档默认档
Claude Opus 5 单跑49 分 / $0.3875 分 / $0.9479 分 / $1.95
Claude Fable 5 单跑55 分 / $0.8173 分 / $1.4474 分 / $1.74
Claude Opus 5 低档执行 + Claude Fable 5 顾问67.5 分 / $0.60(两次运行散点 65 分 / $0.47 与 70 分 / $0.73)

Chartography 的发布方 Surge AI 发布的 100 题全集,2026 年 8 月,跑在 Claude Managed Agents 上,每种配置各跑两次取均值,运行间离散度 4 到 10 点。

Chartography · 读图(分 / 每任务成本) 内部编码基准(解出比例 / 每次尝试成本) $0.00 $0.50 $1.00 $1.50 $2.00 $0 $4 $8 $12 45 55 65 75 85 72 76 80 84 88 每任务成本($,牌价) 每次尝试成本($) low medium default low medium default low medium default low medium default 配对 67.5 分 / $0.60 配对 85.7% / $8.40 Claude Opus 5 单跑(按 effort) Claude Fable 5 单跑(按 effort) 执行者 + 顾问配对(小点 = 配对的两次运行)
图 14 · 左为 Chartography 读图基准(Claude Opus 5 低档执行 + Claude Fable 5 顾问),右为内部编码基准(Claude Opus 5 执行 + Claude Fable 5 顾问)· 两个面板刻度不同 · 重画自官方图

内部编码基准里,配对配置得分最高,但只领先一两点,仍在运行噪声范围内。官方把它视为一种需要在自身任务上复测的结果,不是省钱承诺。

读图测试中,配对比执行者单跑中档和默认档便宜,但后两者分数更高。这组配对的执行者在 86% 的任务上调用顾问,说明求助率决定了配对能否同时提高成绩并降低成本。

按官方的判断

官方认为,顾问式适合大部分回合偏机械、而方案质量决定结果的工作:编码 agent、计算机操作、多步研究流水线。不适合的情形有三种:每个回合都确实需要顶级能力;任务是无需规划的单轮问答;或者执行者本身已经接近顾问的能力。

协调者式:两种任务结构才有成本优势

第一种情形是压住例行任务的成本尾巴。强模型偶尔会在本来能做对的题上反复尝试,少数异常昂贵的任务把平均账单拉高。把这些工作交给便宜 worker 后,偶发的反复尝试按更低价格计费。

$0$20$40 $60$80 每次运行成本($)· 配对 50 次全部答对,单跑 70 次里答对 68 次 越靠左越便宜 Claude Fable 5 协调 + 一个 Claude Sonnet 5 worker Claude Fable 5 单跑 期望 $6.45 90 分位 $12 最差一次 $42 期望 $11.99 90 分位 $33 最差一次 $84 单跑最贵的那一次($84)答案还是错的
图 15 · BrowseComp 里挑出 10 道单模型能稳定做对的题,取自一个 26 题切片;配对跑 50 次即每题 5 次,单跑 70 次;委派侧成本带约 ±20% · 重画自官方图

在 10 道单模型本来能稳定做对的题上,协调配置把平均成本从 $11.99 降到 $6.45,90 分位从 $33 降到 $12。便宜 worker 承担了例行任务中的偶发高成本。换到完整难题集后,强模型低档单跑反而便宜 22% 到 30%。

第二种情形是语料大到一个上下文窗口装不下。单模型只能分段读取,并反复带上自己的状态;协调者可以把语料分给多个 worker 并行处理。这项测试使用了 2,160 万 token 的代码语料。

$200$300$400 $500$600$700 $800 0.700.750.80 0.850.90 每轮全包成本($) 找出的植入缺陷(F1) low · 0.775 / 约 $740 medium · 0.839 / 约 $720 high(默认)· 0.877 / 约 $764 Claude Sonnet 5 单跑 · 0.762 / 约 $228 Claude Fable 5 lead + Claude Sonnet 5 worker 0.808 / 约 $332 比 Fable 5 任何一档单跑便宜 55%,比中档与默认档低 3 到 7 点 单跑成本几乎不随 effort 变化($720 到 $764,在种子噪声内): 成本主要花在读那 2,160 万 token 的语料上, 因此在这项任务中,effort 只改变准确率。 Claude Fable 5 单跑(按 effort) Claude Sonnet 5 单跑 Fable 5 lead + 多波 Sonnet 5 worker
图 16 · 2,160 万 token 的公开 Python 源码语料,植入 130 个缺陷,确定性判分 · 每种配置各跑 3 次,协议在开跑前就固定并经内部复核 · 纵轴从 0.70 起 · 重画自官方图

这类任务的主要成本是读取语料,所以调低 effort 几乎不改变账单。协调配置虽然读取的总 token 更多,成本仍降到约 $332,比 Claude Fable 5 任何一档单跑便宜 55%。

它没有达到最高准确率,但成本更低,等待时间也更短。实际运行时间从 11.4 小时降到 1.9 小时。

图中的 F1 同时衡量缺陷找得全不全、判得准不准,只能在这套语料内部比较。

什么时候不该建协调者

官方的判断是,如果任务是一条前后依赖的链、能装进一个上下文,或者单模型低档已经达到验收标准,协调者通常没有成本优势。拆分、交接和合并本身都要付费。

因此,文档给出的测试顺序是:先测同一个模型的 effort 曲线;仍有缺口,再测更强模型低档单跑;只有多模型配置能打败这条基线,才值得增加编排。顾问式真有优势时,落地可以只是增加一个工具定义,不必重做整套架构。

落到自己的流量

先测单模型,再测多模型

这些数字来自 2026 年 7 月和 8 月,会随模型、价格和任务结构变化。可复用的不是某个配置的固定答案,而是测量顺序:先建立单模型基线,再判断多模型是否填补了真实缺口。

取样,并定好结果检查项

从生产日志里按真实流量比例抽一批任务,为每个任务定好结果检查项(测试通过、工单关闭、行数对得上),并把完成每个任务的成本记在分数旁边。

按不同努力级别分别运行单模型基线

不只跑默认档,把分数与花费的关系画出来。多模型配置必须打败单模型的整条曲线。

只在单模型基线仍有缺口时测试多模型

如果单模型曲线无法同时达到目标质量和成本,再加入合适的多模型策略并重跑整套评测。

先跑影子流量,再切换

胜出的配置先在少量影子流量中运行,再切换,并让这套评测持续运行。

四步分别是:从生产流量中抽取代表性任务并定义验收条件;扫描不同模型和 effort,画出单模型的质量与成本曲线;只有基线仍有缺口时才测试多模型;胜出的配置先在少量影子流量中运行,再持续重测。

计算每个任务的成本时,需要把输入、缓存写入、缓存读取和输出 token 分别按各自费率计费,再按任务累加。

python # 每百万 token 的价格取自价目表;换模型只改这两行 INPUT_PER_MTOK = 5.0 # Claude Opus 5 OUTPUT_PER_MTOK = 25.0 usage = response.usage cost = ( usage.input_tokens * INPUT_PER_MTOK # 缓存写按输入价的 1.25 倍(五分钟档);缓存读按 0.1 倍 + (usage.cache_creation_input_tokens or 0) * INPUT_PER_MTOK * 1.25 + (usage.cache_read_input_tokens or 0) * INPUT_PER_MTOK * 0.10 + usage.output_tokens * OUTPUT_PER_MTOK ) / 1_000_000
官方给出的自检方法

官方还给出一项自检标准:agent 循环里缓存读通常是这四项里最大的一项。如果不是,需要检查缓存是否实际生效。

容易忽略的一处

开启顾问工具或上下文压缩后,部分 token 只出现在 usage.iterations 中,不会进入顶层合计。计费时需要逐项累加这些记录,advisor_message 对应的费用则按顾问模型计价。

这套顺序把免费降本放在前面,把质量取舍放在后面,把多模型留到最后。具体读数会变化,比较方法可以重复使用。

口径

口径与限制

全部实测结果都是 Anthropic 内部运行这些基准得到的,不是第三方复现。标 notional USD 的图,其金额根据每次请求的 token 数和牌价计算,并非发票金额。除另有注明外,成本均按 2026 年 8 月牌价计算,Claude Sonnet 5 按每百万 token 输入 $2、输出 $10 计。原文自己写明这些结果是方向性的、不构成保证。

基准可比性限制
SWE-bench Pro用的是为适配 Anthropic 评测框架挑出的 482 题子集,分数不可与公开榜单比较;max_tokens 那组用的是从中再分层抽出的 100 题子集,与 482 题的分数也不可比
Chartography由 Claude Sonnet 4.6 判分且带工具运行,只在本页各配置之间可比,不可与公开榜单比较
GDPval由 Claude 模型判分,绝对分可能与已发布结果不同
DeepResearch Bench II由 Claude Opus 4.6 判分,原基准用的是另一个判分模型,Anthropic 的判分模型可能偏向自家风格;这批运行早于 Claude Opus 5,所以模型对比那张图里没有 Claude Opus 5
超大语料基准F1 绝对值只在这套语料构建里有意义

运行次数。SWE-bench Pro 上 Claude Opus 5 默认档的数据取两次运行均值,降档配置均只运行一次;max_tokens 64,000 那组是单次运行;内部编码基准每种配置各跑一次;GDPval 的每个数据点来自一次运行。

原文在运行次数上有两处自相矛盾,两种说法并列,不作合并

两处都是官方文本,无法判定哪个为准,故本文不采用任一说法作为定论,也不影响任何点值本身。

① 任务预算那张图的图注写的是 35k = mean of two runs(35,000 档为两次运行均值),而出处清单第 3 条写的是 the task-budget figures are one run per budget(每个预算档各一次运行)。出处清单另写明每一次带预算的运行都完整跑完了 482 题且没有出现框架错误。

② 顾问机制那张图的图注写的是 SWE-bench Pro 与编码任务每种配置各跑一次,而出处清单第 3 条把该基准上的两组配对分开写:默认档那组跑了两次(a run and an exact replication),低档那组一次。

噪声带。客服工单评测里准确率变化小于约 5 点属噪声,Claude Opus 5 准确率增益的 95% 置信区间是 3 到 8 点,Claude Sonnet 的准确率差异在噪声内;分诊那组 $0.10 以内属噪声;Chartography 两次运行间离散度 4 到 10 点;超大语料基准里 $720 到 $764 属种子噪声;内部编码基准里一两点的差异在运行间噪声内。

两个 BrowseComp 切片不能混用。成本保险那组用的是「单模型能稳定做对的 10 题」,取自 26 题切片,委派侧成本带约 ±20%;努力级别那组用的是 500 题切片。

外部引用。原文引的那份关于 agent 系统规模化的研究(Kim 等人)只为“什么时候委派不划算”这一判断提供方向性支持,原文明确不采用其中任何数字。

实现差异。DeepSWE 那组使用客户端顾问循环,而非顾问工具。Chartography 的求助率对照来自 Messages API 上的一次复测;复测使用相同配置和一套容器工具。