成本按每个任务算,
几种省钱做法的实测结论反转
这份 Anthropic 官方实测回答的不是“哪个模型单价最低”,而是完成一个合格任务到底花多少钱。换成这个口径后,答案很清楚:先清理缓存和旧提示词造成的浪费,再测同一个模型的 effort;有可靠验收时,低档先跑、只重试失败任务,成本可以降到约一半。多模型反而要最后考虑。
先拿掉不影响质量的多余成本
成本优化先分两层。缓存、批处理和提示词清理是在减少浪费;换模型、调参数则是在成本和质量之间做取舍。第一层里,提示缓存的影响最大。
agent 会带着工具连续工作很多回合。每进入下一回合,系统提示、工具定义和此前的对话都要再次提交。一个任务跑 40 回合,第一回合的内容就会提交 40 次。
提示缓存不会减少这些重复提交,只会降低它们的价格。请求开头连续不变的部分命中缓存后,按普通输入价的十分之一计费。agent 的相邻回合通常只隔几秒,缓存仍然有效,因此大部分旧内容都能按低价读取。
在一组 issue 分诊实验里,claude-sonnet-5 处理 20 个带截图的真实 bug 报告。只开缓存就省掉 83%;再缩放图片、减少无关工具输入,账单一共下降 88%。这组降幅来自缓存和输入裁剪,与把请求路由给小模型无关。
长任务还有第二层节省:对话足够长时,上下文压缩会缩短早期内容。图 2 右侧显示,缓存后的 $1.34 又降到 $0.83。但短任务达不到触发门槛,不能把这 38% 当成普遍收益。
改 effort、中途调整任务预算或清理上下文,都会使已有缓存失效。这些变化应放在自然断点上,变更后还要检查缓存读取量是否下降。
不需要即时结果的请求可以走批处理,每个 token 五折,缓存过的 token 也打折。代价是结果可能在 24 小时内的任意时刻返回。Anthropic 托管的 agent 运行环境 Claude Managed Agents 不支持这种方式,因为它面向交互会话。
上下文清理会移除过期的工具返回结果,但也会重写已经缓存的对话。在这次实测里,重写缓存的成本高于清理带来的节省。它用于腾出上下文空间;这组数据不支持把它当作降本手段。
旧提示词会让新模型多花钱
上一代模型可能需要“核对两遍”“尽可能详尽”或强制分步流程。新模型会更认真地执行这些旧要求,增加工具调用和输出。模型升级了,提示词没有升级,额外能力就可能变成额外账单。
这组对照使用 44 张客服工单和六份旧提示词。下表中的准确率变化若小于约 5 点,按运行噪声处理。
| 配置 | 准确率 | 每工单成本 | 这一步换到了什么 |
|---|---|---|---|
| Claude Opus 4.8 + 旧提示词 | 89.5% | 2.52 分 | 起点 |
| Claude Opus 5 + 同一份旧提示词 | 91.8% | 3.43 分 | 贵 36% 准确率没有变化 |
| Claude Opus 5 + 审计后的提示词 | 97.0% | 2.93 分 | 便宜 14% 准确率升到 97% |
| Claude Sonnet 4.6 + 旧提示词 | 81.1% | 1.72 分 | 起点 |
| Claude Sonnet 5 + 同一份旧提示词 | 83.9% | 1.61 分 | 准确率差异在噪声内 |
| Claude Sonnet 5 + 审计后的提示词 | 85.6% | 1.39 分 | 省 14% 准确率不变 |
Claude Opus 5 沿用 Claude Opus 4.8 的旧提示词后,每张工单贵 36%,准确率没有变化。审计提示词后,成本比使用未审计提示词时低 14%,准确率从 92% 升到 97%。36% 的比较基准是新旧模型使用同一份旧提示词;审计前后的降幅是 14%。
逐条实验显示,旧提示词会产生两种税:有些要求只增加工具调用和输出,有些要求已经不适合新模型,会导致准确率下降。
去掉“核对两遍”和“尽可能详尽”后,Claude Opus 5 的工单成本明显下降;清除冲突规则、旧 thinking 设置和自建思考草稿区后,准确率恢复。同类旧要求也可能藏在工具描述和 skill 中。
缓存、批处理和提示词审计解决的是重复计费与无效指令造成的浪费。接下来的模型与参数选择,开始涉及成本和质量之间的取舍。
别看单价,先看任务总成本
完成任务的总成本同时受单价、回合数、搜索量和返工次数影响。能力更强的模型虽然每 token 更贵,却可能用更少步骤完成同一件事。比较模型时要计算任务通过验收之前的全部花费,包括失败和重试。
DeepResearch Bench II 用研究报告任务测试了这种差异。完整点值见下表。
| 配置 | 评分 | 每个任务的完成成本 |
|---|---|---|
| Claude Fable 5 · 低档 | 60.2 分 | $0.76 |
| Claude Sonnet 5 · 默认档 | 56.0 分 | $0.84 |
Claude Fable 5 低档的每 token 价格约为 Claude Sonnet 5 的 5 倍,但它完成一个任务反而便宜约 10%,得分也更高。这批运行早于 Claude Opus 5 发布,因此图里没有 Claude Opus 5。
另一项测试给出了不同结果。SWE-bench Pro 测的是在真实仓库中修复代码并通过测试。在这页使用的子集上,Claude Opus 5 单跑 91.7%,Claude Fable 5 单跑 91.3%,差距落在运行噪声内;前者成本约为后者的 60%。
任务类型一变,排序就可能改变。价目表无法提前告诉工程团队结果,只能在自己的任务样本上比较每个候选的完成成本。
官方建议重点看最难的那一成任务。典型任务往往谁都能完成,差距不大;真正拉高账单的,是会失败、会重试、会反复搜索和验证的尾部任务。
即使全部任务都成功,成本也可能高度集中。20 题 WideSearch 跑 3 次后,最贵两题只占题量的 10%,却占总成本的 43%。
模型选择之前还少一步:先把同一个模型的 effort 曲线画出来。
effort 没有通用的省钱档
effort 控制模型思考、调用工具和自我核对的程度,默认档就是 high。调低它,有时几乎只减少成本;有时会明显降低任务完成率。区别取决于任务是否真的需要更高强度的推理。
实测出现两种曲线。研究和知识工作的曲线接近平坦;长周期编码的曲线更陡。两种形状对应相反的选档结论。
| 基准 | 低档 | 中档 | 默认档 |
|---|---|---|---|
| WideSearch 广泛搜网页并填出一张多行表格 | 78.5% / 约 $2.9 | 79.8% / 约 $4.2 | 80.0% / 约 $5.9 |
| DeepWideSearch 同时要求收集很多行与多跳检索 | 64.9% / 约 $3.4 | 65.9% / 约 $4.6 | 66.4% / 约 $6.1 |
| BrowseComp 浏览类 agent 找难找的事实 | 78.5% / 约 $4.2 | 81.5% / 约 $5.3 | 81.3% / 约 $6.15 |
| GDPval 真实经济价值的知识工作交付物 | 83.5% / 约 $1.45 | 84.0% / 约 $2.25 | 83.1% / 约 $3.2 |
四个基准均使用 Claude Fable 5。WideSearch 与 DeepWideSearch 每点 3 次运行;BrowseComp 的图注写 3 次,而出处清单写的是每档 1 到 3 次;GDPval 每点 1 次运行且成本含判分。
四组研究与知识工作测试的结论接近:中档与默认档分数相近,成本却明显更低。BrowseComp 和 GDPval 的默认档甚至略低于中档,但这点差异不能解释为“档位越高越差”。
低档通常也更快。DeepWideSearch 上,低档每题 4.5 分钟,默认档 7.9 分钟。
长周期编码是另一种情况。Claude Opus 5 跑 SWE-bench Pro 时,中档成绩降低约 2 点,成本约为一半;低档成绩降低约 8 点,成本约为四分之一。这里的降档是在明确交换成本和任务完成率。
如果任务已经接近模型的能力上限,每升一档都可能买到分数。图 7 中,每档约增加 2.4 点,没有免费的降本空间。
曲线形状无法从任务名称直接判断,只能从真实样本测出来。每个档位应放在独立会话中运行,避免中途改 effort 导致缓存失效,扭曲成本对比。
文档把这条单模型曲线作为多模型方案的比较基线。如果同一个模型使用较低 effort 已经达标,就没有必要先增加架构复杂度。
三种限制,三种作用
这三种做法都会限制单次任务的花费,但机制不同。失败重试把高成本留给少数失败任务;任务预算让模型主动收敛;max_tokens 只会截断单次响应。模型能不能看见限制,决定了它会主动节省,还是被动失败。
有可靠验收时,先跑低档,只重试失败任务
官方测试的策略是:如果结果可以自动验收,不必给所有任务购买同一档能力。先用低档处理全部任务,只把明确失败的部分交给默认档重试,高成本就只落在少数任务上。
图 8 中,低档加失败重试达到 93.1% / $0.70;默认档单跑是 91.7% / $1.39。通过率相当,前者成本约为一半,而且已经把第一次失败的费用算在内。官方把小幅提分主要归因于“多一次尝试”,高档并非主要原因。
这套策略还会增加失败任务的延迟,因为它们需要完整运行两次。成本下降来自按需购买高档能力,同时牺牲了部分任务的响应时间。
任务预算能省钱,因为模型看得见它
任务预算向模型显示整个任务还剩多少 token。模型会减少低价值搜索和重复验证,并在预算内收尾。这种限制从任务开始就影响执行过程。
最紧的实测设置省下 47% 的成本,同时使成绩降低 4.4 点。较低成本来自减少搜索和验证,质量也随之下降。
官方建议从循环的 90 分位 token 用量附近起步,再逐步收紧。任务预算是建议性的,只引导模型,不会强制停止任务;预算过紧时,模型还可能表现出类似拒答的行为。
max_tokens 只截断响应,不会让模型主动节省
max_tokens 是模型看不见的单次响应上限。达到上限后,响应会被截断;模型不会提前规划,也不会主动删除低价值步骤。被截断的尝试仍然产生费用。
Claude Fable 5 的上限从 64,000 压到 16,384 后,每次尝试的成本从 $29 降到 $17,但成功率也下降,每解出一题的成本仍然是 $53。较低上限还截断了三分之一的尝试,而且这些被截断的尝试没有一次成功。
问题来自极少数很长的关键回合。它们在所有回合中占比很低,却决定了大量任务能否完成。
官方因此把 max_tokens 定位为安全阀,并建议把 stop_reason: max_tokens 当作失败处理。省钱应交给模型看得见的任务预算,以及有验收信号的失败重试。
| 控制项 | 模型看得见吗 | 负责哪件事 | 撞线时 |
|---|---|---|---|
| 任务预算 建议性,beta | 看得见 | 让模型主动收敛,能省钱 | 引导而非强行停住,需验证遵守情况 |
max_tokens单次响应上限 | 看不见 | 防止单次响应无限增长的安全阀,本身省不到钱 | 返回 stop_reason: max_tokens,当失败处理 |
| 会话预算 Claude Managed Agents | 平台侧强制 | 硬性美元停止,按牌价对 token、搜索和会话时长计算 | 会话暂停并返回 stop_reason: budget_reached,抬高预算可继续 |
会话预算对任何有牌价的模型都生效,包括 Claude Sonnet 5,并且能和建议性的任务预算叠加。官方建议三者一起设置,并以工作区花费上限作为最终保护。这些单模型控制仍无法满足目标时,再评估第二个模型。
多模型只在很窄的条件下省钱
多模型的省钱条件很具体:顾问式要求执行模型真的开口求助;协调者式要么压住例行任务偶发的高成本,要么处理大到单个上下文装不下的语料。如果单模型调低 effort 已经达标,加第二个模型通常只会增加编排成本。
两种架构的区别在于主循环由谁控制。顾问式让便宜模型负责执行,只在需要判断时调用强模型;协调者式让强模型拆分任务,再由便宜 worker 处理各个分片。
顾问式:模型间有能力差距,而且执行者确实会求助
文档把顾问式的成败归结为两个条件。第一,顾问必须拥有执行者缺少的能力;两个模型越接近,可借到的能力越少。第二,执行者必须知道何时求助。顾问只有被实际调用,其能力才会作用于任务结果。
求助率记录实际调用顾问的任务占比。图 13 的六组配对显示,实际提升大体跟着求助率变化。
求助率达到 90% 时,执行者拿到了大部分可借用的能力;73% 时仍有明显增益。到了 7% 那组,顾问原本比执行者高 16 点,但执行者几乎没有调用它,最终成绩反而下降 5.4 点。
求助率可以受提示词影响。只提供工具说明时,执行者可能很少调用顾问;测试使用的系统提示要求在动手前和收尾前各问一次,平均每个任务产生两到三次咨询。
顾问式能否省钱,取决于少数几次短咨询能否替代强模型执行完整任务。如果执行者不问,或者每个回合都需要强模型,配对就没有价格优势。
| 内部编码基准(370 个仓库任务) | 解出 | 每次尝试 |
|---|---|---|
| Claude Opus 5 执行 + Claude Fable 5 顾问 | 85.7% | $8.40 |
| Claude Opus 5 单跑默认档 | 84.4% | $8.50 |
| Claude Fable 5 单跑中档 | 83.4% | $8.20 |
| Claude Opus 5 单跑低档 | 74.3% | $1.9 |
| Claude Opus 5 单跑中档 | 82.1% | $4.5 |
| Claude Fable 5 单跑低档 | 78.7% | $5.4 |
| Claude Fable 5 单跑默认档 | 85.1% | $11.9 |
纯 API agent,2026 年 8 月。默认档设置与配对都是每题五次尝试,降档设置各一次。配对平均每次尝试约两次顾问咨询。一两点的差异在运行间噪声内。
| Chartography(读图) | 低档 | 中档 | 默认档 |
|---|---|---|---|
| Claude Opus 5 单跑 | 49 分 / $0.38 | 75 分 / $0.94 | 79 分 / $1.95 |
| Claude Fable 5 单跑 | 55 分 / $0.81 | 73 分 / $1.44 | 74 分 / $1.74 |
| Claude Opus 5 低档执行 + Claude Fable 5 顾问 | 67.5 分 / $0.60(两次运行散点 65 分 / $0.47 与 70 分 / $0.73) | ||
Chartography 的发布方 Surge AI 发布的 100 题全集,2026 年 8 月,跑在 Claude Managed Agents 上,每种配置各跑两次取均值,运行间离散度 4 到 10 点。
内部编码基准里,配对配置得分最高,但只领先一两点,仍在运行噪声范围内。官方把它视为一种需要在自身任务上复测的结果,不是省钱承诺。
读图测试中,配对比执行者单跑中档和默认档便宜,但后两者分数更高。这组配对的执行者在 86% 的任务上调用顾问,说明求助率决定了配对能否同时提高成绩并降低成本。
官方认为,顾问式适合大部分回合偏机械、而方案质量决定结果的工作:编码 agent、计算机操作、多步研究流水线。不适合的情形有三种:每个回合都确实需要顶级能力;任务是无需规划的单轮问答;或者执行者本身已经接近顾问的能力。
协调者式:两种任务结构才有成本优势
第一种情形是压住例行任务的成本尾巴。强模型偶尔会在本来能做对的题上反复尝试,少数异常昂贵的任务把平均账单拉高。把这些工作交给便宜 worker 后,偶发的反复尝试按更低价格计费。
在 10 道单模型本来能稳定做对的题上,协调配置把平均成本从 $11.99 降到 $6.45,90 分位从 $33 降到 $12。便宜 worker 承担了例行任务中的偶发高成本。换到完整难题集后,强模型低档单跑反而便宜 22% 到 30%。
第二种情形是语料大到一个上下文窗口装不下。单模型只能分段读取,并反复带上自己的状态;协调者可以把语料分给多个 worker 并行处理。这项测试使用了 2,160 万 token 的代码语料。
这类任务的主要成本是读取语料,所以调低 effort 几乎不改变账单。协调配置虽然读取的总 token 更多,成本仍降到约 $332,比 Claude Fable 5 任何一档单跑便宜 55%。
它没有达到最高准确率,但成本更低,等待时间也更短。实际运行时间从 11.4 小时降到 1.9 小时。
图中的 F1 同时衡量缺陷找得全不全、判得准不准,只能在这套语料内部比较。
官方的判断是,如果任务是一条前后依赖的链、能装进一个上下文,或者单模型低档已经达到验收标准,协调者通常没有成本优势。拆分、交接和合并本身都要付费。
因此,文档给出的测试顺序是:先测同一个模型的 effort 曲线;仍有缺口,再测更强模型低档单跑;只有多模型配置能打败这条基线,才值得增加编排。顾问式真有优势时,落地可以只是增加一个工具定义,不必重做整套架构。
先测单模型,再测多模型
这些数字来自 2026 年 7 月和 8 月,会随模型、价格和任务结构变化。可复用的不是某个配置的固定答案,而是测量顺序:先建立单模型基线,再判断多模型是否填补了真实缺口。
取样,并定好结果检查项
从生产日志里按真实流量比例抽一批任务,为每个任务定好结果检查项(测试通过、工单关闭、行数对得上),并把完成每个任务的成本记在分数旁边。
按不同努力级别分别运行单模型基线
不只跑默认档,把分数与花费的关系画出来。多模型配置必须打败单模型的整条曲线。
只在单模型基线仍有缺口时测试多模型
如果单模型曲线无法同时达到目标质量和成本,再加入合适的多模型策略并重跑整套评测。
先跑影子流量,再切换
胜出的配置先在少量影子流量中运行,再切换,并让这套评测持续运行。
四步分别是:从生产流量中抽取代表性任务并定义验收条件;扫描不同模型和 effort,画出单模型的质量与成本曲线;只有基线仍有缺口时才测试多模型;胜出的配置先在少量影子流量中运行,再持续重测。
计算每个任务的成本时,需要把输入、缓存写入、缓存读取和输出 token 分别按各自费率计费,再按任务累加。
# 每百万 token 的价格取自价目表;换模型只改这两行
INPUT_PER_MTOK = 5.0 # Claude Opus 5
OUTPUT_PER_MTOK = 25.0
usage = response.usage
cost = (
usage.input_tokens * INPUT_PER_MTOK
# 缓存写按输入价的 1.25 倍(五分钟档);缓存读按 0.1 倍
+ (usage.cache_creation_input_tokens or 0) * INPUT_PER_MTOK * 1.25
+ (usage.cache_read_input_tokens or 0) * INPUT_PER_MTOK * 0.10
+ usage.output_tokens * OUTPUT_PER_MTOK
) / 1_000_000
官方还给出一项自检标准:agent 循环里缓存读通常是这四项里最大的一项。如果不是,需要检查缓存是否实际生效。
开启顾问工具或上下文压缩后,部分 token 只出现在 usage.iterations 中,不会进入顶层合计。计费时需要逐项累加这些记录,advisor_message 对应的费用则按顾问模型计价。
这套顺序把免费降本放在前面,把质量取舍放在后面,把多模型留到最后。具体读数会变化,比较方法可以重复使用。
口径与限制
全部实测结果都是 Anthropic 内部运行这些基准得到的,不是第三方复现。标 notional USD 的图,其金额根据每次请求的 token 数和牌价计算,并非发票金额。除另有注明外,成本均按 2026 年 8 月牌价计算,Claude Sonnet 5 按每百万 token 输入 $2、输出 $10 计。原文自己写明这些结果是方向性的、不构成保证。
| 基准 | 可比性限制 |
|---|---|
| SWE-bench Pro | 用的是为适配 Anthropic 评测框架挑出的 482 题子集,分数不可与公开榜单比较;max_tokens 那组用的是从中再分层抽出的 100 题子集,与 482 题的分数也不可比 |
| Chartography | 由 Claude Sonnet 4.6 判分且带工具运行,只在本页各配置之间可比,不可与公开榜单比较 |
| GDPval | 由 Claude 模型判分,绝对分可能与已发布结果不同 |
| DeepResearch Bench II | 由 Claude Opus 4.6 判分,原基准用的是另一个判分模型,Anthropic 的判分模型可能偏向自家风格;这批运行早于 Claude Opus 5,所以模型对比那张图里没有 Claude Opus 5 |
| 超大语料基准 | F1 绝对值只在这套语料构建里有意义 |
运行次数。SWE-bench Pro 上 Claude Opus 5 默认档的数据取两次运行均值,降档配置均只运行一次;max_tokens 64,000 那组是单次运行;内部编码基准每种配置各跑一次;GDPval 的每个数据点来自一次运行。
两处都是官方文本,无法判定哪个为准,故本文不采用任一说法作为定论,也不影响任何点值本身。
① 任务预算那张图的图注写的是 35k = mean of two runs(35,000 档为两次运行均值),而出处清单第 3 条写的是 the task-budget figures are one run per budget(每个预算档各一次运行)。出处清单另写明每一次带预算的运行都完整跑完了 482 题且没有出现框架错误。
② 顾问机制那张图的图注写的是 SWE-bench Pro 与编码任务每种配置各跑一次,而出处清单第 3 条把该基准上的两组配对分开写:默认档那组跑了两次(a run and an exact replication),低档那组一次。
噪声带。客服工单评测里准确率变化小于约 5 点属噪声,Claude Opus 5 准确率增益的 95% 置信区间是 3 到 8 点,Claude Sonnet 的准确率差异在噪声内;分诊那组 $0.10 以内属噪声;Chartography 两次运行间离散度 4 到 10 点;超大语料基准里 $720 到 $764 属种子噪声;内部编码基准里一两点的差异在运行间噪声内。
两个 BrowseComp 切片不能混用。成本保险那组用的是「单模型能稳定做对的 10 题」,取自 26 题切片,委派侧成本带约 ±20%;努力级别那组用的是 500 题切片。
外部引用。原文引的那份关于 agent 系统规模化的研究(Kim 等人)只为“什么时候委派不划算”这一判断提供方向性支持,原文明确不采用其中任何数字。
实现差异。DeepSWE 那组使用客户端顾问循环,而非顾问工具。Chartography 的求助率对照来自 Messages API 上的一次复测;复测使用相同配置和一套容器工具。