摘要

  • Haiku 5.5 的上下文上限为 100 万 token,但提示词超过 100,000 token 后,输入与输出单价提高五倍。
  • 同一段文字在新分词器下约多出 30% token,客户应重新计量自己的请求,不能把 Anthropic 的平均降本估算当作本地账单预测。

定价机制

上下文容量回答的是“能放进多少”,价格表回答的则是“放进去以后如何计费”。Anthropic 于 10 月 7 日发布 Haiku 5.5,给出的上下文窗口为 100 万 token,最多可生成 128,000 token。但价格分界线设在 100,000:在该长度以内,输入每百万 token 为 0.10 美元、输出为 0.50 美元;超过后分别升至 0.50 和 2.50 美元。也就是说,一旦提示词跨过门槛,输入和输出都进入五倍单价的档位。Claude Platform 价格表把这两档分开列明。

这并不意味着百万 token 的窗口无法使用,而是意味着“窗口够大”和“长请求便宜”不是同一个承诺。模型允许把长文档、对话历史和工具结果放进一次请求;价格档位则让更长的提示词承担更高单价。若只看入门的每 token 报价,采购者会漏掉决定成本的关键分布。

新旧型号之间还有一层变化。Anthropic 说,新分词器对同一段输入文字会比 Haiku 4.5 生成约多 30% token,实际增幅视内容而异。其迁移指南因此建议重新计算提示词,而非沿用旧模型的 token 统计和预算。

用两个输入侧例子可以看出门槛的作用。若一段文字原来被 Haiku 4.5 计为 50,000 token,在新模型下约为 65,000,仍落在低价档;按公开费率估算,输入成本从 0.05 美元降至约 0.0065 美元,减少约 87%。若另一段文字原来为 80,000 token,新分词器可能令其升至约 104,000,进入高价档;对应输入成本约由 0.08 美元变为 0.052 美元,降幅约 35%。这只是按近似 token 增幅进行的单次输入计算,不包括输出、工具、缓存、批量折扣,也没有证明两款模型在任务效果上等价。

Anthropic 表示 Haiku 5.5 平均运行成本约低 75%。发布说明称,其计算考虑了分词器变化,并指出此前 Haiku 的请求中约 90% 不超过 100,000 token。这个比例解释了为什么该公司可以报告较大的平均降幅,但它仍是旧型号的请求数量分布,而不是每家客户的 token 用量分布。短请求占九成,不等于它们占九成 token 支出;迁移后,提示词组成也可能改变。

缓存和批量处理会再次改变单位成本。提示词缓存的写入与读取价格各不相同,Batch API 则把输入和输出 token 价格下调 50%。实际请求还可能带上系统指令、工具定义、工具返回、保留的多轮历史、文件内容以及模型生成的回答。上下文窗口文档说明这些部分都会计入上下文。因此,仅用原始文件大小推算账单并不可靠。

对采购和工程团队来说,第一步应当是用 Haiku 5.5 的分词器重新计算代表性提示词,再按 100,000 token 以下、临近门槛和超过门槛分组。输入、输出、缓存和 Batch 的用量应分别记录。若长提示词档位占据较大支出,可以测试检索、摘要或筛选上下文是否有助于降本;但必须检查被省略的资料是否正是答案所需的证据。

因此,百万 token 不是一种价格,也不是把上下文塞满后仍然便宜的保证。它是容量。最终经济性取决于实际工作产生的提示词长度、新分词器如何计数,以及每种请求落在价格表的哪一侧。

来源