Concitech AI · 深度长文
2026/08/23 08:11
OpenAI 突然降价 20%,算完这笔账,我发现 Token 快要不值钱了
当一百万 Token 的底层生产成本逼近几美分,AI 行业变化的不只是 API 账单。软件会从节省推理,转向持续计算、并行探索和自动验证。

8 月 21 日,OpenAI 宣布将 GPT-5.6 Sol 的 API 和 Credit 价格下调超过 20%,优惠暂定持续三个月。
这已经不是 GPT-5.6 系列第一次降价。7 月 30 日,OpenAI 刚把 Luna 的价格下调了 80%,Terra 下调了 20%。
看到这里,最容易得出的结论是:大模型价格战又开始了。
但价格战只解释了“卖多少钱”,没有解释更重要的问题:生产一百万 Token,到底还要花多少钱?
随着 Qwen、DeepSeek 等公开权重模型发布,模型参数、部署方式和真实吞吐逐渐透明,这笔过去只能靠猜的账,现在已经可以大致算出来了。
结果可能比降价本身更值得重视。
AI 推理正在接近一个临界点:Token 不再是一种需要精打细算的昂贵服务,而会越来越像电力、带宽和工业原料。
先算一笔 B200 的账
以一张 NVIDIA B200 运行 27B 级 Dense 模型为例。
在一组高并发推理测算中,单卡输出吞吐约为每秒 5300 Token,总处理吞吐约为每秒 11915 Token。如果按照大型云厂商自持硬件的 TCO 口径,将一张 B200 的综合成本估为每小时 1.73 美元,那么:
纯输出成本
= 1.73 ÷ 3600 ÷ 5300 × 1,000,000
≈ 0.09 美元 / 百万 Token
总处理成本
= 1.73 ÷ 3600 ÷ 11915 × 1,000,000
≈ 0.04 美元 / 百万 Token
也就是说,在满载、高并发和优化良好的条件下,一百万 Token 的底层计算成本确实可能进入几美分到一毛美元的区间。
这个数量级并非完全脱离现实。NVIDIA 公布的 B200 推理测试中,Qwen3 30B-A3B 在 1000 Token 输入、1000 Token 输出的负载下,单卡输出吞吐达到每秒 26971 Token。不同模型结构、量化精度、输入输出长度和并发数会让结果大幅波动,但 Blackwell 在高并发场景下把吞吐推到数千甚至数万 Token 每秒,已经是公开可见的数据。
关键在于高并发。
单用户在本地运行模型时,每生成一个 Token,都要把大量模型权重从显存读取一遍。数据中心同时处理成百上千个请求,可以通过 Continuous Batching,把同一次权重读取分摊到更多 Token 上。
一张 B200 的小时成本可能是 RTX 4090 的数倍,但它在生产环境里的总吞吐可以高出几十倍。对推理服务商来说,真正重要的不是“这张卡贵不贵”,而是每美元能生产多少 Token。
几美分是真的,但不是所有人都能拿到
这里必须做一个区分。
每小时 1.73 美元是超大规模运营商自购硬件后的 TCO 估算,不是普通开发者打开云平台就能租到的价格。Lambda 当前公开的 B200 租赁价约为每卡每小时 6.69 美元。按同样的每秒 5300 个输出 Token 计算,成本约为:
6.69 ÷ 3600 ÷ 5300 × 1,000,000
≈ 0.35 美元 / 百万输出 Token
这仍然很便宜,但已经不是 0.09 美元。
而且上述测算默认 GPU 接近满载,没有加入闲置容量、CPU、内存、网络、存储、运维、故障冗余和利润。为了维持低延迟,服务商通常也不能把并发堆到吞吐极限。并发越高,总吞吐越大,单个用户等待的时间往往也越长。
所以,“百万 Token 只要几美分”更接近一条工程极限,而不是所有用户都能获得的零售价。
但这并不推翻结论。
即使按公开云租赁价测算,27B 级模型的纯计算成本也已经进入每百万 Token 几毛美元的区间。更大规模的运营商如果拥有更低的硬件采购价、更高的利用率和更成熟的推理栈,成本还能继续下降。
API 价格为什么可以继续跌
目前 GPT-5.6 Sol 的官方标准价格是每百万输入 Token 5 美元、输出 Token 30 美元。DeepSeek V4 Flash 的非高峰输出价是 0.66 美元,V4 Pro 是 1.98 美元;高峰期分别为 1.32 美元和 3.96 美元。
这些数字不能直接横向比较。
GPT-5.6 Sol 的模型规模、激活参数和部署成本没有公开。它与 27B 开放模型的能力也不是同一档。API 售价还包含研发投入、带宽、缓存、负载均衡、安全系统、服务稳定性和商业利润。
但公开模型让我们第一次能看到推理成本的下限。
过去,便宜 API 很容易被解释为补贴市场。现在看,一部分低价可能不是补贴,而是硬件吞吐、模型架构和推理工程共同作用后的正常结果。
成本下降主要来自四个方向:
- Blackwell 一代硬件提供更高的低精度计算能力和显存带宽。
- FP8、FP4 量化降低了权重读取和矩阵计算成本。
- Continuous Batching、前缀缓存、推测解码等技术提高了单卡利用率。
- 模型正在用更少的激活参数完成更难的任务。
Qwen3.8-27B 是一个 27B Dense 模型,官方模型卡显示,它在 Terminal-Bench 2.1 上得到 73.0,在 SWE-bench Pro 上得到 61.7。DeepSeek 则继续使用 MoE,把模型总容量与每个 Token 实际参与计算的参数量拆开。
模型能力在提高,单位 Token 的计算成本却在下降。两件事同时发生,才是这一轮变化最反常识的地方。
真正的问题不是价格,而是成本下降得有多快
很多人担心,API 价格不断下跌会把模型厂商拖入低毛利竞争。
这只看到了售价。
如果一个模型每百万 Token 的售价从 10 美元降到 1 美元,但生产成本同时从 5 美元降到 0.1 美元,毛利率反而可能提高。
因此,更值得观察的不是下一次 API 降价多少,而是模型厂商能否让推理成本下降得比售价更快。
OpenAI 在 GPT-5.6 的发布材料中反复强调“每美元完成更多工作”。这句话的重点不是 Token 单价,而是完成一个任务所需的总步骤、工具调用、失败次数和输出长度。
一个模型即使单个 Token 更贵,只要它能少走一半弯路,任务总成本仍然可能更低。反过来,一个便宜模型如果不断重试、反复调用工具,最终账单也可能更高。
未来衡量模型经济性的单位,不会只是“美元 / 百万 Token”,而会逐渐变成“美元 / 完成任务”。
当 Token 便宜到不用省,软件会发生什么
过去两年,Agent 产品的大量工程优化都围绕一个目标:少调用模型,缩短上下文,减少输出,能用规则解决就不要推理。
这是昂贵智力时代形成的产品习惯。
当 Token 成本继续下降,最优策略可能反过来。
写代码时,Agent 不再满足于生成一个方案。它可以并行写五个实现,分别跑测试、做性能比较、交叉审查,再选择最好的版本。
做研究时,系统可以让多个 Agent 独立建立假设、寻找证据、互相反驳,并对结论做一致性检查。
做设计时,模型可以连续生成几十个版本,让视觉模型逐个评分,再针对弱点自动重做。
做工程优化时,Agent 可以持续搜索参数、运行实验、记录失败,并把结果重新送回下一轮推理。
这类产品的核心不再是“如何用最少 Token 得到一个答案”,而是“如何把更多计算转化为更可靠的结果”。
这很像软件行业经历过的变化。存储昂贵时,程序员会精确计算每个字节;带宽昂贵时,网页要尽量减少请求。等成本下降几个数量级,产品形态就彻底改变了。
Token 也可能走同一条路。
便宜 Token 会淘汰什么
如果推理逐渐成为低成本商品,单纯转售模型能力的产品会越来越难做。
今天很多 AI 应用的商业模式,本质上是在系统提示词外包一层界面,再把 API 按月出售。模型更强、价格更低之后,用户可以更容易地自己搭建同类工具,平台之间的模型差异也会缩小。
真正有价值的部分会向上移动:
- 是否拥有独家数据和反馈闭环。
- 是否能把任务拆成可靠的 Agent Loop。
- 是否有严格的验证、权限和故障恢复机制。
- 是否真正嵌入客户的业务流程。
- 是否能把廉价 Token 转化为可量化的业务结果。
云厂商也会获得新的机会,但不能简单理解为“Token 越多,所有云厂商都受益”。推理需求会增长,单位计算价格也会下降;硬件利用率、能源成本、网络和调度效率决定了谁能留下利润。
AI 正在从产品变成生产资料
一百万 Token 到底是 0.04 美元、0.35 美元还是 3 美元,并不是最重要的争论。
重要的是,它的成本曲线仍在快速向下,而且模型能力没有同步下降。
OpenAI 的连续降价只是这条曲线露出水面的部分。公开权重模型和 Blackwell 的推理数据,让我们第一次看见水面以下发生了什么。
当价格足够低,理性的选择不再是让模型少思考一次,而是让它继续计算、继续验证、继续失败、继续重做,直到结果足够好。
到了那一步,Token 就不再像一项按次购买的软件服务。
它会更像一种工业原料。
只是这条生产线制造的,不是钢铁、塑料或电力,而是可以被软件随时调用的机器智力。
参考资料
