先读图:这不是"降价图",是"需求弹性图"。橙柱(Anthropic ARR)从约 $90 亿涨到 $768 亿(约 8.5 倍);蓝线(Silicon Data Token 支出指数=全市场按用量加权的实际成交均价)却走出"$1.09 → 峰值 $2.07 → 低点 $0.97"的过山车,回到起点。价格大起大落、收入垂直攀升——收入增长靠的是用量,不是单价。
价格变化过程:三个阶段、三级跳水、一次反弹。2023–2024 断崖(GPT-4 $30/$60 → GPT-4o mini $0.15/$0.60,约 200 倍);2025 推理模型普及+旗舰再降一档(o3 降 80%、GPT-5 $1.25/$10、Opus 4.5 $5/$25);2026 双向分化(商品层趋近于零,前沿层首次涨价:GPT-6 Astra $10/$50,是 GPT-5 的 8 倍/5 倍)。
任务级价格:同一道题的成本正在"消失"。研究生级 GPQA 一题:o3(2025.1)$0.30 → GPT-5.6 Luna(2026 年中)$0.0004,18 个月 725 倍;ARC-AGI-2 抽象推理题最低做到 4 美分一题(DeepSeek V4 Flash,61.4%)。固定质量口径下,成本约 每季度降 47%(约 13 倍/年)(Epoch AI,2026-09)。
回答核心问题:分三个口径,三个答案。① 固定任务与质量 → 是,在快速下降(13 倍/年);② 你实际运行的 agent 任务 → 不一定,单任务 token 用量涨了 5–30 倍,账单持平到上涨 2–3 倍;③ 市场混合均价 → 非单调,2026 年"先翻倍再腰斩",当前回到年初起点附近。最新实证是 Claude Sonnet 5.5:标价与上代完全持平,单任务成本却 +50%(≈$5.1 → $7.60,AA max 档)——降价与涨价可以同时写进同一张价目表(详见 4.2 深度案例)。一句话:每一份智能在快速变便宜,但你要买的智能越来越多——这是 Jevons 悖论在推理市场上的完整形态。
算力侧镜像:token 通缩撞上租金上涨,通缩有"地板"。同一时间窗,H200 新云租金 6→9 月 +15%、B200 年内 +31%、B300 上市以来 +44%,CoreWeave 7 月提价约 25%、Nebius 单季上调 21%——算力供不应求。用租金换算:70B 模型自建推理的满载地板约 $0.45/M(H200,73% 利用率 $0.62),这正是 DeepSeek 等"逼近成本定价"玩家的锚;而前沿模型 $2–10/M 卖的是"价值定价"。token 价格的底部由租金×利用率决定——租金不跌,通缩就有底(详见第五节)。
Silicon Data LLM Token Expenditure Index(彭博代码 SDLLMTK)不是"标价",而是全市场实际成交均价:把各家模型的实际用量与各自的输入/输出价格合成一个加权混合价——数学上是 Σ(用量 × 单价) ÷ 总用量。
它的方法论有个关键特性(编制方 Silicon Data 自己反复强调):指数会因为"用户换了模型"而变化,即使没有任何厂商调整标价。工作负载向贵模型迁移 → 指数上涨;向便宜模型迁移(或路由替代)→ 指数下跌。本质上它更像 AI 世界的 PCE 物价指数(允许"替代效应"),而不是 CPI。所以它是"价格 × 结构"的合成信号,不能单独当降价温度计或需求指标。
| 时点 | 指数值 | 事件与驱动 |
|---|---|---|
| 2025-12(发布基线) | ~$1.09 | 基线设立;当时以通用对话模型负载为主 |
| 2026-01 → 05 | +67%~90% ↑ | Agent/推理负载推高:高单价推理模型占比上升、输出(思考)token 占比上升;5 月 28 日达峰值 $2.07,较发布基线近翻倍 |
| 2026-06 → 09 | −53% ↓(较峰值) | 供给效应+替代效应:中国开源模型(Kimi K3、DeepSeek V4、GLM-5.x、Qwen3.x)崛起、OpenAI 7 月底对两款 GPT-5.6 降价、前沿实验室引入动态定价、路由把简单任务分流到便宜模型、缓存/量化/压缩等效率技术 |
| 2026-09-01 | $0.97(新低) | 首次跌破 $1,较 5 月峰值 −54%,创发布以来最低 |
| 2026-09 下旬 → 10 | ~$1.00 | 低位企稳,与年初水平相当(较基线仅低约 8%) |
| 阶段 | 时间 | 特征 | 标志性价格(输入 / 输出,$/Mtok) |
|---|---|---|---|
| ① 断崖跳水 | 2023–2024 | 同代能力年降 10 倍以上;开源入场把"够用"打到地板价 | GPT-4 $30/$60(2023.3)→ GPT-4 Turbo $10/$30 → GPT-4o $5/$15 → GPT-4o mini $0.15/$0.60(16 个月约 200 倍);Claude Opus $15/$75、Sonnet 3.5 $3/$15;DeepSeek V3 $0.14/$0.28(2024.12) |
| ② 推理溢价与通缩并存 | 2025 | 思考型模型从稀有变成标配;旗舰再降一档;中国开源冲击波迫使全行业跟进降价 | o1 $15/$60;o3 从 $10/$40 砍到 $2/$8(−80%);GPT-5 $1.25/$10(较初代 GPT-4 降约 24 倍);Claude Opus 4.5 $5/$25(旗舰直降 3 倍);DeepSeek R1 $0.55/$2.19 |
| ③ 双向分化 | 2026 | 商品化层趋近于零 vs 前沿层"按价值定价"首次涨价;中档逆势降价;动态定价出现 | Gemini 3.x Flash 低至 $0.075/$0.30;DeepSeek V4 Flash $0.09–0.22/$0.28–0.66(分时定价);GLM-5.3-Flash 输出 $0.50;GPT-6 Astra $10/$50(9/3,较 GPT-5 输入 8 倍、输出 5 倍);Fable 5 $10/$50;Sonnet 5 $2/$10(拟涨至 $3/$15 被取消) |
| 厂商 | 模型 | 输入 $/Mtok | 输出 $/Mtok | 备注 |
|---|---|---|---|---|
| OpenAI | GPT-6 Astra | $10(>272K 时 $20) | $50(>272K 时 $75) | 2026-09-03 旗舰;缓存 $1 |
| OpenAI | GPT-5.6 Sol | $4(促销)/$5 标价 | $20(促销)/$30 标价 | 促销至 2026-11-21 |
| OpenAI | GPT-5.6 Terra / Luna | $2 / $0.20 | $12 / $1.20 | 中档 / 低价档 |
| Anthropic | Fable 5 | $10 | $50 | 新顶级档(Mythos 5 同价,限量) |
| Anthropic | Opus 5(及 4.5–4.8) | $5 | $25 | 旗舰主力,1M 上下文无长文溢价 |
| Anthropic | Sonnet 5 | $2 | $10 | 降价永久化(涨价计划取消) |
| Anthropic | Sonnet 5.5 | $2 | $10 | 标价持平,但单任务 token 用量创纪录 → 单任务成本 +50%(见 4.2) |
| Anthropic | Haiku 4.5 | $1 | $5 | 轻量档 |
| Gemini 3.1 Pro | $2 | $12 | ≤200K;超长 $4/$18 | |
| Gemini 3.x Flash | $0.075–0.75 | $0.30–3.75 | 档位多,最低价档位极具杀伤力 | |
| DeepSeek | V4 Flash / V4 Pro | $0.09–0.22 / $0.42–0.66 | $0.20–0.66 / $0.83–1.98 | 分时定价:高峰 ×2 |
| Moonshot | Kimi K3 | $3 | $15 | 开源旗舰,1M 上下文,缓存 $0.30 |
| 智谱 | GLM-5.2 / 5.3-Flash | $1.05–1.40 / ~ | $3.3–4.4 / $0.50 | Flash 为国产性价比第一 |
| 阿里 | Qwen3.5 4B | $0.03 | $0.15 | 挂到"地板价"的轻量档 |
| xAI | Grok 4.6 | ≈$3 | ≈$15 | 行情参考值 |
注:各来源披露口径与更新时间不一,部分为区间估计;以厂商官方定价页为准。
行业已经从"每百万 token 多少钱"进化到"每完成一件事多少钱"。目前有四套被广泛引用的任务级口径,分别回答不同问题:
| 任务样本 | 模型(档位) | 得分 | 单任务成本 | 备注 |
|---|---|---|---|---|
| ARC-AGI-2 一道抽象推理题 (2026-08 官方验证榜) | Claude Opus 5 (Max) | 90.4% | $2.06 | 榜首 |
| Kimi K3 (Max) | 60.4% | $1.59 | 开源旗舰 | |
| Gemini 3.6 Flash (High) | 60.4% | $0.61 | ||
| GPT-5.6 Luna (Max) | 59.6% | $0.18 | 曾是最佳性价比 | |
| DeepSeek V4 Flash (Max) | 61.4% | $0.042 | 性价比前沿新标准(4 美分/题) | |
| 历史对照:Opus 4.5(2025-11)37.6% = $2.20/题;Gemini 3 Pro+Poetiq 54% = $30/题;DeepSeek V3.2(2025-12)仅 4.0%、R1(2025-01)1.3%。一年时间:同族模型从"做不出"到"61 分只需 4 美分"。 | ||||
| SWE-rebench 一道真实代码修复题 (2026 年中,去污染题库) | Claude Fable 5 | 64.5% | $4.40 | "0.7 分之差、3 倍价差"——选择比价格更重要 |
| Grok 4.5 | 63.8% | $1.47 | ||
| 任务场景 | 时点 | 成本 | 对比/说明 |
|---|---|---|---|
| 典型 2,000-token 简单任务(问答/摘要) | 2023(GPT-4 时代) | ≈ $0.08 | 当时最强模型的单次任务成本 |
| 同上 | 2026-08(前沿档) | ≈ $0.02–0.03 | 降约 3–4 倍,但能力代际不同 |
| 同上 | 2026-08(经济档) | < $0.001 | 较 2023 年降 100 倍以上 |
| 代码 Agent:一天工作量 | 2026-05 | ≈ $13/天 | 对比软件工程师 ≈ $300/天(约 20 倍优势) |
| 企业级 Agent 工作流(单任务) | 2026 | $0.005–0.1(纯经济路由) $0.5–25+(全量前沿模型) | 单任务 5 万–50 万 tokens;路由选择决定 10–100 倍成本差 |
| 整轮基准评测(GAIA,74.5 分档) | 2026 | $178.20/轮 | Princeton HAL 成本控制榜;SWE-bench Mini 同档 $463.90/轮 |
| 口径 | 回答的问题 | 答案 | 关键数据 |
|---|---|---|---|
| A · 科学口径 固定任务、固定质量 |
同样考 75 分的题,今天要花多少钱? | 在快速下降 | 47%/季 ≈ 13 倍/年(Epoch 2026-09);GPQA 单题 18 个月降 725 倍;三年累计约 300 倍(GPT-4 级能力从 $30 → $0.1–0.4/Mtok)。但降速在放缓:10 倍/年(2021–25)→ 3–5 倍/年(2025–27e)→ 1.5–2 倍/年(2027+e,推理算力地板) |
| B · 账单口径 真实的 agent 工作负载 |
我完成同样一件事(或一个项目),账单涨还是跌? | 不降,持平到上涨 2–3 倍 | Gartner(2026-03):agentic 任务 token 用量是聊天机器人的 5–30 倍;单次交互从 ~2,000 → 5 万–50 万 tokens;单价 ÷10 与用量 ×30 相抵。Jevons 悖论:便宜的单位价格创造了更多需求 |
| C · 市场口径 全市场混合成交均价 |
"大模型"作为一个整体,价格在跌吗? | 非单调:先翻倍、再腰斩 | SDLLMTK:$1.09 → $2.07(5 月底)→ $0.97(9 月初,−54%)→ 约 $1.00。涨是结构效应(负载升级),跌是供给效应(开源+降价+路由)。当前较发布基线仅低约 8% |
Sonnet 5.5 是"名义价格 ↓、有效价格 ↑"最完整的实证样本。它把本节讨论的每一条机制——用量放大、分词器、思考档位、名义价与有效价的背离——都压缩在了一个案例里。
| 度量 | Sonnet 5(max) | Sonnet 5.5(max) | 变化 | 来源 |
|---|---|---|---|---|
| 挂牌价(输入/输出) | $2/$10 | $2/$10 | 0%(完全持平) | Anthropic 官方价 |
| AA 智能指数 | 38→53 档* | 56(第 2 名,max 档 +18 分) | 能力 ↑ 大幅 | Artificial Analysis |
| 单任务输出 tokens(AA 口径) | ≈121k | ≈193k(AA 有史以来最高) | +60% | Artificial Analysis 实测 |
| 单任务成本(AA Intelligence Index 口径) | ≈$5.1 | $7.60 | +50% | Artificial Analysis / SiliconReport / AI Weekly |
| 横向参照 | 193k/任务 ≈ Opus 5.5(max)的 1.6 倍 ≈ GPT-6 Astra(max)的 7 倍;AA 整轮跑完输出 420M tokens vs 全市场中位数 81M | Artificial Analysis | ||
* Sonnet 5 发布时 AA 指数 53 分(当时口径),同期成本约 $2.29/任务(促销价下);5.5 与 5 同价口径对比约 $5.1 → $7.60。Sonnet 5.5 处于"智力—成本" Pareto 前沿之外:同等成本下 GPT-6 Astra / Sol 用更少 token 达到同等智力分。
单任务成本 = 单价 × token 数。标价 $2/$10 没动,分子上动的是 token 数,且不止一处:
| 机制 | 放大系数 | 性质 | 说明 |
|---|---|---|---|
| ① 分词器膨胀 | ≈ +30%(1.0–1.4x) | 隐性、不可控 | Sonnet 5 起新分词器对同一段文本多计约 30% token(官方披露)。Simon Willison 实测分布:英文 ~1.4x、西语 ~1.33x、Python 代码 ~1.28x、简体中文 ≈1.0x——语言结构不同,"tokenizer 税"不同。输入侧同样生效,且顺带让 1M 上下文装得更少、限流更早触发 |
| ② 思考/输出膨胀 | ≈ +60%(max 档,AA 口径) | 半可控(effort 档位) | Adaptive thinking 默认高档、思考 tokens 按输出计费。Sonnet 5.5 max 档单任务输出 193k,是上代的 1.6 倍;Anthropic 自己在 Opus 5.5 提示指南里警告"旧 effort 设置在新模型上会炸 token" |
| ③ 默认值上移 | 结构性 | 厂商可控、用户被动 | 默认 effort 上移(API/Claude Code 默认 high)、Claude Code 与 App 默认 medium。用户"什么都不改",账单口径就自动升级了 |
| 合成效果 | +50%(成本) | 标价 0% × token 总量放大 → 有效单价上涨约 50%。这是"同一张价目表"的完整含义 | |
Sonnet 5 线的故事在 2026 年 9 月叠加了一次教科书级的复合效应——对 Sonnet 5/5.5 的存量用户而言,9 月 1 日同时发生两件事:
Finout / MoClaw 的迁移审计给出过一组具体测算(以 Sonnet 5 为例,同一 workload):
| 价格状态 | 费率(入/出) | 同文本计费 tokens | 月成本 | vs 基线 |
|---|---|---|---|---|
| Sonnet 4.6(基线) | $3/$15 | 2.0M / 0.4M | $360 | — |
| Sonnet 5 促销期 | $2/$10 | 2.6M / 0.52M(+30%) | $312 | −13%(显得"更便宜") |
| Sonnet 5/5.5 标准价(若回调 $3/$15) | $3/$15 | 2.6M / 0.52M | $468 | +30%(纯 tokenizer 税) |
社区实证与该模型吻合:r/SaaS 有创始人报告请求数基本不变的情况下月账单 $140 → $278(+99%);r/vibecoding 用户确认 session 额度消耗明显加快。中国用户幸运一些:Willison 实测简体中文 ≈1.0x,tokenizer 税对中文负载几乎不生效。
前面四节回答的是"价格信号"(token 卖多少钱),这一节回答"成本地板"(token 最低能卖多便宜、为什么便宜不下去)。两条线在物理层汇合:每一枚 token 都是在某张计算卡上、按每小时租金计费生产出来的。
| 计算卡 | 新云中位租金 ($/GPU·hr) | 超大规模云中位 | 溢价 | 近期走势 |
|---|---|---|---|---|
| NVIDIA H100 SXM 80GB | $2.61–3.41 | $7.19 | +89% | 7D +1.5%,低位缓慢爬升 |
| NVIDIA H200 SXM 141GB | $3.30(峰值 $3.32,9/19) | $10.44 | +132% | 6 月 $2.87 → 9 月 $3.29(+15%) |
| NVIDIA B200 180GB | $5.76–5.79 | $15.18 | +93% | 年内 +31%,7D +1.2% |
| NVIDIA B300 288GB | $8.39–9.06 | — | — | 4 月底上市以来 +44% |
| NVIDIA GB300 NVL | $14.21 | — | — | 机架级系统,供给最紧 |
| AMD MI300X 192GB | $2.59–2.65 | — | — | 7D +0.8%;约为 H200 的 8 折 |
| AMD MI355X 288GB | $5.60 | — | — | 对标 B200 档位 |
口径:Silicon Data 新云(neo-cloud)标准化租赁指数 + cloud-gpus.com / ComputePrices / GPUPerHour 三方聚合(2026-10 初);"超大规模云"指 AWS/Azure/GCP 同卡挂牌中位。现货租赁波动大,取中位数以平滑。远期曲线佐证:多家聚合平台显示 H100/H200/B200 的一年期 forward 租金单调上行——云厂商宁可不接长单也不愿折价锁定,即供给方自己判断"租金还会涨"。
自建推理的 token 成本只有一个公式(DigitalOcean/vLLM 实测框架):
公式的三个变量恰好解释了三件事:租金决定地板的高度、吞吐决定工艺水平、利用率决定你离地板有多远。代入 2026-10 的真实数据:
| 成本档 | 硬件/口径 | 吞吐(实测锚点) | 利用率 | token 成本 | 对应市场价位 |
|---|---|---|---|---|---|
| ① 物理地板 | H200 $3.44/hr,70B FP8 满载 | 2,036 tok/s(batch 饱和) | 100% | ≈$0.45/M | 理论极限,现实中达不到 |
| ② 良好运营 | 同上 | 2,036 tok/s | 73%(持续负载) | ≈$0.62/M | DeepSeek 类"成本定价"区($0.28–0.66);专业推理云批量价 |
| ③ 普通运营 | 同上 | 2,036 tok/s | 40%(波动流量) | ≈$1.17/M | 已高于 SDLLMTK 全市场均价 $0.97——自建开始贵过 API |
| ④ 低效运营 | 同上 | batch=1(~47 tok/s) | 任意 | ≈$20/M | 未做连续批处理的"裸跑":比前沿 API 还贵 2 倍+ |
| 层 | 变量 | 2026 现状 | 方向 |
|---|---|---|---|
| L1 物理层 算力租金 | $/GPU·hr × 利用率 | H200 $3.30、B200 $5.76、B300 +44%;forward 单调上行 | ↑ 通胀(供给约束) |
| L2 生产层 token 成本地板 | 租金 ÷(吞吐 × 利用率) | 地板 ≈$0.45/M,良好运营 $0.62/M;效率红利(量化/批处理/蒸馏)仍在兑现 | ↓ 缓降(效率 vs 租金赛跑) |
| L3 市场层 API 挂牌/成交价 | SDLLMTK、厂商价目表 | 均价 $0.97;成本轨贴地板、价值轨(前沿)结构性上涨(GPT-6、Fable、5.5 案例) | 分化(商品趋地板、前沿涨) |
前五章分别观察了两条线:价格信号线(SDLLMTK 均价、厂商价目表、任务级成本——市场"卖多少钱")与成本地板线(GPU 租金、利用率、自建换算——产业"最低能卖多便宜")。本章把两条线合到一张图上,给出统一的机制解释、可检验的判断清单、以及对三类参与者的操作含义。
每个维度一张卡:左蓝 = 价格信号(市场卖多少),右橙 = 成本地板(产业最低多少),底部绿条 = 两线合流后的结论。
2024–2026 的所有现象,可以用一条传导链压缩:
| # | 判断 | 核心依据 | 证伪条件(何时认错) |
|---|---|---|---|
| 1 | 固定质量成本继续下降,但降速换挡:13x/年(2023–25)→ 3–5x(2026–27)→ 1.5–2x(2027+) | Epoch 47%/季及其自身减速预告;租金上涨吞噬效率红利 | 任一主流基准(GPQA/ARC)单题成本再现 >10x/年 跌幅且租金同步下跌 |
| 2 | token 均价在 $1/M 附近筑底,通缩让位于分化 | SDLLMTK 三个月在 $0.96–1.02 窄幅企稳;成本轨已贴地板 | forward 租金掉头 + Rubin 量产 + 指数再破新低(三者同时出现) |
| 3 | 前沿层继续"隐性涨价":用量系数、tokenizer、默认档位成为主要涨价通道 | Sonnet 5.5(标价平、成本 +50%);Astra 长上下文翻倍价;Sol 促销价到期机制 | 厂商转向明码涨价(如 Astra 模式)且第三方实测单任务成本随标价同步回落 |
| 4 | 模型层毛利触底、靠量补价;价值向"经营利用率"的中间层迁移 | Anthropic 指引 40% + ARR 8.5 倍并存;CoreWeave 托管推理 $1M→$100M ARR、Nebius 毛利 77% | 前沿厂商毛利回升至 60%+ 而用量增速失速;或 neocloud 托管推理增长停滞 |
| 5 | Jevons 闭环持续:单价降幅 < 用量增幅,企业账单继续膨胀 | Gartner 5–30x;企业预算三年近 6 倍;推理占算力支出 2/3;Uber/医保案例 | OpenRouter 周用量增速连续一个季度低于 10%,且企业 AI 预算增速降至 <20% |
| 6 | 降本的下一战场是"每 token 有效性":路由/缓存/压缩/effort 管理的节省空间(30–95%)大于标价谈判 | batch 1→饱和 44 倍;缓存 −90%;路由省 30–60%;压缩 60–95%;headroom 类工具爆发 | 推理优化层出现整合红利耗尽(主流工作流有效成本降幅连续两季 <10%) |
| 角色 | 该相信什么 | 不该相信什么 | 动作 |
|---|---|---|---|
| 模型厂商 | 弹性 > 1:降价换量在商品轨成立;前沿轨靠能力稀缺性定价 | "标价即品牌"——用户和评测已经只看单任务成本 | 管住三权(定价/计量/档位)的滥用,隐性涨价会在 Pareto 前沿上被第三方当场抓获(5.5 案例);把毛利押在托管推理与利用率而非 token 差价 |
| 应用开发者 | 账单 = 单价 × token 系数 × 档位;73% 利用率是自建分界;量小用 API、量大且平稳再自建 | "新模型一定更便宜"——5.5 已经证明标价持平也能贵 50% | 预算按 cost per accepted task 立;迁移必重测 tokenizer;effort 默认降一档;三层路由(经济/执行/前沿)作为默认架构 |
| 投资者 | SDLLMTK 是"替代调整价格指数"不是需求指标;租金与 token 价互为镜像,组合看才是供需真相 | "token 价格下跌 = AI 需求走弱"(2026 年被证伪次数最多的单一误读) | 跟踪 6.5 仪表盘;弹性受益顺序:算力层(租金上行)→ 经营利用率层(托管推理)→ 应用层(成本红利)→ 模型层(毛利承压换规模) |
报告生成:Bruce · Thematic Research · 2026-10-08 · 数据窗口 2023.03–2026.10