TOKEN ECONOMICS · 大模型调用成本研究

大模型 API 价格的"过山车"
以及完成一个任务到底要花多少钱

起点是一张剪刀差图:Anthropic ARR 十个月涨了 8.5 倍,而 Silicon Data 全市场 Token 支出指数先翻倍、后腰斩。本报告梳理 2023–2026 三年价格变化过程、任务级成本的四类官方口径,并回答一个核心问题——大模型完成任务的调用总成本,是否真的在下降。
报告日期:2026-10-08 数据截至:2026 年 9 月底 / 10 月初 价格单位:USD / 百万 tokens($/Mtok) 研究整理 · 不构成投资建议
〇

核心结论摘要

TL;DR
1

先读图:这不是"降价图",是"需求弹性图"。橙柱(Anthropic ARR)从约 $90 亿涨到 $768 亿(约 8.5 倍);蓝线(Silicon Data Token 支出指数=全市场按用量加权的实际成交均价)却走出"$1.09 → 峰值 $2.07 → 低点 $0.97"的过山车,回到起点。价格大起大落、收入垂直攀升——收入增长靠的是用量,不是单价。

2

价格变化过程:三个阶段、三级跳水、一次反弹。2023–2024 断崖(GPT-4 $30/$60 → GPT-4o mini $0.15/$0.60,约 200 倍);2025 推理模型普及+旗舰再降一档(o3 降 80%、GPT-5 $1.25/$10、Opus 4.5 $5/$25);2026 双向分化(商品层趋近于零,前沿层首次涨价:GPT-6 Astra $10/$50,是 GPT-5 的 8 倍/5 倍)。

3

任务级价格:同一道题的成本正在"消失"。研究生级 GPQA 一题:o3(2025.1)$0.30 → GPT-5.6 Luna(2026 年中)$0.0004,18 个月 725 倍;ARC-AGI-2 抽象推理题最低做到 4 美分一题(DeepSeek V4 Flash,61.4%)。固定质量口径下,成本约 每季度降 47%(约 13 倍/年)(Epoch AI,2026-09)。

4

回答核心问题:分三个口径,三个答案。① 固定任务与质量 → 是,在快速下降(13 倍/年);② 你实际运行的 agent 任务 → 不一定,单任务 token 用量涨了 5–30 倍,账单持平到上涨 2–3 倍;③ 市场混合均价 → 非单调,2026 年"先翻倍再腰斩",当前回到年初起点附近。最新实证是 Claude Sonnet 5.5:标价与上代完全持平,单任务成本却 +50%(≈$5.1 → $7.60,AA max 档)——降价与涨价可以同时写进同一张价目表(详见 4.2 深度案例)。一句话:每一份智能在快速变便宜,但你要买的智能越来越多——这是 Jevons 悖论在推理市场上的完整形态。

5

算力侧镜像:token 通缩撞上租金上涨,通缩有"地板"。同一时间窗,H200 新云租金 6→9 月 +15%、B200 年内 +31%、B300 上市以来 +44%,CoreWeave 7 月提价约 25%、Nebius 单季上调 21%——算力供不应求。用租金换算:70B 模型自建推理的满载地板约 $0.45/M(H200,73% 利用率 $0.62),这正是 DeepSeek 等"逼近成本定价"玩家的锚;而前沿模型 $2–10/M 卖的是"价值定价"。token 价格的底部由租金×利用率决定——租金不跌,通缩就有底(详见第五节)。

一

图表解读:剪刀差背后的三层信息

READING THE CHART
Anthropic ARR × Silicon Data LLM Token 支出指数(示意重绘)
基于公开报道锚点重绘(非逐日数据,数值为近似值)。左轴:Anthropic 年化收入(十亿美元);右轴:Token 支出指数(美元/百万 tokens)。来源:Silicon Data、Anthropic 公开里程碑、Ticker Trends。
Anthropic ARR(左轴,$bn) SD LLM Token 支出指数(右轴,$/Mtok) $2.20$2.00$1.80 $1.60$1.40$1.20 $1.00$0.80 $30B$60B $0B $9B $76.8B 基线 $1.09 峰值 $2.07(5 月底) $0.97 首次破 $1(9/1) ↑ 上半年 agent/推理负载推高结构,指数近翻倍 ↓ 开源模型+降价+路由替代,较峰值 −53% 12月1月2月3月 4月5月6月7月 8月9月10月 2025 年 12 月 → 2026 年 10 月(ARR 为年化运行率口径;指数峰值为 5 月 28 日 $2.07,9 月 1 日低点 $0.97)

1.1 这条蓝线到底在测量什么

Silicon Data LLM Token Expenditure Index(彭博代码 SDLLMTK)不是"标价",而是全市场实际成交均价:把各家模型的实际用量与各自的输入/输出价格合成一个加权混合价——数学上是 Σ(用量 × 单价) ÷ 总用量。

它的方法论有个关键特性(编制方 Silicon Data 自己反复强调):指数会因为"用户换了模型"而变化,即使没有任何厂商调整标价。工作负载向贵模型迁移 → 指数上涨;向便宜模型迁移(或路由替代)→ 指数下跌。本质上它更像 AI 世界的 PCE 物价指数(允许"替代效应"),而不是 CPI。所以它是"价格 × 结构"的合成信号,不能单独当降价温度计或需求指标。

1.2 过山车轨迹(2025-12 → 2026-10)

时点指数值事件与驱动
2025-12(发布基线)~$1.09基线设立;当时以通用对话模型负载为主
2026-01 → 05+67%~90% ↑Agent/推理负载推高:高单价推理模型占比上升、输出(思考)token 占比上升;5 月 28 日达峰值 $2.07,较发布基线近翻倍
2026-06 → 09−53% ↓(较峰值)供给效应+替代效应:中国开源模型(Kimi K3、DeepSeek V4、GLM-5.x、Qwen3.x)崛起、OpenAI 7 月底对两款 GPT-5.6 降价、前沿实验室引入动态定价、路由把简单任务分流到便宜模型、缓存/量化/压缩等效率技术
2026-09-01$0.97(新低)首次跌破 $1,较 5 月峰值 −54%,创发布以来最低
2026-09 下旬 → 10~$1.00低位企稳,与年初水平相当(较基线仅低约 8%)

1.3 为什么"指数下跌"不等于"需求走弱"——三条对照证据

  • 算力侧镜像:GPU 租金仍在上涨。同一时间窗内,H200 租金基准约 $3.29/GPU·小时(9 月 19 日纪录 $3.32),B200 约 $5.76/GPU·小时(同比 +31%)。Token 均价在跌、算力租金在涨——量在爆发,价在分化。
  • 收入侧对照:Anthropic ARR $9B → $76.8B(8.5 倍)。ARR 里程碑:2025-12 约 $90 亿 → 2026-03 约 $200 亿 → 2026-05 末约 $470 亿 → 2026-08 约 $650 亿 → 2026-09-24 $768 亿(月环比 +1.8%);同期 OpenAI ARR $504.4 亿(月环比 +13.4%)。降价与收入爆发并存 = 需求价格弹性大于 1。
  • 用量侧对照:Token 调用量仍在高速增长。2026 年初发生"Inference Flip"——推理侧累计支出超过训练;目前推理约占全球 AI 算力支出的三分之二。单周 Token 调用量持续环比两位数增长。
一句话读图:橙柱是"量 × 价"的收入现实,蓝线是"价 × 结构"的价格现实。两者背离恰恰说明:模型市场的增长引擎已经切换到用量,单价涨跌不再是收入的决定变量。
二

API 价格变化过程(2023–2026):三个阶段

PRICE HISTORY
阶段时间特征标志性价格(输入 / 输出,$/Mtok)
① 断崖跳水2023–2024 同代能力年降 10 倍以上;开源入场把"够用"打到地板价 GPT-4 $30/$60(2023.3)→ GPT-4 Turbo $10/$30 → GPT-4o $5/$15 → GPT-4o mini $0.15/$0.60(16 个月约 200 倍);Claude Opus $15/$75、Sonnet 3.5 $3/$15;DeepSeek V3 $0.14/$0.28(2024.12)
② 推理溢价与通缩并存2025 思考型模型从稀有变成标配;旗舰再降一档;中国开源冲击波迫使全行业跟进降价 o1 $15/$60;o3 从 $10/$40 砍到 $2/$8(−80%);GPT-5 $1.25/$10(较初代 GPT-4 降约 24 倍);Claude Opus 4.5 $5/$25(旗舰直降 3 倍);DeepSeek R1 $0.55/$2.19
③ 双向分化2026 商品化层趋近于零 vs 前沿层"按价值定价"首次涨价;中档逆势降价;动态定价出现 Gemini 3.x Flash 低至 $0.075/$0.30;DeepSeek V4 Flash $0.09–0.22/$0.28–0.66(分时定价);GLM-5.3-Flash 输出 $0.50;GPT-6 Astra $10/$50(9/3,较 GPT-5 输入 8 倍、输出 5 倍);Fable 5 $10/$50;Sonnet 5 $2/$10(拟涨至 $3/$15 被取消)

2.1 三条产品线的具体轨迹

  • OpenAI:从"单线降价"转向"能力分档定价"。GPT-4 $30/$60 → Turbo $10/$30 → 4o $5/$15 → GPT-5 $1.25/$10 → GPT-5.4 $2.50/$15 → GPT-5.6 Sol $5/$30(促销价 $4/$20,至 11/21)→ GPT-6 Astra $10/$50。三年半输入价净降 3 倍,但 2026 年旗舰线重新上调——贵 2.5 倍的单价买的是长程 agent、计算机操作、终端任务的跃升(Terminal-Bench 4.0:57.9% vs 37.3%)。低价档同时探底:GPT-5.6 Luna $0.20/$1.20。
  • Anthropic:旗舰直降后稳住,新增顶级档。Opus 线从 $15/$75(Opus 3/4)压到 $5/$25(Opus 4.5 起,4.5–4.8 与 Opus 5 全部维持);Sonnet 家族稳在 $3/$15,新款 Sonnet 5 反向降到 $2/$10 并宣布永久(此前拟回调至 $3/$15,在竞争压力下取消);新增 Fable 5 顶级档 $10/$50。Haiku 4.5 $1/$5。
  • 商品化/开源层:向零收敛。DeepSeek 首创分时定价(2026-08-16 起,高峰时段 2 倍价,周末全时段低档);DeepSeek V4 Flash 低至 $0.09/$0.20 级;智谱 GLM-5.3-Flash 输出 $0.50(智能指数 41.9,国产性价比第一);Qwen3.5 4B $0.03/$0.15;免费档与 $18/月订阅(GLM Coding Plan)并行——"按 seat 卖"开始侵蚀"按 token 卖"。

2.2 三个容易被忽略的"隐性价格"

  • Tokenizer 缩放:Claude Opus 4.7 之后的新分词器对同一段文本多计约 30% token——"单价没涨"的迁移可能带来"账单上涨"。
  • 长上下文阶梯价:GPT-6 Astra 请求超过约 27.2 万 token 后,输入与缓存费率翻倍、输出升至 1.5 倍——反复读整个代码库/财报的应用,长上下文并不免费。
  • 真正的折扣在"工程层":缓存命中 −90%(如 $5 档输入降至 $0.50)、批处理 −50%、路由替代省 30–60%、上下文压缩 60–95%。标价是名义价格,工程优化后的有效价格才是你付的钱。

2.3 当前主要模型价格速查(2026-10)

厂商模型输入 $/Mtok输出 $/Mtok备注
OpenAIGPT-6 Astra$10(>272K 时 $20)$50(>272K 时 $75)2026-09-03 旗舰;缓存 $1
OpenAIGPT-5.6 Sol$4(促销)/$5 标价$20(促销)/$30 标价促销至 2026-11-21
OpenAIGPT-5.6 Terra / Luna$2 / $0.20$12 / $1.20中档 / 低价档
AnthropicFable 5$10$50新顶级档(Mythos 5 同价,限量)
AnthropicOpus 5(及 4.5–4.8)$5$25旗舰主力,1M 上下文无长文溢价
AnthropicSonnet 5$2$10降价永久化(涨价计划取消)
AnthropicSonnet 5.5$2$10标价持平,但单任务 token 用量创纪录 → 单任务成本 +50%(见 4.2)
AnthropicHaiku 4.5$1$5轻量档
GoogleGemini 3.1 Pro$2$12≤200K;超长 $4/$18
GoogleGemini 3.x Flash$0.075–0.75$0.30–3.75档位多,最低价档位极具杀伤力
DeepSeekV4 Flash / V4 Pro$0.09–0.22 / $0.42–0.66$0.20–0.66 / $0.83–1.98分时定价:高峰 ×2
MoonshotKimi K3$3$15开源旗舰,1M 上下文,缓存 $0.30
智谱GLM-5.2 / 5.3-Flash$1.05–1.40 / ~$3.3–4.4 / $0.50Flash 为国产性价比第一
阿里Qwen3.5 4B$0.03$0.15挂到"地板价"的轻量档
xAIGrok 4.6≈$3≈$15行情参考值

注:各来源披露口径与更新时间不一,部分为区间估计;以厂商官方定价页为准。

三

任务完成对应价格:四个权威口径

COST PER TASK

行业已经从"每百万 token 多少钱"进化到"每完成一件事多少钱"。目前有四套被广泛引用的任务级口径,分别回答不同问题:

3.1 口径一:固定质量任务成本(Epoch AI)——回答"做题便宜了多少"

  • 2026-09-22 报告《The Plunging Price of Thought》:达到固定性能水平的成本以约 47%/季度(≈13 倍/年)下降,统计窗口为 2023 年以来、222 个模型、11 项基准。
  • 实例:研究生级科学题(GPQA Diamond)一题——o3(2025 年 1 月,75 分档)约 $0.30 → GPT-5.6 Luna(约 18 个月后,同水平)约 $0.0004,725 倍。相当于一辆 5 万美元的车一年半后卖 69 美元。
  • 速率特征:新 SOTA 能力首个季度降约 66%(≈75 倍/年),两年后放缓至 32%/季度;数学题降得最快(50–52%/季),游戏类稍慢(39–43%/季)。
  • 横向比较:比 DNA 测序快约 4 倍、比锂电池快 18 倍、比 20 世纪电力快 54 倍——有可比数据的技术里没有更快的。

3.2 口径二:公开计价榜的单任务价格(ARC-AGI-2 / SWE-rebench)

任务样本模型(档位)得分单任务成本备注
ARC-AGI-2 一道抽象推理题
(2026-08 官方验证榜)
Claude Opus 5 (Max)90.4%$2.06榜首
Kimi K3 (Max)60.4%$1.59开源旗舰
Gemini 3.6 Flash (High)60.4%$0.61
GPT-5.6 Luna (Max)59.6%$0.18曾是最佳性价比
DeepSeek V4 Flash (Max)61.4%$0.042性价比前沿新标准(4 美分/题)
历史对照:Opus 4.5(2025-11)37.6% = $2.20/题;Gemini 3 Pro+Poetiq 54% = $30/题;DeepSeek V3.2(2025-12)仅 4.0%、R1(2025-01)1.3%。一年时间:同族模型从"做不出"到"61 分只需 4 美分"。
SWE-rebench 一道真实代码修复题
(2026 年中,去污染题库)
Claude Fable 564.5%$4.40"0.7 分之差、3 倍价差"——选择比价格更重要
Grok 4.563.8%$1.47

3.3 口径三:综合智能任务成本(Artificial Analysis)

  • AA 智能指数"综合难题一题"的加权成本(含输入/缓存/思考/输出全链路):当前区间从 $0.01–0.02(GPT-5.6 Luna 中低档、MiMo-V2.5)到 $3.45(Fable 5),跨度约 300 倍。
  • 智力 63 分(榜首档)的 Opus 5(Max)约 $2.34/题;同为 61 分的 GPT-5.6 Sol(Max)约 $1.23/题——同分不同价,多花一倍钱不一定多拿一分。
  • 2025 全年回顾(AA 年报):o1 级智力的每 token 成本一年内下降 128 倍——"聪明不再等于昂贵"。

3.4 口径四:应用级任务成本(你日常真正在付的)

任务场景时点成本对比/说明
典型 2,000-token 简单任务(问答/摘要)2023(GPT-4 时代)≈ $0.08当时最强模型的单次任务成本
同上2026-08(前沿档)≈ $0.02–0.03降约 3–4 倍,但能力代际不同
同上2026-08(经济档)< $0.001较 2023 年降 100 倍以上
代码 Agent:一天工作量2026-05≈ $13/天对比软件工程师 ≈ $300/天(约 20 倍优势)
企业级 Agent 工作流(单任务)2026$0.005–0.1(纯经济路由)
$0.5–25+(全量前沿模型)
单任务 5 万–50 万 tokens;路由选择决定 10–100 倍成本差
整轮基准评测(GAIA,74.5 分档)2026$178.20/轮Princeton HAL 成本控制榜;SWE-bench Mini 同档 $463.90/轮
研究界提醒:Princeton HAL 的总结是"Agent 可以贵 100 倍而只强 1%";真实成本要按"通过验收的任务单价"(cost per accepted task)衡量——包含重试、失败、人工复核的完整链路,而不是 API 清单价。
四

结论:完成一个任务的总成本在降吗?

VERDICT

4.1 三个口径、三个答案——以及它们为什么不矛盾

口径回答的问题答案关键数据
A · 科学口径
固定任务、固定质量
同样考 75 分的题,今天要花多少钱? 在快速下降 47%/季 ≈ 13 倍/年(Epoch 2026-09);GPQA 单题 18 个月降 725 倍;三年累计约 300 倍(GPT-4 级能力从 $30 → $0.1–0.4/Mtok)。但降速在放缓:10 倍/年(2021–25)→ 3–5 倍/年(2025–27e)→ 1.5–2 倍/年(2027+e,推理算力地板)
B · 账单口径
真实的 agent 工作负载
我完成同样一件事(或一个项目),账单涨还是跌? 不降,持平到上涨 2–3 倍 Gartner(2026-03):agentic 任务 token 用量是聊天机器人的 5–30 倍;单次交互从 ~2,000 → 5 万–50 万 tokens;单价 ÷10 与用量 ×30 相抵。Jevons 悖论:便宜的单位价格创造了更多需求
C · 市场口径
全市场混合成交均价
"大模型"作为一个整体,价格在跌吗? 非单调:先翻倍、再腰斩 SDLLMTK:$1.09 → $2.07(5 月底)→ $0.97(9 月初,−54%)→ 约 $1.00。涨是结构效应(负载升级),跌是供给效应(开源+降价+路由)。当前较发布基线仅低约 8%

4.2 深度案例:Sonnet 5.5——一张价目表上同时写下"降价"和"涨价"

Sonnet 5.5 是"名义价格 ↓、有效价格 ↑"最完整的实证样本。它把本节讨论的每一条机制——用量放大、分词器、思考档位、名义价与有效价的背离——都压缩在了一个案例里。

4.2.1 事实:三次连续的"标价持平、账单上涨"

度量Sonnet 5(max)Sonnet 5.5(max)变化来源
挂牌价(输入/输出)$2/$10$2/$100%(完全持平)Anthropic 官方价
AA 智能指数38→53 档*56(第 2 名,max 档 +18 分)能力 ↑ 大幅Artificial Analysis
单任务输出 tokens(AA 口径)≈121k≈193k(AA 有史以来最高)+60%Artificial Analysis 实测
单任务成本(AA Intelligence Index 口径)≈$5.1$7.60+50%Artificial Analysis / SiliconReport / AI Weekly
横向参照193k/任务 ≈ Opus 5.5(max)的 1.6 倍 ≈ GPT-6 Astra(max)的 7 倍;AA 整轮跑完输出 420M tokens vs 全市场中位数 81MArtificial Analysis

* Sonnet 5 发布时 AA 指数 53 分(当时口径),同期成本约 $2.29/任务(促销价下);5.5 与 5 同价口径对比约 $5.1 → $7.60。Sonnet 5.5 处于"智力—成本" Pareto 前沿之外:同等成本下 GPT-6 Astra / Sol 用更少 token 达到同等智力分。

4.2.2 拆解:+50% 从哪来——两个乘数、三个机制

单任务成本 = 单价 × token 数。标价 $2/$10 没动,分子上动的是 token 数,且不止一处:

机制放大系数性质说明
① 分词器膨胀 ≈ +30%(1.0–1.4x) 隐性、不可控 Sonnet 5 起新分词器对同一段文本多计约 30% token(官方披露)。Simon Willison 实测分布:英文 ~1.4x、西语 ~1.33x、Python 代码 ~1.28x、简体中文 ≈1.0x——语言结构不同,"tokenizer 税"不同。输入侧同样生效,且顺带让 1M 上下文装得更少、限流更早触发
② 思考/输出膨胀 ≈ +60%(max 档,AA 口径) 半可控(effort 档位) Adaptive thinking 默认高档、思考 tokens 按输出计费。Sonnet 5.5 max 档单任务输出 193k,是上代的 1.6 倍;Anthropic 自己在 Opus 5.5 提示指南里警告"旧 effort 设置在新模型上会炸 token"
③ 默认值上移 结构性 厂商可控、用户被动 默认 effort 上移(API/Claude Code 默认 high)、Claude Code 与 App 默认 medium。用户"什么都不改",账单口径就自动升级了
合成效果 +50%(成本) 标价 0% × token 总量放大 → 有效单价上涨约 50%。这是"同一张价目表"的完整含义
Sonnet 5.5 的"有效涨价"分解:标价持平 → 单任务成本 +50%
口径:Artificial Analysis Intelligence Index 单任务成本(max effort),近似值。输入/输出按 AA 实测任务结构合成。
$8$6$4 $2$0 ≈$5.1 Sonnet 5 (max) 193k÷1.6≈121k 输出/任务 +≈$0.7 分词器膨胀 同文本多计 ~30% +≈$1.8 思考/输出膨胀 121k→193k,+60%(主因) $7.60 Sonnet 5.5 (max) 193k 输出/任务 · 标价同为 $2/$10 标价变化:0% 有效成本:+50% (≈$5.1 → $7.60) 拆分为近似值:+50% 总增幅中,思考/输出膨胀贡献约 2/3,分词器贡献约 1/3

4.2.3 时间线加成:9 月 1 日"双重跳价"

Sonnet 5 线的故事在 2026 年 9 月叠加了一次教科书级的复合效应——对 Sonnet 5/5.5 的存量用户而言,9 月 1 日同时发生两件事:

  • 促销价退出:$2/$10 是"intro 定价"(原定 8 月 31 日结束回调 $3/$15;Anthropic 在竞争压力下宣布对 Sonnet 5 永久维持 $2/$10,但 5.5 各档定价结构不变)——即便维持,促销期形成的"降价预期"也已经锚定了用户心理。
  • tokenizer 膨胀全额显形:促销期内 $2/$10 恰好对冲了 +30% 的 token 膨胀,Anthropic 官方称迁移"roughly cost-neutral"——这句表述本身就是"标价下降≈刚好抵消 token 膨胀"的厂商自认。一旦任何一端松动(如某档回调 $3/$15),膨胀立即转化为净涨价。

Finout / MoClaw 的迁移审计给出过一组具体测算(以 Sonnet 5 为例,同一 workload):

价格状态费率(入/出)同文本计费 tokens月成本vs 基线
Sonnet 4.6(基线)$3/$152.0M / 0.4M$360—
Sonnet 5 促销期$2/$102.6M / 0.52M(+30%)$312−13%(显得"更便宜")
Sonnet 5/5.5 标准价(若回调 $3/$15)$3/$152.6M / 0.52M$468+30%(纯 tokenizer 税)

社区实证与该模型吻合:r/SaaS 有创始人报告请求数基本不变的情况下月账单 $140 → $278(+99%);r/vibecoding 用户确认 session 额度消耗明显加快。中国用户幸运一些:Willison 实测简体中文 ≈1.0x,tokenizer 税对中文负载几乎不生效。

4.2.4 怎么读这个案例:四条推论

  • ① "降价"的定义已经改变。Sonnet 5.5 证明:在"思考 token 按输出计费 + 分词器可重定义 + effort 默认值厂商可控"的计费体系下,标价(price per token)与成本(cost per task)是两个可以独立运动的变量。看账单要看三元组:单价 × token 系数 × effort 档位——缺一个都会得出与钱包相反的结论。
  • ② 这是厂商的理性定价策略,不是事故。智能指数 +18 分、Terminal-Bench 4.0 拿下 64%(超过 Opus 5.5 和 GPT-6 Astra 的 60%)——5.5 确实更强,但它把"更强"的增量放在了用量维度而不是价格维度:涨的能力按 token 收费,稳的价格守住名义锚。对比之下 GPT-6 Astra 是另一种打法:直接把涨幅写上标价($10/$50)。前者是"隐性涨价",后者是"显性涨价"——AA 数据显示 Astra max 单任务 $2.57 反而只有 Sonnet 5.5 的 1/3。
  • ③ "Pareto 前沿之外"是第三方评测给出的最严厉判词。AA 明确指出 Sonnet 5.5 大多数配置下不在智力—成本前沿上:同样 61 分档,GPT-6 Sol 用少得多的 token;同样花 $7.6,可以直接买 Astra 两倍数量的任务。当"每 token 智能密度"成为竞争维度,单看价格榜和智力榜都会误判。
  • ④ 用户侧的对策已经收敛为三个动作。(a)压 effort:Anthropic 官方映射——Sonnet 5.5 medium ≈ 上代 high,绝大多数工作流降一档 effort 不掉质量;(b)重算 token:迁移前用官方 token 计数端点重测自己的 prompt,别沿用旧模型的 counts;(c)盯有效指标:按"每通过验收任务的成本"(cost per accepted task)做预算,而不是按 $/Mtok。
把 4.2 的结论并回主命题:"大模型 API 降价"这句话在 2026 年需要一个补充条款——降价的是标价,未必是成本。当模型厂商同时掌握定价权($/Mtok)、计量权(tokenizer)和档位权(默认 effort)时,三者都可以成为涨价通道。Sonnet 5.5 只是最清晰的样本,同样的机制在 GPT-5.6 Sol 的"促销价"、DeepSeek 的"分时定价×2"、Astra 的"长上下文阶梯价"上都有不同力度的体现。口径之争,就是成本之争。

4.3 所以,"总成本在降低"这个判断该怎么下?

  • 如果锁定任务和质量不变——是的,而且在以史上最快速度下降。同一道题、同一分数,成本每 3–4 个月减半(13 倍/年)。这部分是确定、可验证的。
  • 但你几乎不会"锁定质量"。一年前你在问"聊天机器人答得对不对",现在你在让 agent 独立跑完几十分钟的编程任务(METR:agent 能独立完成的任务时长每 4 个月翻倍)。你花的钱买到了去年买不到的东西——成本比较的基准线本身在移动。
  • 更隐蔽的是:厂商在用"用量"替代"价格"收费。Sonnet 5.5 是最新样本——标价与上代完全持平($2/$10),但 max 档单任务输出 193k tokens(AA 有史以来最高),单任务成本 +50%(≈$5.1 → $7.60),跌出智力—成本 Pareto 前沿(详见 4.2 深度案例)。名义降价与有效涨价可以同时成立。
  • 企业侧的现实是"账单悖论":单价跌 10–280 倍的同时,企业 AI 支出在涨——LLM API 支出 2025 年 $84 亿、2026 年再翻倍;平均企业 AI 预算从 $120 万/年(2024)涨到 $700 万/年(2026);推理占预算 85%(2023 年:40%)。Uber 4 个月烧完全年 AI 编码预算、某医药险企 token 消耗一年从 300 万涨到 1.5 亿——这不是价格问题,是用量问题。
  • 把三个数字放在一起才是完整的 2026:ARR $768 亿(需求爆炸)× 指数 $0.97(单位价格历史新低)× 13 倍/年(固定质量成本降速)。价格腰斩没有杀死增长,反而成了增长的燃料——这是需求弹性大于 1 的市场。
一句话答案:"大模型完成一个任务的调用总成本"——按固定质量口径在快速下降(约 13 倍/年),按实际 agent 负载口径持平到上涨(用量 5–30 倍吃掉降价红利,且厂商正在用 token 计量与档位设计部分回收降价),按市场混合均价口径非单调。你感受到"变便宜"和"花更多"同时成立,两者都是真的。

4.4 对投资视角的三点延伸

  • 别把 Token 价格指数当需求指标用。SDLLMTK 是"替代调整后的价格指数",与 GPU 租金(H200/B200 坚挺上涨)互为镜像:价格在通缩、算力在紧俏——组合看才是完整的供需图。韩国券商已将其作为 AI 需求的"先行指标"用于仓位管理。
  • 模型层定价权在流失、毛利在压缩。API 毛利率估计:OpenAI 75–80% → 55–65%;Anthropic 70–75% → 55–60%(2023 → 2026)。但弹性 > 1 可以补偿——Anthropic 约 $2 万亿 IPO 估值本质上在赌"量补价";而 DeepSeek 毛利率或仅 10–25%,走的是"薄利多销+开源生态"定价。
  • 下一个降本来源不在标价,在"每 token 有效性"。缓存(−90%)、批处理(−50%)、路由(省 30–60%)、上下文压缩(60–95%)、蒸馏与端侧——2026 年增长最快的开源项目之一(headroom 等上下文压缩层)正是干这个的。价值捕获正在从"卖 token"转向"卖每 token 的效果"。
五

算力租金 × Token 成本:通缩的地板在哪里

COMPUTE RENTS → TOKEN FLOOR

前面四节回答的是"价格信号"(token 卖多少钱),这一节回答"成本地板"(token 最低能卖多便宜、为什么便宜不下去)。两条线在物理层汇合:每一枚 token 都是在某张计算卡上、按每小时租金计费生产出来的。

5.1 算力租金现状(2026-10):与 token 通缩完全相反的曲线

计算卡新云中位租金
($/GPU·hr)
超大规模云中位溢价近期走势
NVIDIA H100 SXM 80GB$2.61–3.41$7.19+89%7D +1.5%,低位缓慢爬升
NVIDIA H200 SXM 141GB$3.30(峰值 $3.32,9/19)$10.44+132%6 月 $2.87 → 9 月 $3.29(+15%)
NVIDIA B200 180GB$5.76–5.79$15.18+93%年内 +31%,7D +1.2%
NVIDIA B300 288GB$8.39–9.06——4 月底上市以来 +44%
NVIDIA GB300 NVL$14.21——机架级系统,供给最紧
AMD MI300X 192GB$2.59–2.65——7D +0.8%;约为 H200 的 8 折
AMD MI355X 288GB$5.60——对标 B200 档位

口径:Silicon Data 新云(neo-cloud)标准化租赁指数 + cloud-gpus.com / ComputePrices / GPUPerHour 三方聚合(2026-10 初);"超大规模云"指 AWS/Azure/GCP 同卡挂牌中位。现货租赁波动大,取中位数以平滑。远期曲线佐证:多家聚合平台显示 H100/H200/B200 的一年期 forward 租金单调上行——云厂商宁可不接长单也不愿折价锁定,即供给方自己判断"租金还会涨"。

镜像:Token 均价腰斩 vs 计算卡租金上涨(2025-12 → 2026-10)
基于 Silicon Data 双指数公开锚点重绘(近似值)。蓝线:LLM Token 支出指数($/Mtok);柱:新云 GPU 租金指数(H200+B200 等权合成,以 2025-12=1.00 归一)。
≈+13% 租金持续爬升 $1.09 $2.07(5/28) $0.97(9/1) 同一枚 token 的两侧: 卖价(API)在通缩, 产线租金(GPU)在通胀 12月1月2月3月 4月5月6月7月 8月9月 GPU 租金指数(新云 H200+B200 合成,2025-12=1.00) LLM Token 支出指数($/Mtok,右概念左轴) 来源锚点:Silicon Data(H200 $2.87→$3.29;B200 年内+31%;B300 +44%;Token 指数 $1.09→$2.07→$0.97)

5.2 从租金到 token:换算公式与三档成本地板

自建推理的 token 成本只有一个公式(DigitalOcean/vLLM 实测框架):

token 单位成本 = GPU 租金 ÷(饱和吞吐 × 利用率)
$/Mtok = 时租金 ÷(tok/s × 3600 × 利用率)× 10⁶

公式的三个变量恰好解释了三件事:租金决定地板的高度、吞吐决定工艺水平、利用率决定你离地板有多远。代入 2026-10 的真实数据:

成本档硬件/口径吞吐(实测锚点)利用率token 成本对应市场价位
① 物理地板 H200 $3.44/hr,70B FP8 满载 2,036 tok/s(batch 饱和) 100% ≈$0.45/M 理论极限,现实中达不到
② 良好运营 同上 2,036 tok/s 73%(持续负载) ≈$0.62/M DeepSeek 类"成本定价"区($0.28–0.66);专业推理云批量价
③ 普通运营 同上 2,036 tok/s 40%(波动流量) ≈$1.17/M 已高于 SDLLMTK 全市场均价 $0.97——自建开始贵过 API
④ 低效运营 同上 batch=1(~47 tok/s) 任意 ≈$20/M 未做连续批处理的"裸跑":比前沿 API 还贵 2 倍+
三个关键数字:① 利用率 73% 是自建/API 的盈亏交叉点(DigitalOcean 实测 72.2%);② batch 1→饱和相差 44 倍($20.3 → $0.46/M),批处理是比换卡大一个量级的降本杠杆;③ H200 比 H100 吞吐高约 1.45 倍(HBM3e 带宽差),且 70B FP16 装不进 80GB——显存带宽(HBM)才是推理的卡位资源,这就是 H200/B200 租金坚挺的微观原因。

5.3 地板的三个推论:谁能定价、谁被挤出去、通缩何时见底

  • 推论一:成本定价区已经贴地,价值定价区远离地板。DeepSeek V4 Flash 按"成本+微利"定价(毛利或仅 10–25%),其 $0.28/M 输出价已贴近 73% 利用率的物理地板——这条赛道上价格战没有多少再降空间,除非租金跌。而前沿模型 $2–10/M 卖的是"能力稀缺性",与地板无关:Astra 的长上下文翻倍价、Fable 的 $10/$50,都是稀缺性定价。市场实际是双轨制:一轨锚定成本、一轨锚定价值,SDLLMTK 的 $0.97 是两轨用量的加权混合。
  • 推论二:租金上涨正在重塑推理产业的分层。纯 GPU 转租毛利仅 20–30%,扛不住涨价的新云玩家被挤出;CoreWeave(Q2 收入 +112%、合同积压 $1,040 亿)、Nebius(+454%、毛利 77%)都在向托管推理(Token-as-a-Service)上游迁移——用"提高利用率"消化租金,用"软件层"赚回毛利。CoreWeave 托管推理单季从 $100 万做到 $1 亿 ARR,就是"租金上涨 → 倒逼利用率革命 → 商业模式升级"的完整链条。对模型厂商的映射:Anthropic 把毛利指引下调到 40%(付给云厂商的推理成本是主因)——前沿玩家在为稀缺算力支付通胀,商品玩家在把算力用到极致。
  • 推论三:token 通缩的"见底条件"已经可以写成不等式。Epoch 的降速预测(2027+ 年降至 1.5–2 倍/年)与算力侧相互印证:当效率红利(量化/蒸馏/推理优化,arXiv 测算贡献了全要素降本的 ~104%)被租金上涨部分吞噬后,固定质量成本的年降幅将从"10 倍时代"滑向"2 倍时代"。见底信号 checklist:(a)H200/B200 一年期 forward 租金掉头向下(当前仍单调上行);(b)Rubin 量产缓解 HBM 供给(2026 年底首批几乎全部被超大规模云锁定的例外:它们自己也要跑推理);(c)SDLLMTK 与 GPU 租金指数的剪刀差收敛。三者未出现前,"token 均价在 $1 附近筑底、结构性分化继续"是基准情形——这也意味着:Q2 那种"全市场腰斩"式通缩大概率已终结,后续降价将只发生在模型档位切换(新代际把旧代际打下来),而不是整体水位下移。

5.4 并回主命题:完整的三层成本模型

层变量2026 现状方向
L1 物理层
算力租金
$/GPU·hr × 利用率H200 $3.30、B200 $5.76、B300 +44%;forward 单调上行↑ 通胀(供给约束)
L2 生产层
token 成本地板
租金 ÷(吞吐 × 利用率)地板 ≈$0.45/M,良好运营 $0.62/M;效率红利(量化/批处理/蒸馏)仍在兑现↓ 缓降(效率 vs 租金赛跑)
L3 市场层
API 挂牌/成交价
SDLLMTK、厂商价目表均价 $0.97;成本轨贴地板、价值轨(前沿)结构性上涨(GPT-6、Fable、5.5 案例)分化(商品趋地板、前沿涨)
最后合成一句话:token 价格的通缩是"效率红利"在分配,不是"成本塌方";地板由计算卡租金和利用率决定,而租金正在上涨。所以"完成任务的总成本在降吗"的完整答案是——下降的部分是效率红利(真实、快速、但在减速),上涨的部分是稀缺溢价(前沿能力与思考 token)和用量膨胀(agent 化)。L1 通胀、L2 缓降、L3 分化——2026 年的 token 成本问题,本质上是这三层速度差的游戏。
六

总结:当价格信号遇上成本地板

SYNTHESIS

前五章分别观察了两条线:价格信号线(SDLLMTK 均价、厂商价目表、任务级成本——市场"卖多少钱")与成本地板线(GPU 租金、利用率、自建换算——产业"最低能卖多便宜")。本章把两条线合到一张图上,给出统一的机制解释、可检验的判断清单、以及对三类参与者的操作含义。

6.1 两条线的全景对撞:一张图看完 2026

每个维度一张卡:左蓝 = 价格信号(市场卖多少),右橙 = 成本地板(产业最低多少),底部绿条 = 两线合流后的结论。

总量指标指数与租金的剪刀差
价格信号
SDLLMTK:$1.09 → $2.07(峰值)→ $0.97(新低)→ ~$1.00,年内 −8%、较峰值 −53%
成本地板
H200 租金 $3.30/hr(+15%)、B200 $5.76(+31%)、B300 上市以来 +44%;一年期 forward 单调上行
合流剪刀差——卖价通缩、产线通胀并存,证明通缩来自效率再分配,不是成本塌方。
头部样本旗舰标价 vs 自建地板
价格信号
旗舰输入价:GPT-4 $30 → GPT-6 $10(三年净降 3 倍,2026 年反弹 2.5 倍);Sonnet 5.5 标价持平、单任务 +50%
成本地板
自建 70B 满载地板 $0.45/M、良好运营 $0.62/M(73% 利用率,H200 实测)
合流前沿定价与地板完全脱钩(约 22 倍空间)——前沿卖的是稀缺性,不是 token 本身。
任务成本谁在为降价买单
价格信号
固定质量:GPQA 单题 $0.30 → $0.0004(18 个月 725 倍);实际 agent 账单:用量 5–30 倍吃掉降价
成本地板
地板降幅 = 效率红利 ÷ 租金涨幅(arXiv 分解:效率贡献 ~104%,GPU 硬件贡献 −0.9%)
合流任务成本的下降全部由效率红利融资;租金每涨一分,红利就被吃掉一分。
厂商利润价值向中间层迁移
价格信号
API 毛利:OpenAI 75–80% → 55–65%;Anthropic 指引下调至 40%(云侧推理成本是主因)
成本地板
纯 GPU 转租毛利仅 20–30%;CoreWeave / Nebius 靠托管推理把毛利做到 66–77%
合流利润正从"卖 token 的"和"租卡片的"两端,向"经营利用率的"中间层迁移。
需求验证Jevons 闭环的三个证据
价格信号
Anthropic ARR $9B → $76.8B(8.5 倍);企业 AI 预算 $1.2M → $7M/年;推理占全球 AI 算力支出 2/3
成本地板
OpenRouter 周调用量两位数环比增长;GPT-5.6 Luna 单周 17.4T tokens(+21%)
合流价格弹性 > 1 的闭环成立:降价 → 用量更猛 → 算力更紧 → 租金更涨。

6.2 统一框架:一个机制讲完整个故事

2024–2026 的所有现象,可以用一条传导链压缩:

Token 成本的完整传导链(2026 合流模型)
左侧物理层决定"能多便宜",右侧市场层决定"实际卖多少";两条外部力量(效率红利、稀缺溢价)分别从上下挤压中间。
上压:效率红利(量化 · 蒸馏 · 批处理 · 缓存 · 路由 · 压缩) 压低 L2 与 L3 —— 通缩的唯一真实来源(arXiv:贡献 ~104% 的降本) 算力供给 HBM · 电力 · 先进制程 约束 ↑ L1 租金 H200 $3.30 · B200 +31% 通胀 ↑ L2 成本地板 $0.45–0.62/M(70B) 缓降 ↓ L3 价格信号 均价 $1 筑底 · 轨道分化 分化 ⇄ 用量 5–30x/任务 · 周环比两位数 膨胀 ↑ 账单/ARR ARR 8.5x 爆发 ↑ Jevons 反馈:账单增长 → 需求弹性 → 更多用量(弹性 > 1,闭环自我强化) 下托:稀缺溢价(前沿能力 · 思考 token · 长上下文) 抬高 L3 的前沿轨 —— Sonnet 5.5 / GPT-6 / 阶梯价都是它的形态 物理层(第五节) 市场层(第一至四节) 读法:中间三层是主链;效率红利自上而下压低成本与价格,稀缺溢价自下而上托住前沿价格,Jevons 反馈把降价转化为用量与账单

6.3 六条可检验的核心判断

#判断核心依据证伪条件(何时认错)
1 固定质量成本继续下降,但降速换挡:13x/年(2023–25)→ 3–5x(2026–27)→ 1.5–2x(2027+) Epoch 47%/季及其自身减速预告;租金上涨吞噬效率红利 任一主流基准(GPQA/ARC)单题成本再现 >10x/年 跌幅且租金同步下跌
2 token 均价在 $1/M 附近筑底,通缩让位于分化 SDLLMTK 三个月在 $0.96–1.02 窄幅企稳;成本轨已贴地板 forward 租金掉头 + Rubin 量产 + 指数再破新低(三者同时出现)
3 前沿层继续"隐性涨价":用量系数、tokenizer、默认档位成为主要涨价通道 Sonnet 5.5(标价平、成本 +50%);Astra 长上下文翻倍价;Sol 促销价到期机制 厂商转向明码涨价(如 Astra 模式)且第三方实测单任务成本随标价同步回落
4 模型层毛利触底、靠量补价;价值向"经营利用率"的中间层迁移 Anthropic 指引 40% + ARR 8.5 倍并存;CoreWeave 托管推理 $1M→$100M ARR、Nebius 毛利 77% 前沿厂商毛利回升至 60%+ 而用量增速失速;或 neocloud 托管推理增长停滞
5 Jevons 闭环持续:单价降幅 < 用量增幅,企业账单继续膨胀 Gartner 5–30x;企业预算三年近 6 倍;推理占算力支出 2/3;Uber/医保案例 OpenRouter 周用量增速连续一个季度低于 10%,且企业 AI 预算增速降至 <20%
6 降本的下一战场是"每 token 有效性":路由/缓存/压缩/effort 管理的节省空间(30–95%)大于标价谈判 batch 1→饱和 44 倍;缓存 −90%;路由省 30–60%;压缩 60–95%;headroom 类工具爆发 推理优化层出现整合红利耗尽(主流工作流有效成本降幅连续两季 <10%)

6.4 对三类参与者的操作含义

角色该相信什么不该相信什么动作
模型厂商 弹性 > 1:降价换量在商品轨成立;前沿轨靠能力稀缺性定价 "标价即品牌"——用户和评测已经只看单任务成本 管住三权(定价/计量/档位)的滥用,隐性涨价会在 Pareto 前沿上被第三方当场抓获(5.5 案例);把毛利押在托管推理与利用率而非 token 差价
应用开发者 账单 = 单价 × token 系数 × 档位;73% 利用率是自建分界;量小用 API、量大且平稳再自建 "新模型一定更便宜"——5.5 已经证明标价持平也能贵 50% 预算按 cost per accepted task 立;迁移必重测 tokenizer;effort 默认降一档;三层路由(经济/执行/前沿)作为默认架构
投资者 SDLLMTK 是"替代调整价格指数"不是需求指标;租金与 token 价互为镜像,组合看才是供需真相 "token 价格下跌 = AI 需求走弱"(2026 年被证伪次数最多的单一误读) 跟踪 6.5 仪表盘;弹性受益顺序:算力层(租金上行)→ 经营利用率层(托管推理)→ 应用层(成本红利)→ 模型层(毛利承压换规模)

6.5 监测仪表盘与风险情形

  • 周度三件套:SDLLMTK(价格信号)、Silicon Data GPU 租金指数 + forward 曲线(成本地板)、OpenRouter 用量榜(Jevons 验证)。三者 signs 组合即当前象限:价跌/租涨/量增 = 健康通缩(当下);价涨/租涨/量增 = 稀缺溢价主导(警惕);价跌/租跌/量平 = 需求警报(离场信号)。
  • 月度/季度:AA Cost per Task 与 ARC Prize 榜(固定质量成本)、厂商毛利与 ARR 披露(量补价验证)、企业 AI 预算调查(账单悖论)。
  • 事件触发:Rubin 量产与 HBM 供给节点、头部厂商 IPO 定价(Anthropic ~$2T 的本质是"量补价"的公开投票)、新的 tokenizer/计费规则变更公告。
框架失效的三种情形:① 供给冲击——HBM/电力短缺超预期,地板上移,通缩提前见底甚至反弹(租金曲线已给出早期预警通道);② 需求断裂——agent 商业化不及预期,用量增速失速,Jevons 逆转为死亡螺旋(价格战加深 + 租金崩塌共振);③ 技术阶跃——线性注意力/端侧推理等架构级突破令地板塌方,本报告的"租金锚定"逻辑整体重写。当前数据下三者概率均偏低,但 ② 的监测优先级最高——因为整个 2026 年的叙事(包括 $2T IPO)都建立在弹性 > 1 之上。
全篇终语:把六节压成一段话——大模型 API 的标价三年降了数百倍,任务级固定质量成本仍以每年数倍的速度下探;但成本地板由计算卡租金和利用率钉住,而租金正在上涨;于是市场分裂成贴着地板的成本轨和远离地板的价值轨,均价在 $1 筑底、结构持续分化;降价经由弹性 > 1 的 Jevons 闭环转化为更多用量与更贵的账单;厂商开始用计量权和档位权回收降价红利(Sonnet 5.5 是样本),利润向"经营利用率"的中间层迁移。"总成本在降吗"的最终答案:单位智能的成本在史诗级下降,单位任务的成本在结构分化中涨跌互现,单位账单的金额几乎注定继续上涨——三个都是真话,区别只在你站在传导链的哪一环。
附

附注:口径与主要来源

NOTES & SOURCES
  • 价格口径:均为标准挂牌价($/百万 tokens),输入/输出分别计价;促销价、缓存价、批处理价单独标注。各厂商命名迭代快(如 OpenAI 2026-07 起用 Sol/Terra/Luna 替代 Instant/Thinking/mini/nano),跨代比较时以能力档位对齐。
  • 指数与 ARR:SDLLMTK 数值为公开报道锚点(峰値 $2.07 为 5 月 28 日、低点 $0.97 为 9 月 1 日),月度内波动被平滑;Anthropic ARR 为年化运行率口径(最新 $768 亿,2026-09-24 披露)。
  • 主要来源:Silicon Data(SDLLMTK 指数、GPU 租赁指数及方法论说明,经公开报道整理);Epoch AI《The Plunging Price of Thought》(2026-09-22);Artificial Analysis(智能指数与 Cost per Task 榜单、2025 年报、Sonnet 5.5 首发测评 2026-09 底);ARC Prize 排行榜 / Princeton HAL 成本控制榜 / SWE-rebench;Gartner(2026-03,agentic token 用量;2026 年 AI IaaS 支出与推理占比预测);Anthropic 与 OpenAI 官方定价页与迁移文档(tokenizer 变更披露);Simon Willison 分词器实测;Finout / MoClaw 迁移成本审计;GPU 租金聚合:cloud-gpus.com / ComputePrices / GPUPerHour / Thunder Compute(2026-10 快照);自建推理成本框架:DigitalOcean H200 实测(vLLM 70B FP8)、arXiv 推理成本分解研究;CoreWeave / Nebius 财报与公开报道;The Information / Reuters / TechCrunch / Tom's Hardware / SiliconReport / AI Weekly 等报道汇编。
  • 免责声明:本报告为公开信息研究整理,部分数据为第三方估算或近似值,不构成投资建议。

报告生成:Bruce · Thematic Research · 2026-10-08 · 数据窗口 2023.03–2026.10