
你大概有一个跑了几个月、每天烧几十美金的 AI 管道。输入是一堆固定的公司文档加代码库输出是一段 JSON。上个月账单 3400这个月账单 1700。GPT-6.1 Sol 上线之后这种事不算新闻但原因不在多数人以为的地方。先说清楚时间。9 月 22 日 OpenAI 发 GPT-6 Sol9 月 29 日发 GPT-6.1 Sol中间隔了七天。新品在自家大部分测试上追平 GPT-6 Astra——那个单价五倍的自家旗舰。通常让位这么快意味着上一周做得不行但这次不太一样Sol 不是被 Astra 淘汰的是被价格淘汰的。OpenAI 花一周把旗舰能力搬到了工作horse的价格档然后顺手让旗舰的溢价显得不太合理。定价这块容易看错。GPT-6.1 Sol 输入每百万 token 2 美元、输出 10 美元和 GPT-6 Sol 一模一样。变的是缓存读取从 0.2 降到 0.1砍半写入另算 2.5。所以降价不准确标价没动动的是缓存读取价。这对你的账单意味着什么取决于你 prompt 的形状。同一份长上下文反复塞进去的命中率决定实际支出读取价减半之后差不多腰斩。prompt 每次都不同的缓存对你毫无帮助——那你这次升级的收益基本为零。真正要盯的是另一条输入超过 27.2 万 token 的请求整个请求按长上下文档位计费输入和缓存 2 倍、输出 1.5 倍。不是超出部分是全部。272001 个 token你那 30 万就全按长上下文算。这条把百万上下文的实用性划了个口子。装得下是一回事装满了还便宜地用是另一回事。而受冲击最大的恰恰是长文档 agent——这类应用最想让模型一直保持满上下文。第三方数据和官方的说法不完全合得上。Artificial Analysis 用 Intelligence Index v4.3.2 跑的结果是模型指数加权每任务成本Claude Opus 5.558$5.98Claude Sonnet 5.556$7.60GPT-6.1 Sol (max)52$0.72GPT-6 Astra53$3.26GPT-6 Sol48$1.05Sol 比 Astra 低一分这一分在统计上说明不了什么指数发布方也没给显著性结果。但 Opus 高 6 分、贵 8 倍这组对比没法绕开如果你的任务卡在 Sol 稍差一点的位置上升上去值不值取决于你的错误成本。一次失败是重跑两分钟值得一次失败是赔一笔钱答案可能反过来。然后是这次发布里我觉得唯一真正有信息量的数字。Sonnet 5.5 和 GPT-6.1 Sol 标价完全一样2 美元进、10 美元出。跑同一套指数的过程中Sonnet 生成了 4.1 亿 output tokenSol 生成了 6700 万。六倍。同样的单价实际账单差六倍多因为 token 消耗不由标价决定由模型决定。整个行业的定价叙事错在这儿——大家比每百万 token 多少钱比出谁便宜但掏钱的人是按任务付的而 token 用量是乘数。单价贵六倍、用量少六倍账单可能反过来。OpenAI 这次砍缓存价逻辑是同一件事不在单价上竞争在让单价更好用的地方竞争。它不是便宜是同样便宜的情况下更省。官方发布稿里把每任务成本放在单价后面讲顺序反了。Astra 现在守得住的大概是 Terminal-Bench Science68.1% 还是最高Sol 在这项上比上一代翻了一倍多但没赶上。除此之外OSWorld 2.0 差 2.1 个点指数差 1 分。这些撑不起五倍价差。旗舰不会消失但它得开始回答一个问题既然 Sol 便宜五倍谁还会为那一分付钱。几个迁移前要自己算的地方。OpenAI 这次给的数据全是自家评测官方标注为初步结果说研究环境和 API harness 可能跟生产的 ChatGPT 不一样有几条对比还横跨不同推理档位、对手那侧开着 fallback。方向能参考数字别照抄。知识截止是 2026 年 4 月 30 日。推理档位支持 low/medium/high/xhigh/maxmedium 默认none 和 minimal 这次拿掉了。最要紧的是现在只有 API、ChatGPT Work 和 Codex 的 Plus/Pro/Business/Enterprise/Edu 能用普通 Chat 里还没有。旗舰的保质期大概只会越来越短。不是旗舰变弱了是旗舰和中间档的差距填得太快而填它的是一周的工程优化加一个缓存价格不是架构突破。对 OpenAI 自己这是个难题溢价的来源是能力差差一缩小到十分之几个百分点五倍价差就撑不住。对我们的意义其实很简单卡在边界上的任务先翻翻价格表别急着换旗舰已经在用上一代的升级理由主要在那条缓存不在模型本身。真正的变量是 token 用量。它不出现在任何一张价格表上却是你账单上最大的一块。