今夜注定无眠。
Opus 5.5刚刚发布90分钟,OpenAI就把GPT-6 Sol和Luna一起端了上来。
前脚Anthropic刚把Opus的价格砍了一刀,后脚OpenAI直接把刀砍得更深。
GPT-6 Sol每百万Token输入只要2美元、输出10美元,价格正好只有Opus 5.5的一半,Astra的五分之一。
Luna更夸张,只要0.1美元和0.5美元,直接砍到Astra的1%。
这一晚上,模型能力还没来得及被检验,价格战先打起来了。
便宜,但没缩水
Astra仍然是GPT-6系列的最高档,OpenAI明确表示,如果任务足够重要、足够困难,而且不想在能力上做任何妥协,继续选Astra。
新来的Sol和Luna的任务,是把Astra的能力往更便宜的模型里塞。
OpenAI表示,两款模型采用了与Astra相似的训练方法,把这一代在专业工作、事实准确性、Coding、Computer Use和Alignment上的进步给“下放”了。
其中,GPT-6 Sol的定位为复杂Coding和Agent工作流的主力模型,Luna则负责高频、大规模、任务相对集中的工作,核心就是快和便宜。
两款模型都是105万Token上下文、最大128K Token输出,和Astra处于同一档;都支持文本和图片输入,网页搜索、文件搜索、代码解释器、Computer Use、MCP、Skills等工具也都可以正常调用。
它俩的推理档位甚至比Astra多一个选项。Astra只有low、medium、high、xhigh和max,Sol和Luna则多了一个none,可以把推理关掉。默认档位均为medium。
Sol的知识截止日期是2026年4月20日,Luna反而更新一些,到2026年5月18日。有意思的是,Astra的知识截止日期是2026年4月30日,卡在两个新模型中间。看来知识截止日期和模型“档位高低”并不是一回事。
然后再看价格。GPT-6 Sol每百万Token输入2美元、输出10美元,缓存输入只要0.2美元;GPT-6 Luna更狠,每百万Token输入0.1美元,输出0.5美元,缓存读取甚至低到了0.01美元。
而且这还不是价格的下限。Batch和Flex模式继续半价,缓存命中的输入Token也只按照普通输入价格的10%收费。
不过,百万上下文不能从头到尾都按这个价格算。
OpenAI规定,一旦单次请求的输入超过27.2万Token,整个请求都会按照长上下文价格收费:输入和缓存价格翻倍,输出提高50%。
所以Sol塞进超长上下文以后,会变成4美元输入、15美元输出;Luna则变成0.2美元和0.75美元。
105万上下文是真的,0.1美元也是真的,但两个数字不能直接乘起来。
价格降得很夸张,但性能并没有摆烂。
OpenAI用Sol证明了,原本需要旗舰模型花很多钱才能做的事,现在可以便宜很多。
比如跨应用Agent测试AutomationBench——由于OpenAI的文档里不包含刚发布的Opus 5.5,所以我们去找了Zapier的公开榜单。
在这项测试里,GPT-6 Sol开到xhigh拿到33.2%,单任务成本只有0.27美元。
如果只看绝对能力,它还打不过刚发布的Opus 5.5,后者max档做到40.0%,仅次于Astra max的41.4%。但Opus 5.5每项任务要1.28美元,几乎是Sol的4.7倍;Astra则要1.73美元,是Sol的6.4倍。
虽然Sol没有拿下第一,但它用不到0.3美元的价格,已经挤进了同一张前沿Agent榜单。
Coding也是一样。
在真实代码库软件工程测试DeepSWE v1.1里,GPT-6 Sol max拿到68.8%,距离Fable 5此前最高的69.9%只差1.1个百分点,但OpenAI估算单任务成本低约80%。
Luna则更加夸张,这个每百万输入Token只卖0.1美元的模型,max档也跑到了66.6%的水平。
OpenAI称,这已经接近Opus 5和Fable 5的medium档,但单任务成本分别低了93%和96%。
在测试Computer Use的OSWorld 2.0上,Sol xhigh拿到了60.5%,和Opus 5 medium的60.3%基本打平,成本却降了大约80%;Luna开到max,也能超过上一代GPT-5.6 Sol medium,而成本只有后者的大约十分之一。
不过需要说明的是,虽然Anthropic当天公布的Opus 5.5成绩高达81.8%,但这组成绩来自Anthropic自己的OSWorld 2.0评测设置;OpenAI公布的60.5%,则是在2026年8月8日版本的离线任务集上,按照部分完成度得分统计出来的。两边并不是同一套公开横测,不能直接比较。
要看Sol和Opus 5.5谁的Computer Use更强,得等同一套第三方测试。
GPT-6 Sol和Luna今天已经进入ChatGPT Work和Codex,Plus、Pro、Business、Enterprise和Edu用户都可以使用;Free和Go用户也可以在桌面App里使用GPT-6 Luna。
开发者则可以直接通过API调用,模型ID分别是gpt-6-sol和gpt-6-luna。
目前两款模型还没有进入普通Chat。Work和Codex则会在当天逐步完成推送,如果现在还没看到,可能只是还没轮到。
熟悉的Tibo重置,同样也没有缺席。
新模型、永久降价,再送一次额度重置,这个发布夜算是把“便宜”贯彻到底了。
跑分没暴涨,但体感在变
把视角移到第三方Artificial Analysis,这代模型的智力其实和上一代没什么差别。
在最新的Intelligence Index里,GPT-6 Sol max拿到48分,上一代GPT-5.6 Sol是47分;GPT-6 Luna max则是37分,上一代GPT-5.6 Luna甚至还高一分。
两款模型的综合能力基本原地踏步,但成本就完全不是这一回事了。
Artificial Analysis测得,Sol max的平均单任务成本从上一代的1.99美元降到了1.06美元;Luna则从0.18美元降到0.07美元。
这甚至不是因为两个新模型学会了“省Token”,Sol平均每项任务生成的Token从2.9万增加到了3.1万,Luna更是从4.1万增加到5.1万。它们就是单纯卖得更便宜了。
说到便宜,怎么能不提中国模型呢?
最新的DeepSeek V4.1 Flash在Artificial Analysis Intelligence Index里拿到39分,平均单任务成本大约0.27美元。虽然成绩比Luna高两分,但Luna的单任务成本只有0.07美元,差不多是V4 Flash的四分之一。
但要说它是“价格屠夫”,还是差点意思——就在昨天,小米刚刚发布了MiMo-V2.6系列。其中MiMo-V2.6-Pro在同一版Artificial Analysis Intelligence Index里拿到46分,距离Sol max的48分只差2分;但它的平均单任务成本只有0.13美元,而Sol是1.06美元。
只看API价格的话,MiMo-V2.6-Pro每百万Token输入0.435美元、输出0.87美元;更低一档的MiMo-V2.6-Flash,则只要0.14美元输入、0.28美元输出。
可惜目前Artificial Analysis还没有给MiMo-V2.6-Flash完整的综合指数,所以暂时没法和Luna做完全同口径的性价比比较。
这场价格战,远远不只是OpenAI和Anthropic两家公司之间的事。OpenAI把GPT-6的价格打进来了,但中国模型早就在这里卷了很久。
说完价格和跑分,值得注意的是,OpenAI这次也专门对模型的“回复风格”做出了调整。
官方专门给Sol和Luna列了一项“协作模式”,它们继承了Astra在沟通方式上的改进:说话更清楚,少一点行话,减少奇怪的措辞和低价值细节,整体回答也会稍微变短,但不牺牲真正有用的信息。
OpenAI认为,这种变化在Coding和技术对话里尤其明显。
而就在90分钟前发布的Opus 5.5,也做了几乎同一个方向的升级。Anthropic说,新Opus会把重要信息更早放出来,减少行话和一些Claude特有的奇怪表达,更遵守用户规定的写作方式。
同一个晚上,OpenAI和Anthropic都开始给自己的模型“去AI味”了。
另一个非常直接的升级,是降低了模型的事实性错误——说实话,这让我有一种梦回去年的感觉。
前沿大模型已经很少再把“不胡说八道”当成卖点了。虽然它依然重要,但相比Coding、Agent、Computer Use这些新能力,总显得不够“前沿”。Sol和Luna这次又把它捞了回来,可能是因为对于这种主打低价、大规模部署的模型来说,把最基础的能力做好才是关键。
OpenAI用一批真实ChatGPT对话做测试,这些对话都曾被用户标记出事实错误。结果GPT-6 Sol犯下的事实错误数量相比GPT-5.6 Sol减少了大约一半,已经开始接近Astra。
Luna也明显进步。在较高effort下,它的事实准确性可以达到GPT-5.6 Sol附近,而成本大约只有后者的百分之一。
当然,OpenAI自己也提醒,这批样本本来就是专门挑出来的“容易让模型犯错”的对话,并不能代表日常使用中的实际幻觉率。
模型市场只剩两种赢法
把过去48小时的模型发布连起来,会发现一件有点残酷的事:现在发一个“挺强的模型”,已经不太够看了。
模型越来越多,能让用户记住的理由却越来越少,要么把能力天花板继续往上顶,要么就在相近能力下,把价格压到别人比不了的位置。
Artificial Analysis借用了经济学里“帕累托前沿”的概念来表示竞争的两个维度,更强、或者更便宜,一个模型至少得占一样。
如果另一个模型在比你强的同时,还比你更便宜,那你的处境就麻烦了。
昨天发布的Grok 4.7,就是个很好的例子。
它其实不算弱,Artificial Analysis给Grok 4.7 xhigh打了46分,比Grok 4.6高2分;Coding Agent Index更是从47分跳到56分。xAI给它换了更大的基础模型,把训练重点放到长时间Coding和知识工作上。
但同一天,MiMo-V2.6-Pro也上线了。
同样是46分,但Artificial Analysis测得Grok 4.7 xhigh跑一项Intelligence Index任务平均要3.74美元,而MiMo-V2.6-Pro只要0.13美元。
后者还是开放权重模型,官方API每百万Token输入0.435美元、输出0.87美元。
当然,一张综合榜并不能决定模型的最终表现。Grok还有Grok Build、产品生态,以及具体Coding和Agent任务上的优势。
但事实就是,46分对46分,价格差近30倍。到这个程度,“别的优势”已经很难再作为摆在桌上的筹码了……
用户现在的选择实在太多了,贵不是问题,但你的表现最好配得上这个价格。
Anthropic今天发布的Opus 5.5,走的就是这条路。Artificial Analysis给出的最高成绩是58分,一下子把能力上限又往上推了一截。它当然不便宜,max档跑一项任务平均要5.98美元,但至少用户花这笔钱的时候,知道自己买的是目前的最强模型之一。
OpenAI则选了另外一条:GPT-6 Sol在Artificial Analysis只有48分,距离Opus 5.5还有明显差距;Luna更只有37分。但Sol一项任务平均只要1.06美元,Luna更低到0.07美元。
这个价格,它们压根不需要证明自己比Opus更聪明,只要够用就行。
短短48小时,新模型几乎自动站成了两排。
一边是Opus 5.5这种继续冲能力上限的模型;另一边是Sol、Luna和MiMo-V2.6这些不断往下砸成本的模型。
模型市场正在被两股力量同时往外拉,一边不断抬高性能,另一边不断压低价格。中间那片“还不错”的位置,只会越来越难待下去。
或者,干脆换个思路,别卷模型了,去做应用吧?
meta就是最现成的例子。Muse上线后迅速登顶美国App Store,9月21日meta股价单日大涨11.4%;路透社统计,Muse上线至今,meta股价已经累计上涨超过20%,市值增加约2000亿美元。
模型卷不到第一也没关系,做个爆款应用,华尔街照样买单。






