GPT-6 Sol 抢了 Claude Opus 5 的榜首,OpenAI 等了两年半才反超(gpt sol terra) ypxx.net

OpenRouter 上周的数据把开发者群炸了:9 月 7 日那一周,用户在 OpenAI 模型上的调用消耗第一次超过 Anthropic。上一次出现这个位置关系,还是 2024 年 2 月,中间隔了三十个月。Greg Brockman 自己转了那条数据,配文说 Astra 和 Luna 正在起飞。

构成这次反超的是四款模型。GPT-6 Astra 上线才两周,一口气拿下 OpenAI 与 Anthropic 合计消耗的 19%,压过 Claude Opus 5 的 16%,坐上单周榜首。GPT-5.6 Luna 走另一条路,扛的 token 量最大。GPT-5.6 Sol 和 Terra 各占一成。一条从旗舰到走量的产品线,把对能力敏感和对成本敏感的两拨人一起兜住了。

更热闹的是还没官宣的那两个。有人在 OpenRouter 上请求 GPT-5.6 Sol,返回的模型 ID 变成了 GPT-6 Sol;也有 Plus 用户发现自己被灰度命中。早测者的评价很一致:速度离谱。一个 SVG 生成任务,Astra 大约要 19 分钟,Sol 三分钟出头。有人摸出了判断自己有没有"天选"的办法:关掉联网问它最新的 Opus 是哪个版本,答 4.7 的就说明知识截止被刷新过。

Anthropic 那头的动作是对称的。Opus 5.2 跳过了 5.1 直接进入灰度,目前只在 Claude Code 环境里能用。重度的 Claude Code 用户反馈说,它会自己复查已经做完的活再优化一轮,遇到信息不全也不来回追问,一口气推完八个复杂任务;有次多智能体测试里,一个疑似 5.2 的子代理直接质疑另一个模型的任务分配,要求重新切分。视觉测试里,二维线稿能被扩成带多轮细化的三维场景。

节奏才是这件事真正的重点。OpenAI 已经公告,GPT-5.5 会在 10 月 14 日从 ChatGPT、ChatGPT Work 和 Codex 全线退场。产品负责人说本周的发布密度达到 DevDay 级别,Altman 预告了"本周大事件,然后是开发者日",DevDay 定在 9 月 29 日。一年之内从 5.5 到 Sol 再到 Astra,模型换代从年更变成了季更,甚至月更。

企业侧的位置也在动。八月的统计里,付费买 AI 服务的美国企业中 Anthropic 占 43.8%、OpenAI 占 39.8%,两家几乎是贴身状态;同一份数据里,前沿模型吃掉的 token 份额从八月初的 53% 滑到九月初的 45%,头部企业正在成批地把任务往下一档模型换。选型这件事,已经从"挑一个最强的"变成"哪一段活该配哪一档"。

对企业用户,这不再是看热闹。选型周期被压缩是第一道坎:你刚把某个模型接进业务流程,刚调完提示词,刚跑完一轮内部验收,它就排进了退役名单。绑死一家的代价也在升高——接口换了、行为变了、评测要重跑,这些工作量不会因为供应商一句"新版更强"就消失。两条叠在一起,多模型路由就从架构洁癖变成了生存必需:把任务按难度分层,通用难题走旗舰,长尾高频走更轻的或者自己部署的,中间用一层网关兜住。

灰度还有个容易被忽略的副作用:同一个账号今天和昨天跑出来的,可能压根不是一个模型。做回归对照的时候这一点不锁死,评测数据就没有意义——Sol 和 5.2 目前都还是未证实状态的泄露,能确认的只有体验者的自述。能做的稳妥动作,是把每次调用的模型标识、版本、返回头全部记下来,作为后面分析时的分组字段。

而路由的前提是你得有能跑的评测。榜单是别人的,你的场景只有你自己知道。每换一个候选模型,就得拿自己的数据、自己的任务集重跑一遍,这不是一次性的活,是常态。跑评测这件事最后都落到机器上:批量推理要卡,回归对比要卡,灰度期间的 A/B 也要卡。

我现在把这部分放在按小时开机器、跑完就关的模式上, PyTorch、vLLM 这些是预置好的,不用每次新开实例都重搭一遍环境;评测集和中间产物都压在 IO 上,全闪存存储对这种反复读写最有帮助;新模型半夜灰度、第二天早上要出结论的时候,有真人能接电话比什么都强。