Anthropic 又泄露: Sonnet 5.5价格只有 Fable 5.1的五分之一?(anthropic指责三家) ypxx.net

Anthropic 在九月二十二日把 Opus 5.5 放出来的时候,官方文档里留了一句备注,说 Sonnet 5.5 和 Haiku 5.5 会在未来几周内跟上,多数人扫过去没当回事。不到一周,有人在前端 artifact 的配置文件里翻出一个标识符,叫 claude-sonnet-5-5,跟它并排的还有 claude-opus-5-5、claude-sonnet-5 和一个 claude-fable-5.1,写进前端的标识符一般说明权重已经躺在服务器上,就差把开关拨开。

更早的信号是有人发现,一周前 Sonnet 5 的请求就已经转到 5.5 上做暗测,验证的手法挺土,关掉联网和记忆,直接问它认不认识一个只在圈子里流传的梗。

价格是最先炸开的东西,输入两美元、输出十美元、缓存读取两毛,都按每百万 token 算,拿 Anthropic 自家旗舰 Fable 5.1 的十美元和五十美元对一下,中间差五倍。它踩进去的那个价位,原本是 OpenAI 特意留给 GPT-6 Sol 和 Luna 的地盘,那两款就是为了抢高频场景才把价压下来的;拿同一道题的分数横向比,单位成本这两年一直在往下走,这一轮只是把速度提快了。

有人拿同一组三个提示词,让六个模型各跑一遍,结果不做任何修剪。跑完的落差很大,Sonnet 5.5 交了三个文件,合计 90 到 131KB,六次全都顶到九十分钟的时间上限;GPT-6 Sol 那三次只有 20 到 29KB,九到十二分钟就收工。九十分钟是这类并行测试给死的上限,撞上去说明它还在继续改,而不是跑不动。更直观的一组对比是让四款模型写同一段前端 UI 动效,不许用设计稿,纯代码生成,出来的观感被评价为比 Sol 和 Astra 都好,评价里反复出现"代码直觉"和"审美"。

"逼平 Astra"这半句需要拆开看,综合多个爆料人的早期结论,Astra 在打磨度上还没被追上,Sonnet 5.5 逼近的是高级编码和 Agent 这类任务,并非全面反超。这个区分有意义,被压得最狠的是中间那一档,最顶上一格目前没动。

谷歌那边同一周被从竞技场里认出了两个还没公布的检查点,代号 barium-b,也叫 Checkpoint 2。流传的参数是 1000 万 token 上下文、256k 输出上限,标价 2.25 美元输入、11.25 美元输出。跑分上,编程类的智能体测试 DeepSWE v1.1 打了 88 分,编码测试 Terminal-bench 2.1 到 95.3 分,两项都排在 GPT-6 Astra 和 Fable 5.1 前面。

演示部分也不含糊,有人要它用 Three.js 现搭一个空间站,让它在页面里绕着地球转,十六分钟到手,连地球贴图都自己去网上抓,图的是经纬度和颜色对得上;另一组测试要一段浮筒飞机水面滑行的物理过程,它给出的流体反馈和水面质感被认为比 Opus 5.5 那版干净,机身也不会晃得像随时散架。同类测试里还有几组更快的数据,一个完整的产品展示站从前到后 14 分钟生成完;任天堂 Wii 遥控器的三维还原被夸细节准、速度快;机械蜂鸟那组被认为与 Fable 旗鼓相当、明显好过 GPT-6 Sol,只是换成 Astra 时它也会落在下风。挑刺的人也有一堆,界面不够好看、背面透视有错,这些都在公开对比里。

支撑这个速度的东西比模型本身更该看。Anthropic 内部流出的量化口径是,有 26% 的核心研发活已经交给前代 Claude 牵头,自产代码里超过八成由模型自己写,公司自己估到 2027 年会走到完全自动化那一步。谷歌这边是 DeepMind 新任掌门 Koray Kavukcuoglu 第一次公开交底,Gemini 4 七月启动预训练、两个月收尾,眼下全面进后训练,目标远早于年底发布;发现上一代 3.5 Pro 压不住对手之后,算力被全部转到 4 上,内部编码工具已经在用。

把这几条消息叠到个人开发者身上,结论只有一句,最贵那一档不再稀缺。一年前判断一个活能不能接,先看手里有没有贵模型的额度;现在同一批活里,便宜档位在多数场景已经够用,值钱的是判断哪类任务该放哪一档。缓存读到两毛这个价格也有实际用处,长对话里每轮都要重发的系统提示、工具定义、几十页的产品手册,成本压到这个价位之后几乎可以不算,给私人助理做长期记忆第一次变得便宜。换算到日子上也很直白,同一笔预算能跑的活比去年多出好几倍。

反向的风险也在这里,价格战一旦打到这个程度,供应商更想你把量用上去。微软那边的付费席位已经过三千万,计费也从纯席位改成"席位加用量";便宜档一放开,量会自己长起来。能真正按住账单的还是老两样,固定内容放前面吃缓存,批量活排到闲时或者批处理队列。

有个细节值得记一下,便宜的是 token,不便宜的是机器。模型调用这本账越来越薄,机器时租那本账还在往上走,两本得分开算。真要把 AI 用到日常里,找一个按小时起租、用多少算多少、余额见底能自动停的算力入口,比在选型上抠那几分钱的差价重要。