
9月21号SpaceXAI把Grok 4.7摆出来的时候,官方话术挑不出毛病:价格不变、速度不变,本事涨了一截。老马更直接,在社交平台上放话说这一代把SpaceXAI顶到了智能体编程的老三位置,前头只站着Anthropic和OpenAI。

价格确实没动。输入每百万token两美元,输出六美元,跟上一代4.6一模一样。对天天泡在终端里跟代码死磕的独立开发者来说,这数字有点勾人——隔壁旗舰动辄十刀进五十刀出,Grok看着便宜得不像话。
可问题恰恰出在"便宜"这两个字上。便宜的是单价,账单可不一定便宜。
有评测机构拿同一批任务去测,Grok 4.7在最高档跑完一趟,得往外吐八万一千多个输出token,上一代4.6同样档位只要三万六,直接翻了一倍多。把消耗量折进去,一道题下来Grok 4.7实际要花三块七毛四,反倒不如GPT-5.6 Sol的一块九毛九——后者单价明明更贵。
说白了,这家伙是个话痨。单价看着砍了五倍,废话却多了三倍,账面那点优势被生生抹掉一半。Cursor社区里已经有人绷不住了,说这哪是什么性价比怪物,token消耗都快赶上4.6的两倍,4.5时代那种极致的廉价感算是回不去了。
那老马嘴里的"全球第三"又是怎么来的?这里头的猫腻值得扒一扒。Grok 4.7在综合智能指数上只拿了46分,比4.6多了两分,而第一梯队的Fable 5.1和GPT-6 Astra都是53。按单个模型排,它排到第十六。真正让它"吹上天"的,是套上GrokBuild框架之后的56分——这个分确实挤进了前三,可那是把Anthropic的两个模型并成一家才腾出来的名次。
换到统一基准Terminal-Bench 4.0,Grok 4.7的通过率当场从云端摔回地面,只剩26%到27%,对手GPT-6 Astra是60%,Fable 5.1是55%。评测机构ValsAI那边更狠,直接给Grok 4.7排到第24名,比上一代还倒挂了5分,等于不升反降。
原因藏得也不深。官方公告的附注里点了一句:Grok 4.7在预训练阶段深度对齐了GrokBot框架的交互模式。翻译一下,就是它照着自家工具的调用逻辑和拆任务的套路练出来的,一旦离开那套脚手架,真本事就漏了馅。有开发者拿两个真实代码库、埋了105个bug测了三轮,GPT-6 Astra修好45个,Grok 4.7搞定28.7个——跟上一代一模一样,等于原地踏步。
不过也不能一棒子打死。除了编程,这一代在"把活儿干完"这件更接地气的事上进步其实是实打实的。官方把办公场景单拎出来讲,在长流程知识工作测试里Grok 4.7拿了1657 Elo,比上一代的高档多了111分。这类任务看重的是AI能不能帮专业人士把材料整理好、把文档做出来、把分析和演示文稿交出来,Grok 4.7确实比上一代顺手了一截。电气工程那道题它拿下64%,在列出来的四款模型里排第一。对那种不追求极限、就想让AI帮着把杂活干利索的人,它其实挺合适。
论纯速度它确实够狠,实测每秒能飙出188个token,开了fast模式直接翻倍——不过fast的价钱也跟着翻倍,输入四美元输出十二美元,这又是另一笔要掂量的账。上下文窗口也大方了一截,Cursor悄悄把Grok 4.7顶到了500K,上一代才256K,喂进去更长的代码库也不会那么快掉链子。还有个开发者啥具体要求都没给,就丢下一句"十分钟内你看着办",结果它自己钻进Blender里搭了个黄铜浑天仪,上头的小行星居然还能转,引来全网二十五万人围观。

真正值得咂摸的,是这场发布底下埋的那层意思。Grok 4.7的高分一大半是靠框架量身定制硬撑起来的。Anthropic用Claude Code卡住长程任务,OpenAI用Codex占住生态,现在xAI也学着用私有框架把开发者圈进来。单个模型单打独斗的时代正在翻篇,往后拼的是"模型加框架"这一整套东西。
xAI这步棋其实挺清醒。它没打算去跟OpenAI、Anthropic抢那个"最强通用模型"的王座,只认准了自己的位置:卡在最便宜最快这块性价比高地上,把"够用又不贵"这件事做到极致。对预算有限的个人开发者来说,这种策略反而比追顶配更实在——大多数人要的只是一个46分但随手能用、跑得动、不烧钱的工具,压根用不上那个53分的极限。问题只在于,你得先搞清楚自己买到的"便宜"到底是真便宜,还是被"话痨"偷偷加了价。
对自己掏钱跑模型的开发者来说,这份热闹背后真正要留神的是最朴素的那笔账。模型贵不贵从来不看单价,看的是你为同一件事到底烧了多少token、最后花了多少钱。尤其是要长期跑、要喂大文件的场景,光盯着输入输出单价的数字好看没用。真到了要批量调用、要稳定出活的阶段,找个能按量计费、花多少算多少的地方,比追着谁又发了新模型实在得多。















