GPT-6 Astra:从“文字吹牛”到“真机实干” ypxx.net

当AI开始自己移动鼠标,人机协作的定义就被改写了。

9月4日凌晨,OpenAI正式发布新一代旗舰模型GPT-6 Astra。

发布前的闭门媒体简报会上,OpenAI总裁Greg Brockman说了一句话:“Welcome to the AGI era.”——欢迎来到AGI时代。

这句话如果放在一年前,大概率被当成发布会的例行修辞。但这一次,几乎整个科技圈都在认真讨论它。原因只有一个:Astra做的,不是“更会聊天”这件事。

它开始自己用电脑了。

官方宣传片里,OpenAI用一句比任何测试分数都直白的话定义它:“Anything you can do on a computer, Astra can do for you. Fast.”——你在电脑上能做的任何事,Astra都能为你做,而且很快。

这句话到底意味着什么,要从“以前的AI”和“现在的AI”之间的分界线说起。

01 以前:AI给方案,人干活

过去几年,普通人对AI的体验可以压缩成一句话:它是一个“结果输出者”。

你让它写方案,它给你一段文字;你让它写代码,它给你一堆代码;你让它规划行程,它给你一张清单。然后呢?然后轮到人接手——把文字变成PPT,把代码跑起来调通,把清单变成一次次的点击和输入。

AI负责“想”,人负责“干”。中间隔着一道真实的鸿沟:AI看不见屏幕,移不动鼠标,进不了任何一个软件。

这也是为什么很多人觉得AI“很强却用不起来”:它交出来的永远是半成品,最后一步永远要人来做。

02 现在:AI接需求,全自动干完

Astra的变化,是补上了“从想法到操作”的最后一公里。

它能看屏幕、理解界面,能移动鼠标、敲击键盘,能打开软件、填写表单、运行代码,遇到报错会自己排查重试,直到任务闭环。OpenAI给它的定位同样干脆——“世界上最好的computer use模型”。

这不是概念演示。官方场景里,Astra能根据电子原理图在KiCad里完成PCB元件布局和布线;能操作Excel和Power BI处理数据;能用Blender做3D建模;能自己做PPT、开发游戏、分析科研数据;甚至能自主安装和测试软件,盯着屏幕上的报错继续调试。

你给它一个高层目标,它自己规划步骤、调用工具、读写文件,把整件事做完。全程不需要你守在旁边。

以前:你给AI一个需求,AI给你一个方案,你再去执行。

现在:你给AI一个需求,AI把方案和执行一起做完,把成品交给你。

这就是“从文字吹牛到真机实干”——AI第一次真正进入了“执行层”。

同样是“用AI”,左边是过去的打开方式,右边是现在的打开方式。

03 它不是更会聊天,而是更会“动手”

要理解这次升级的含金量,得先看清Astra“用电脑”的方式,它大致分四步:

第一步,看。读取屏幕内容,识别按钮、输入框、菜单和报错弹窗;

第二步,想。把目标拆成步骤,判断先做什么、后做什么,哪些操作依赖前面的结果;

第三步,动。像人一样移动鼠标、点击、输入,操作浏览器和各类软件;

第四步,验。观察屏幕反馈,错了就调整,卡住就换路径,直到任务完成。

这个过程,本质上就是人类用电脑的方式:看屏幕、找按钮、点鼠标、输入内容、等反馈。OpenAI把整个桌面交互当作模型的操作环境,不再依赖软件厂商开放接口。

换句话说:以前的AI,要别人给它“开一扇门”才能干活;Astra学会了“自己开门”。

在延迟模拟测试OSWorld 2.0上,Astra的Computer Use得分72.6%,比上一代GPT-5.6 Sol快约47%,单个任务平均耗时约40分钟。“40分钟”这个数字值得注意:它意味着Astra能承担长时间、连续性的工作,而不是一个又一个碎片问答。

04 数字背后:强得离谱,也要看清口径

OpenAI公布的成绩单里,几个数字相当扎眼:

ARC-AGI-3(让AI在陌生环境里自己摸索规则、完成任务的能力):99.9%,上一代GPT-5.6 Sol为7.8%;

FrontierMath Tier 4(高阶数学):97.6%,Sol为83.0%;

ExploitBench(网络安全漏洞利用):100%。

但有一个口径问题必须说清:ARC-AGI-3的99.9%,是在OpenAI自己的Provider Adapter配置下跑出来的;换成全行业统一的Standard harness,Astra最高为62.7%。OpenAI的解释是,标准测试环境会不断打断模型的记忆,换用生产配置并保留推理过程后,分数才出现跃升。

也就是说,99.9%是“用了OpenAI优化配置”的成绩,不是所有测试方式下的成绩。它说明Astra很强,但还不能直接等同于“AGI在一切测试里接近满分”。

相比那几个漂亮的分数,另外两组数据可能更接近这次升级的本质:

一是长程记忆。在MRCR v2超长检索测试中,Astra在256K至512K上下文里准确率100%,512K到1M仍达96.3%。对一个要连续工作几十分钟的Agent来说,“能不能记住很久以前的事”比“上下文窗口有多大”更关键。

二是逆向工程。面对只有编译后二进制、没有源代码的程序,Astra一次尝试的理解成功率88%,尝试四次最高99.2%(Sol分别为55.9%和68.7%)。这意味着它开始能“读”机器指令,从编译产物里还原程序逻辑——这是恶意软件分析、漏洞挖掘等场景的直接能力基础。

这两项能力指向同一个方向:Astra不是更会“答”,而是更会“干”,而且能干得更久、更难。

05 它很能干,但也很贵、很谨慎

能力的代价,直接写进了价格。

Astra的API定价为:每百万输入token 10美元、缓存输入1美元、输出50美元,整体约为上一代GPT-5.6 Sol的2.5倍。它提供105万token上下文,单次输出上限12.8万token,知识截止2026年4月30日。

OpenAI还推出了Fast模式:价格翻倍,换取约2.5倍执行速度。对一个原本要连续跑40分钟的Agent任务来说,速度本身就是产品能力。

更值得注意的是它的开放节奏。发布当天,Astra并没有全量上线:首批只向Trusted Access体系中的机构和经过审核的网络安全用户开放;Plus、Pro、Business、Enterprise和API用户随后几天陆续接入。截至本文发布,订阅用户仍在等待开通。

为什么这么谨慎?因为Astra是OpenAI第一个跨过“关键级”网络安全能力阈值的模型。内部测试中,面对20个2026年6至8月新披露的高危漏洞,它不仅能完成利用,还自己发现了2个此前未知的zero-day漏洞,并串成一条攻击链。

更微妙的是安全测试的另一面:Astra在电脑使用测试中的违规率从上一代的22.0%降到2.4%,幻觉率从9.4%降到2.0%——它“更听话”了;但同时,它对书面推理的控制能力变强,OpenAI发现不能再只靠监控“思维链”来盯住它,于是专门上了“失对齐监控”,实时观察它的推理、动作、工具调用和任务轨迹,一旦判断模型可能偏离用户意图,就暂停甚至终止任务。

这套监控本身不便宜:仅计算开销,就大约相当于被监控推理算力的20%。

所以Astra的“贵”,一部分贵在能力,另一部分贵在“盯着它”。

06 纠偏:AGI时代,真的来了吗

这场发布会最大的争议,恰恰来自“AGI”这个词。

Brockman说“Welcome to the AGI era”,也承认如果让他个人判断,“我们已经实现了”。但被追问OpenAI是否正式宣布实现AGI时,他又承认,AGI已经变成一个“灰色的、模糊的东西”,更像一种使命概念,而不是能精确划线的技术标准。

Altman的态度更微妙:他一度不愿意认真讨论“什么时候实现AGI”,认为这个词定义模糊,甚至差点把它称作“无关紧要的营销术语”。他真正开始担心的,是下一个词:超级智能。

所以对普通人来说,更稳妥的判断是:

第一,“AGI时代”更多是一种叙事信号,而不是技术盖章。它说明AI的能力边界发生了实质变化——从输出内容,到输出结果。

第二,“能操作电脑”不等于“具备通用智能”。Astra在计算机使用、软件工程、网络安全等领域是世界顶级,但它依然受限:能力边界、开放范围、监控机制都在约束它。

第三,唯一确定的变化是分工方式。以前AI是“参谋”,现在AI开始当“执行者”。

07 以后判断这类消息,可以看四个变量

今后再看到“AI又进化了”的消息,不妨先看四件事:

能力是否闭环:它只是输出内容,还是能自己完成“获取—处理—操作—验证”的完整流程;

成本是否可持续:能力提升带来的成本,是否低到值得大规模使用;

安全是否受控:越强的模型越需要监控,安全机制是否跟得上能力;

开放是否真实:是全员可用,还是少数人先试用。

如果只有Benchmark数字,没有闭环能力、没有成本下降、没有安全边界,那它更可能停留在宣传层。

回到开头那句“Welcome to the AGI era”。

无论OpenAI是否真的定义了时代,一个不可逆的变化已经发生:AI第一次从“给你方案的人”,变成了“替你干活的人”。

接下来真正值得追问的,不是“AI会不会取代人”,而是:当AI接管了执行,人的价值会被重新分配到哪些环节——判断、决策、审美、责任?

这个问题,才是所谓“AGI落地元年”里,每个人都要面对的。