何恺明团队新论文:不改模型、不做训练,Agent 满分通关 25 款游戏(何恺明论文) ypxx.net

(来源:机器学习算法那些事)

这篇论文最核心的一个判断

当模型已经足够强,记忆的组织方式决定 Agent 的上限

10 月 1 日,麻省理工学院何恺明团队的论文《VISTA: A Visual Harness for Reasoning in an Interactive World》挂上 arXiv,这几天开始在国内技术圈刷屏[1][3]。作者共五位——Qiushi Han、Keya Hu、Linlu Qiu、Cathy Wu 与何恺明,全部来自 MIT。从 ResNet、MoCo 到 MAE,何恺明的工作定义了视觉表征学习的二十年;这一次,他第一次把研究触角伸进了 Agent Harness。

先交代背景。ARC-AGI-3 是当前检验 Agent 通用推理能力最具挑战性的基准之一:25 款公开的交互式视觉游戏,不提供规则说明书,也不告诉你目标是什么。Agent 得像人第一次拿到陌生游戏机那样,靠观察、试错和反馈,自己摸出这个世界怎么运转。

在 VISTA 之前,榜单头部方法清一色是「程序合成」路线:把画面压成文本网格,让模型写代码构建可执行的世界模型。VISTA 换了一条更朴素的路——让多模态模型直接看渲染画面,把环境返回的每一帧原始无损地存下来,推理时随时回看、放大、比对。结果是:Claude Opus 5.0 满分通关全部 25 款公开游戏,总动作 7302 步,比首次上手的人类参照组少了 57.4%[1]。

这篇按论文结构做一次精读:先看基准与计分规则,再拆方法设计,然后逐级读消融实验,最后谈边界——包括论文自己承认的那三条。

01

PART

ARC-AGI-3:不给说明书的世界

ARC-AGI-3 难在哪?它与传统视觉问答的根本区别在于「无规则的游戏性」:物体代表什么、规则如何运作、目标是什么,全部未知;进入后续关卡后,Agent 还要判断此前摸到的规律还能不能用。规则不能查手册,只能从交互里长出来。

两派做法,各有一个死穴

主流解法分两派。语言派把 64×64 画面转成约 4000 个 token 的数字网格,交给大语言模型推理,再用程序合成构建可执行的世界模型——榜单上的 Schema、Tycho、Retrodict 都属此列。问题是:环境一复杂,物体的外观、空间关系与动态变化很难完整转写成文本与代码;交互历史一长,早期帧还会被挤出上下文,或被替换成文字摘要[1][4]。

视觉派让 VLM 直接看图,听上去更自然,却有一个长期被忽视的缺陷:主流 VLM 在图像进入上下文的那一刻做一次性编码,此后原始视觉输入不再保留。压缩后的表征未必存得下后续推理需要的细节;上下文逼近上限时,早期观察被删除或替换成摘要。换句话说,模型在第一次看画面的那一刻,就被迫决定了「哪些信息值得记住」——而它那时根本不知道未来会需要什么[1]。

— 图 1:三种 Agent 设计对比。(a)语言 Agent:画面先转文本;(b)多模态 Agent:图像一次性编码后不再保留;(c)VISTA:每次行动前迭代调用视觉工具回看记忆。图源:论文 Figure 1

VISTA 的全部设计都建立在这个判断上:模型在编码画面的那一刻,并不知道哪些信息会在后续推理中变得重要——任何一次性编码,都是在赌。

RHAE:满分是怎么算的

ARC-AGI-3 用 RHAE(Relative Human Action Efficiency,相对人类动作效率)计分:Agent 与首次游玩的人类玩家比动作效率。完成关卡且动作数与人类基线(首次玩家中的上半中位数)持平,得 100%;更省则按效率的平方给分,封顶 115%;更费按比例扣分;未完成的关卡直接零分。而且越靠后的关卡权重越高[1]。

这是一个相当苛刻的指标:RHAE 100.00 意味着所有关卡全部通关,且整体效率不输人类。VISTA 拿到满分的同时,总动作数只有 7302 步,人类参照组是 17135 步——不但全通关,还比人少走了 57.4% 的路[1]。

02

PART

三个组件:观察、无损记忆、主动检查

VISTA 不改模型一分参数、不做任何训练,它是在模型外面搭了一套「对交互历史的显式注意力机制」,由三个组件构成[1]。

— 图 2:VISTA 的三个组件与每轮流程。(a)视觉观察:64×64 文本网格 vs 渲染图像,每格一个数字 vs 每格一个像素;(b)无损记忆:世界返回的每一帧全分辨率可寻址;(c)视觉检查:空间放大与跨回合回放;(d)观察→推理→行动的每轮管道,外加两份笔记与视觉记忆。图源:论文 Figure 3

组件一:直接看渲染画面

模型收到的观察不是文本网格,而是 512×512 的 PNG 图像——由官方 64×64 帧做 8 倍最近邻上采样得到,每帧约消耗 308 个图像 token。这里藏着一个反直觉的细节:最近邻上采样不增加任何信息,只是把格子放大;但图像 token 的编码方式远比逐格文本便宜,单帧成本从约 4000 token 降到约 308 个,一次省下 13 倍[1]。图像保留了物体的外观与空间关系,模型可以直接调用预训练中积累的视觉先验来理解环境。

组件二:无损视觉记忆

环境返回的每一帧——包括动作触发的中间动画帧——都以原始形式保存,按「回合号 + 帧号」建立索引(例如 t67 f0–f5),在整个交互过程中始终可寻址。关键在于,这份记忆独立于模型上下文存在:上下文里的历史可以被压缩、被摘要、被丢弃,完整的视觉档案永远在外面等着[1][3]。

组件三:主动检查

这是 VISTA 的核心机制。空间维度上,模型可以请求任意帧中任意矩形区域的放大视图,还能用 read_pixels 读出选区内像素的精确 RGB 值;时间维度上,它可以一次性检索任意早先回合的多帧,比较不同状态,甚至通过中间动画帧回放一个动作引起的前后变化。是否检查、检查哪些帧、放大哪些区域,全部由模型根据当前的推理需要自主决定[1]。

顺便注意这套机制里的经济学:inspect 与 read_pixels 都不消耗游戏行动,只有 play 算一步。也就是说,「看」免费,「做」才花钱——规则本身就在鼓励模型动手之前充分回看。每一轮的完整流程是:观察 → 自由语言推理(提出假设、预测结果、修订理解)→ play 执行动作[1]。

两份笔记与一次交接

Agent 还维护两份笔记:GUIDE.md 记录对游戏机制的持久理解,跨关卡复用;WORKING.md 是当前关卡的临时草稿,过关即清空。当上下文快满时,Agent 写一份简短的交接摘要,在全新的上下文里继续运行——笔记、视觉记忆、动作历史全部保留[1]。对比之下,ARC-AGI-3 官方接口只维护一个 175K token 的窗口,超了就丢最早的回合,没有任何长期记忆[1]。熟悉 Claude Code 的读者应该已经认出来了:这就是 todo list 加 progress file 那一套——去年 11 月 Anthropic 用它解释了文本 Harness 如何跨越上下文窗口推进长任务,何恺明团队把同一套思想搬进了视觉世界[4]。

03

PART

消融阶梯:加分项藏在哪

VISTA 论文里最值得精读的不是成绩单,而是消融阶梯:从官方基线出发,每加一个组件记一次分,每一分是谁贡献的,一目了然[1]。

— 图 3:消融配置实测。(a)RHAE 得分;(b)总动作数;(c)通关比例。深蓝两行(无损记忆+检查、像素读取)贡献了最大跳变。图源:论文 Figure 5

配置(逐步叠加)

RHAE

增量

官方实现(64×64 文本网格)

13.33

—

① 换成图像观察

47.32

+33.99

② 放宽动作与时间限制

51.66

+4.34

③ 持续对话 + 原生压缩

65.82

+14.16

④ GUIDE.md + WORKING.md 双笔记

70.05

+4.23

⑤ 无损视觉记忆 + 主动检查 94.10 +24.05

⑥ 像素级读取(完整 VISTA)

99.00

+4.90

阶梯上最大的两跳非常说明问题:把文本网格换成图像,13.33 涨到 47.32,一次加 33.99 分;加入无损视觉记忆与主动检查,70.05 跳到 94.10,一次加 24.05 分。其余每一项都只有个位数到十几分的贡献。换成图像解决的是「看得懂」——模型可以直接调用视觉先验;记忆与检查解决的才是长程交互真正的瓶颈——「回得去」[1]。

账还能算得更细。25 款游戏的总 token 消耗:文本网格 71.9M,图像观察 30.7M;一次包含七帧的检索请求,文本要约 28K token,图像只要约 2.2K。上下文长度也不是越大越好:200K 是最优点;扩到 780K,每游戏 token 涨到 105.7M,分数不涨;缩到 100K,只跌 0.4 分,token 直接减半[1]。

长程交互的瓶颈,从来不是「看不看得见」,而是「回不回得去」

04

PART

成绩单与边界

主战场的成绩单如下。注意 VISTA 全程没有使用程序合成,却与使用程序合成的 Tycho 在同一模型上同分——论文的说法是:据其所知,VISTA 是首个不依赖程序合成、纯靠视觉输入就在 ARC-AGI-3 上达到满分或近满分表现的系统[1]。

系统

程序合成

后端模型

RHAE

官方实现

无

GPT-5.6 Sol

13.33

官方实现

无

Opus 5.0

40.68

Schema

有

GPT-5.6 Sol

95.35

Schema

有

Opus 4.8 / Fable 5

98.98

Retrodict

有

GPT-5.6 Sol

99.86

Tycho

有

GPT-5.6 Sol / Opus 5.0

100.00

VISTA(本文)

无

GPT-5.6 Sol

99.00

VISTA(本文)

无

Opus 5.0

100.00

换模型、换渲染、换基准

— 图 4:三个附加基准的环境与结果。GameWorld 成功率 63.3%、进度 79.3%,AI GameStore 几何均分 140.3(人类=100),BabyVision 准确率 63.2%(官方实现 41.0%),均超过新手人类或此前最佳。图源:论文 Figure 11

VISTA 的增益依赖基模吗?答案是肯定的。换成开源模型 GLM-5.3 Flash 320B,官方基线只有 1.89,VISTA 拉到 66.93——放大效果惊人;但把 inspect 与 read_pixels 拿掉,立刻跌回 13.27[3]。Harness 是乘数,不是加数:基模太弱,乘出来也有限。把同样的游戏渲染成 3D 画面,难度显著上升,VISTA 仍拿到 84.12,只是动作数从 9126 涨到 20640[1][3]。

泛化性上,同一套 Harness 以极小改动迁移到三个新基准:GameWorld 的 34 款浏览器游戏、170 个任务,成功率 63.3%、任务进度 79.3%,均超过首次上手的人类玩家;AI GameStore 的 10 款游戏,按人类中位数归一化后的几何均分 140.3(人类等于 100);静态的 BabyVision 39 道题,准确率从 41.0% 提升到 63.2%[1][3]。

论文自己承认的三条边界

1

模型能力仍是成功的关键:VISTA 提供的是一种「简单但有效的引出方式」,它与模型改进互补,而非替代;

2

所用模型的发布时间晚于基准公开,无法排除这些游戏已进入训练数据;

3

私有集检验缺位:ARC-AGI-3 还有未公开的私有游戏,唯有在私有集上复现,泛化检验才算完整[1]。

换句话说,「公开集满分」与「通用视觉 Harness」之间,还隔着一场私有集考试。在刷榜成风的当下,把这三条边界白纸黑字写进论文,是少见的诚实,也是这项工作可信度的来源。

///

LAST

写在最后

从 ResNet 到 MoCo 到 MAE,何恺明的研究有一条不变的主线:表征——如何让模型「看见」世界的结构。VISTA 有趣的地方在于,这一次的答案不在模型里,而在模型外面:不改网络、不做训练,仅靠重新组织观察与记忆,就把多模态模型的长程推理能力整体拔高一截。

放在更大的图景里看,这波 Agent 能力爆发,文本 Harness 功不可没——任务清单、进度文件、交接摘要,让模型得以跨越上下文窗口持续推进长任务。VISTA 证明了同一套思想在视觉世界同样成立,而且给出了一个更极致的形态:不是更聪明的摘要,而是无损的原始帧加按需回看。「看什么、存什么、何时回看」,正在成为与模型能力并列的设计变量[1][4]。

给做 Agent 的读者三个带走的东西:其一,长程任务的瓶颈常在记忆的组织方式,而不在模型的智力;其二,「无损原始数据 + 按需回看」往往比「更好的压缩」更便宜、也更可靠;其三,Harness 是乘数不是加数,评估 Harness 之前先看清基模。论文、项目页与开源材料见文末参考来源[1][2]。

参考来源

[1] Han Q., Hu K., Qiu L., Wu C., He K.《VISTA: A Visual Harness for Reasoning in an Interactive World》,arXiv:2610.02200,2026-10-01

[2] VISTA 项目页与早期博文(2026-08-05):vista-research.github.io

[3] 智源社区转载学术头条《何恺明团队新作:视觉 Harness VISTA,让 Claude 满分通关 25 款 ARC-AGI-3 公开游戏》,2026-10-10

[4] 36氪《何恺明团队发布多模态 Harness 框架:给 Claude 装上视觉 Harness,拿下 ARC-AGI-3 公开集满分》,2026-10

[5] 搜狐·智猩猩《何恺明首次探索 Agent Harness:25 款游戏通关,动作效率满分》,2026-10