
(来源:机器学习算法那些事)
这篇论文最核心的一个判断
当模型已经足够强,记忆的组织方式决定 Agent 的上限
10 月 1 日,麻省理工学院何恺明团队的论文《VISTA: A Visual Harness for Reasoning in an Interactive World》挂上 arXiv,这几天开始在国内技术圈刷屏[1][3]。作者共五位——Qiushi Han、Keya Hu、Linlu Qiu、Cathy Wu 与何恺明,全部来自 MIT。从 ResNet、MoCo 到 MAE,何恺明的工作定义了视觉表征学习的二十年;这一次,他第一次把研究触角伸进了 Agent Harness。
先交代背景。ARC-AGI-3 是当前检验 Agent 通用推理能力最具挑战性的基准之一:25 款公开的交互式视觉游戏,不提供规则说明书,也不告诉你目标是什么。Agent 得像人第一次拿到陌生游戏机那样,靠观察、试错和反馈,自己摸出这个世界怎么运转。
在 VISTA 之前,榜单头部方法清一色是「程序合成」路线:把画面压成文本网格,让模型写代码构建可执行的世界模型。VISTA 换了一条更朴素的路——让多模态模型直接看渲染画面,把环境返回的每一帧原始无损地存下来,推理时随时回看、放大、比对。结果是:Claude Opus 5.0 满分通关全部 25 款公开游戏,总动作 7302 步,比首次上手的人类参照组少了 57.4%[1]。
这篇按论文结构做一次精读:先看基准与计分规则,再拆方法设计,然后逐级读消融实验,最后谈边界——包括论文自己承认的那三条。
01
PART
ARC-AGI-3:不给说明书的世界
ARC-AGI-3 难在哪?它与传统视觉问答的根本区别在于「无规则的游戏性」:物体代表什么、规则如何运作、目标是什么,全部未知;进入后续关卡后,Agent 还要判断此前摸到的规律还能不能用。规则不能查手册,只能从交互里长出来。
两派做法,各有一个死穴
主流解法分两派。语言派把 64×64 画面转成约 4000 个 token 的数字网格,交给大语言模型推理,再用程序合成构建可执行的世界模型——榜单上的 Schema、Tycho、Retrodict 都属此列。问题是:环境一复杂,物体的外观、空间关系与动态变化很难完整转写成文本与代码;交互历史一长,早期帧还会被挤出上下文,或被替换成文字摘要[1][4]。
视觉派让 VLM 直接看图,听上去更自然,却有一个长期被忽视的缺陷:主流 VLM 在图像进入上下文的那一刻做一次性编码,此后原始视觉输入不再保留。压缩后的表征未必存得下后续推理需要的细节;上下文逼近上限时,早期观察被删除或替换成摘要。换句话说,模型在第一次看画面的那一刻,就被迫决定了「哪些信息值得记住」——而它那时根本不知道未来会需要什么[1]。

— 图 1:三种 Agent 设计对比。(a)语言 Agent:画面先转文本;(b)多模态 Agent:图像一次性编码后不再保留;(c)VISTA:每次行动前迭代调用视觉工具回看记忆。图源:论文 Figure 1
VISTA 的全部设计都建立在这个判断上:模型在编码画面的那一刻,并不知道哪些信息会在后续推理中变得重要——任何一次性编码,都是在赌。
RHAE:满分是怎么算的
ARC-AGI-3 用 RHAE(Relative Human Action Efficiency,相对人类动作效率)计分:Agent 与首次游玩的人类玩家比动作效率。完成关卡且动作数与人类基线(首次玩家中的上半中位数)持平,得 100%;更省则按效率的平方给分,封顶 115%;更费按比例扣分;未完成的关卡直接零分。而且越靠后的关卡权重越高[1]。
这是一个相当苛刻的指标:RHAE 100.00 意味着所有关卡全部通关,且整体效率不输人类。VISTA 拿到满分的同时,总动作数只有 7302 步,人类参照组是 17135 步——不但全通关,还比人少走了 57.4% 的路[1]。
02
PART
三个组件:观察、无损记忆、主动检查
VISTA 不改模型一分参数、不做任何训练,它是在模型外面搭了一套「对交互历史的显式注意力机制」,由三个组件构成[1]。

— 图 2:VISTA 的三个组件与每轮流程。(a)视觉观察:64×64 文本网格 vs 渲染图像,每格一个数字 vs 每格一个像素;(b)无损记忆:世界返回的每一帧全分辨率可寻址;(c)视觉检查:空间放大与跨回合回放;(d)观察→推理→行动的每轮管道,外加两份笔记与视觉记忆。图源:论文 Figure 3
组件一:直接看渲染画面
模型收到的观察不是文本网格,而是 512×512 的 PNG 图像——由官方 64×64 帧做 8 倍最近邻上采样得到,每帧约消耗 308 个图像 token。这里藏着一个反直觉的细节:最近邻上采样不增加任何信息,只是把格子放大;但图像 token 的编码方式远比逐格文本便宜,单帧成本从约 4000 token 降到约 308 个,一次省下 13 倍[1]。图像保留了物体的外观与空间关系,模型可以直接调用预训练中积累的视觉先验来理解环境。
组件二:无损视觉记忆
环境返回的每一帧——包括动作触发的中间动画帧——都以原始形式保存,按「回合号 + 帧号」建立索引(例如 t67 f0–f5),在整个交互过程中始终可寻址。关键在于,这份记忆独立于模型上下文存在:上下文里的历史可以被压缩、被摘要、被丢弃,完整的视觉档案永远在外面等着[1][3]。
组件三:主动检查
这是 VISTA 的核心机制。空间维度上,模型可以请求任意帧中任意矩形区域的放大视图,还能用 read_pixels 读出选区内像素的精确 RGB 值;时间维度上,它可以一次性检索任意早先回合的多帧,比较不同状态,甚至通过中间动画帧回放一个动作引起的前后变化。是否检查、检查哪些帧、放大哪些区域,全部由模型根据当前的推理需要自主决定[1]。
顺便注意这套机制里的经济学:inspect 与 read_pixels 都不消耗游戏行动,只有 play 算一步。也就是说,「看」免费,「做」才花钱——规则本身就在鼓励模型动手之前充分回看。每一轮的完整流程是:观察 → 自由语言推理(提出假设、预测结果、修订理解)→ play 执行动作[1]。
两份笔记与一次交接
Agent 还维护两份笔记:GUIDE.md 记录对游戏机制的持久理解,跨关卡复用;WORKING.md 是当前关卡的临时草稿,过关即清空。当上下文快满时,Agent 写一份简短的交接摘要,在全新的上下文里继续运行——笔记、视觉记忆、动作历史全部保留[1]。对比之下,ARC-AGI-3 官方接口只维护一个 175K token 的窗口,超了就丢最早的回合,没有任何长期记忆[1]。熟悉 Claude Code 的读者应该已经认出来了:这就是 todo list 加 progress file 那一套——去年 11 月 Anthropic 用它解释了文本 Harness 如何跨越上下文窗口推进长任务,何恺明团队把同一套思想搬进了视觉世界[4]。
03
PART
消融阶梯:加分项藏在哪
VISTA 论文里最值得精读的不是成绩单,而是消融阶梯:从官方基线出发,每加一个组件记一次分,每一分是谁贡献的,一目了然[1]。

— 图 3:消融配置实测。(a)RHAE 得分;(b)总动作数;(c)通关比例。深蓝两行(无损记忆+检查、像素读取)贡献了最大跳变。图源:论文 Figure 5
配置(逐步叠加) | RHAE | 增量 |
|---|---|---|
官方实现(64×64 文本网格) | 13.33 | — |
① 换成图像观察 | 47.32 | +33.99 |
② 放宽动作与时间限制 | 51.66 | +4.34 |
③ 持续对话 + 原生压缩 | 65.82 | +14.16 |
④ GUIDE.md + WORKING.md 双笔记 | 70.05 | +4.23 |
| ⑤ 无损视觉记忆 + 主动检查 | 94.10 | +24.05 |
⑥ 像素级读取(完整 VISTA) | 99.00 | +4.90 |
阶梯上最大的两跳非常说明问题:把文本网格换成图像,13.33 涨到 47.32,一次加 33.99 分;加入无损视觉记忆与主动检查,70.05 跳到 94.10,一次加 24.05 分。其余每一项都只有个位数到十几分的贡献。换成图像解决的是「看得懂」——模型可以直接调用视觉先验;记忆与检查解决的才是长程交互真正的瓶颈——「回得去」[1]。
账还能算得更细。25 款游戏的总 token 消耗:文本网格 71.9M,图像观察 30.7M;一次包含七帧的检索请求,文本要约 28K token,图像只要约 2.2K。上下文长度也不是越大越好:200K 是最优点;扩到 780K,每游戏 token 涨到 105.7M,分数不涨;缩到 100K,只跌 0.4 分,token 直接减半[1]。
长程交互的瓶颈,从来不是「看不看得见」,而是「回不回得去」
04
PART
成绩单与边界
主战场的成绩单如下。注意 VISTA 全程没有使用程序合成,却与使用程序合成的 Tycho 在同一模型上同分——论文的说法是:据其所知,VISTA 是首个不依赖程序合成、纯靠视觉输入就在 ARC-AGI-3 上达到满分或近满分表现的系统[1]。
系统 | 程序合成 | 后端模型 | RHAE |
|---|---|---|---|
官方实现 | 无 | GPT-5.6 Sol | 13.33 |
官方实现 | 无 | Opus 5.0 | 40.68 |
Schema | 有 | GPT-5.6 Sol | 95.35 |
Schema | 有 | Opus 4.8 / Fable 5 | 98.98 |
Retrodict | 有 | GPT-5.6 Sol | 99.86 |
Tycho | 有 | GPT-5.6 Sol / Opus 5.0 | 100.00 |
| VISTA(本文) | 无 | GPT-5.6 Sol | 99.00 |
| VISTA(本文) | 无 | Opus 5.0 | 100.00 |
换模型、换渲染、换基准

— 图 4:三个附加基准的环境与结果。GameWorld 成功率 63.3%、进度 79.3%,AI GameStore 几何均分 140.3(人类=100),BabyVision 准确率 63.2%(官方实现 41.0%),均超过新手人类或此前最佳。图源:论文 Figure 11
VISTA 的增益依赖基模吗?答案是肯定的。换成开源模型 GLM-5.3 Flash 320B,官方基线只有 1.89,VISTA 拉到 66.93——放大效果惊人;但把 inspect 与 read_pixels 拿掉,立刻跌回 13.27[3]。Harness 是乘数,不是加数:基模太弱,乘出来也有限。把同样的游戏渲染成 3D 画面,难度显著上升,VISTA 仍拿到 84.12,只是动作数从 9126 涨到 20640[1][3]。
泛化性上,同一套 Harness 以极小改动迁移到三个新基准:GameWorld 的 34 款浏览器游戏、170 个任务,成功率 63.3%、任务进度 79.3%,均超过首次上手的人类玩家;AI GameStore 的 10 款游戏,按人类中位数归一化后的几何均分 140.3(人类等于 100);静态的 BabyVision 39 道题,准确率从 41.0% 提升到 63.2%[1][3]。
论文自己承认的三条边界
1
模型能力仍是成功的关键:VISTA 提供的是一种「简单但有效的引出方式」,它与模型改进互补,而非替代;
2
所用模型的发布时间晚于基准公开,无法排除这些游戏已进入训练数据;
3
私有集检验缺位:ARC-AGI-3 还有未公开的私有游戏,唯有在私有集上复现,泛化检验才算完整[1]。
换句话说,「公开集满分」与「通用视觉 Harness」之间,还隔着一场私有集考试。在刷榜成风的当下,把这三条边界白纸黑字写进论文,是少见的诚实,也是这项工作可信度的来源。
///
LAST
写在最后
从 ResNet 到 MoCo 到 MAE,何恺明的研究有一条不变的主线:表征——如何让模型「看见」世界的结构。VISTA 有趣的地方在于,这一次的答案不在模型里,而在模型外面:不改网络、不做训练,仅靠重新组织观察与记忆,就把多模态模型的长程推理能力整体拔高一截。
放在更大的图景里看,这波 Agent 能力爆发,文本 Harness 功不可没——任务清单、进度文件、交接摘要,让模型得以跨越上下文窗口持续推进长任务。VISTA 证明了同一套思想在视觉世界同样成立,而且给出了一个更极致的形态:不是更聪明的摘要,而是无损的原始帧加按需回看。「看什么、存什么、何时回看」,正在成为与模型能力并列的设计变量[1][4]。
给做 Agent 的读者三个带走的东西:其一,长程任务的瓶颈常在记忆的组织方式,而不在模型的智力;其二,「无损原始数据 + 按需回看」往往比「更好的压缩」更便宜、也更可靠;其三,Harness 是乘数不是加数,评估 Harness 之前先看清基模。论文、项目页与开源材料见文末参考来源[1][2]。
参考来源
[1] Han Q., Hu K., Qiu L., Wu C., He K.《VISTA: A Visual Harness for Reasoning in an Interactive World》,arXiv:2610.02200,2026-10-01
[2] VISTA 项目页与早期博文(2026-08-05):vista-research.github.io
[3] 智源社区转载学术头条《何恺明团队新作:视觉 Harness VISTA,让 Claude 满分通关 25 款 ARC-AGI-3 公开游戏》,2026-10-10
[4] 36氪《何恺明团队发布多模态 Harness 框架:给 Claude 装上视觉 Harness,拿下 ARC-AGI-3 公开集满分》,2026-10
[5] 搜狐·智猩猩《何恺明首次探索 Agent Harness:25 款游戏通关,动作效率满分》,2026-10












