
一、论文速览论文标题VISTA: A Visual Harness for Reasoning in an Interactive World作者Qiushi Han, Keya Hu, Linlu Qiu, Cathy Wu, Kaiming He麻省理工学院发表时间2026年10月1日arXiv:2610.02200代码https://github.com/joshhhhhan/VISTA这篇论文的核心论点是当前多模态大模型在交互式视觉任务中表现不佳根源不在于推理能力不足而在于“看不见”和“记不住”。作者将ARC-AGI-3一个交互式像素游戏基准从传统的语言/符号表示范式重新构建为视觉问题提出VISTA——一个不修改模型本身、仅改变模型“如何获取视觉信息”的轻量级视觉外挂框架。核心成果在ARC-AGI-3上VISTA将Claude Opus 5.0的相对人类动作效率从官方框架下的40.68提升至满分100.00完成全部25个公开游戏且比首次游玩的人类玩家少用57.4%的动作。二、问题诊断为什么大模型在视觉游戏中“失明”ARC-AGI-3要求智能体在没有任何规则说明的交互式像素游戏中通过试错发现规则和目标。官方基准为模型提供的是一张64×64的数字网格——人类看到的角色、机关和路径到模型那里变成了4096个整数。这相当于让人闭着眼睛听坐标去玩《超级马里奥》。论文识别出两个核心瓶颈瓶颈一感知通道错位。将图像转为文本网格不仅信息损失严重而且Token开销巨大。一个64×64的数字网格约消耗4000个Token而一张同等信息的512×512图像仅需约308个Token。瓶颈二长程视觉记忆缺失。现有VLM通常将每张图像编码一次为视觉表示这些表示可能在推理过程中被压缩或丢失。当上下文窗口填满时早期观察要么被删除要么被压缩为文本摘要——而文本摘要会丢失微妙的空间关系和颜色变化导致多步推理失败。三、核心技术拆解VISTA的设计哲学是**“工具介导的再注意力”** 在观察时刻编码什么与在推理时刻需要什么这两者应当解耦。为此它提供了三层递进式的技术组件。3.1 无损视觉记忆把每一帧都存成原图VISTA维护一个无损视觉记忆将环境返回的每一帧——包括中间动画帧——以原始分辨率存档按回合/帧索引。这与传统的“文本摘要压缩”形成根本性对立文本摘要路线模型在每一步将观察压缩为简短文字描述后续推理只依赖这些摘要。代价是空间布局、颜色渐变、微小的视觉变化等细节永久丢失。VISTA路线模型始终拥有完整的视觉历史可以在需要时回看任意一帧的原始细节。翻看记忆不消耗游戏动作步数只有真实的游戏操作才计步。这一设计的关键洞察是模型不需要在编码时刻就决定什么信息重要。传统架构强迫模型在单次前向传播中判断“哪些视觉特征值得保留”而VISTA将这一判断推迟到推理时刻由模型根据当前推理需求主动检索。3.2 模型自主的视觉检查让模型自己决定“看哪里”仅有存储还不够模型需要有效利用记忆的工具。VISTA提供了三个检查工具inspect从记忆库中检索任意历史帧支持跨帧对比和区域放大。模型可以指定想看哪一回合、哪一帧、画面的哪个区域。read_pixels对选定像素区域返回精确的RGB数值。这弥补了视觉编码器在颜色细微差异上的感知局限——在ARC-AGI-3这类游戏中颜色往往是规则的关键线索。history回顾之前的动作及其环境反馈。这些工具是只读的、可选的。游戏推进一步只能通过play工具而检查工具不消耗动作预算。3.3 辅助记忆结构化的持久笔记VISTA还引入了两个持久化笔记文件作为视觉记忆的语义补充GUIDE.md存储对游戏规则的可复用理解是可修正的“知识库”。WORKING.md当前关卡状态的草稿纸用于暂存推理中间结果。当上下文窗口填满时智能体可以在全新上下文中恢复而笔记、视觉记忆和动作历史仍然完整可用。这一机制与视觉记忆形成互补视觉记忆提供“原始证据”结构化笔记提供“提炼后的理解”。3.4 推理与行动的耦合循环VISTA的整体工作流是一个紧凑的感知-推理-行动循环观察接收当前帧的渲染图像默认512×512和可用动作列表。推理用自然语言描述所见预测动作的预期效果。检查可选如果推理中需要核对历史细节调用inspect或read_pixels回看。行动通过play执行一个游戏动作。记录更新GUIDE.md和WORKING.md中的理解。值得注意的是模型在每次play之前被要求“简要陈述预期会看到什么”之后被要求“简要陈述所有可见变化无论是否符合预期”。这种预期-验证的循环迫使模型持续修正其世界模型。四、实验验证消融实验揭示的性能阶梯论文最有力的证据来自Figure 5中的六步消融实验。在GPT-5.6 Sol上从官方基线13.33分出发逐步添加组件配置变更内容RHAE得分增量官方基线文本网格13.33—(i)替换为渲染图像47.3234.0(ii)放宽动作/时间限制51.664.3(iii)持续对话原生压缩65.8214.2(iv)添加GUIDE/WORKING笔记70.054.2(v)无损视觉记忆自主检查94.1024.1(vi)精确像素读出99.004.9这组数据传达了三个关键信息第一感知通道的切换贡献了最大单步增量。仅将文本网格替换为渲染图像分数就从13.33跃升至47.32。这直接验证了“多模态模型被文本表示蒙蔽了眼睛”的核心假设。第二视觉记忆主动检查是VISTA最核心的原创贡献。从70.05到94.10的24.1分提升是所有组件中最大的单步增益且这一组件是VISTA独有的而非对现有智能体框架的通用改进。第三Token效率的改善是显著的。文本网格方案每局消耗约7190万Token而图像方案仅需3070万Token分数却更高。此外论文还进行了多项控制实验上下文从200K缩减至100K仅降低0.4分但Token减半8×图像缩放256像素/边比默认16×在性能相当的情况下节省75%图像Token增大到32×则无额外收益且成本更高。这些实验表明VISTA的性能对关键超参数具有较好的鲁棒性。五、技术意义与局限VISTA的核心贡献不在于训练了更强的模型而在于揭示了一个被忽视的事实交互式视觉推理的性能瓶颈可能在“接口”而非“智能”。论文中一个特别有说服力的数据点是——使用320B参数的开源权重模型GLM-5.3 Flash在官方接口下仅得1.89分在VISTA下提升至66.93分。这意味着即使模型规模较小合适的视觉接口也能释放出远超出预期的推理能力。方法的局限同样明确。论文承认实验中的模型发布时间晚于ARC-AGI-3公开游戏因此公开集上的结果可能存在预训练数据污染的风险真正的泛化能力需要在私有游戏集上验证。此外VISTA是一个纯推理时的框架不涉及任何模型训练或微调其性能上限受限于底层多模态模型本身的能力。从工程角度看维护完整的帧级视觉记忆和无损图像存档在长时间交互中可能带来存储和检索成本的增长。从更宏观的视角看VISTA提出的问题比它回答的更多如果仅通过改善视觉信息的可及性就能将性能从40分推到100分那么当前多模态模型在各类交互式基准上的“低分”有多少是真实能力缺失有多少是评估接口设计不当造成的系统性低估这个问题值得整个领域重新审视。