[论文解读] ProTo: Program-Guided Transformer for Program-Guided Tasks
ProTo 提出了一种程序引导的 Transformer 模型,通过交叉注意力和掩码自注意力机制,联合建模程序语义与结构,实现在感知、推理和决策任务中的统一执行。它在 GQA 视觉推理任务(准确率提升 4.31%)和 2D Minecraft 策略学习任务中达到最先进性能,展现出对未见过的、复杂的、人类编写的程序的强大泛化能力。
Programs, consisting of semantic and structural information, play an important role in the communication between humans and agents. Towards learning general program executors to unify perception, reasoning, and decision making, we formulate program-guided tasks which require learning to execute a given program on the observed task specification. Furthermore, we propose the Program-guided Transformer (ProTo), which integrates both semantic and structural guidance of a program by leveraging cross-attention and masked self-attention to pass messages between the specification and routines in the program. ProTo executes a program in a learned latent space and enjoys stronger representation ability than previous neural-symbolic approaches. We demonstrate that ProTo significantly outperforms the previous state-of-the-art methods on GQA visual reasoning and 2D Minecraft policy learning datasets. Additionally, ProTo demonstrates better generalization to unseen, complex, and human-written programs.
研究动机与目标
- 通过学习通用的程序执行器,统一感知、推理与决策任务,以实现程序引导的任务执行。
- 解决即兴的、任务特定的程序执行器所导致的可扩展性与泛化性受限的问题。
- 开发一种神经符号模型,联合编码程序语义与结构控制流,以提升推理与执行能力。
- 在多样化程序引导任务(包括视觉推理与策略学习)上评估模型,涵盖密集监督与稀疏奖励设置。
提出的方法
- ProTo 使用交叉注意力将任务规范(如图像或环境状态)与程序例程对齐,实现语义定位。
- 在程序结构上应用掩码自注意力,以保持控制流并支持对循环与条件语句的结构化推理。
- 模型在学习的潜在空间中执行程序,相比以往的神经符号模型,实现了更丰富的表征学习。
- 支持密集执行监督与基于稀疏奖励的训练,使模型能在复杂环境中实现泛化。
- 该架构在程序引导任务上端到端训练,注意力机制显式建模程序的语义与结构组件。
- 模型在 GQA(视觉推理)与 2D Minecraft(策略学习)上进行评估,使用程序标注的数据集与领域特定语言(DSL)。
实验结果
研究问题
- RQ1统一的神经模型能否有效学习在感知、推理与决策任务中执行多样化程序?
- RQ2显式建模程序结构与语义在未见过的、复杂的或人类编写的程序上是否能提升泛化能力?
- RQ3具有结构化注意力的 Transformer 方法是否在程序引导任务中优于普通 Transformer 与符号规划器?
- RQ4ProTo 在无显式监督的情况下,对未见过的程序例程的泛化能力达到何种程度?
- RQ5ProTo 能否在稀疏奖励信号环境中扩展至长而复杂的程序?
主要发现
- 在公开的 GQA 测试服务器上,ProTo 在程序引导的视觉推理任务中相比之前的最先进方法实现了 4.31% 的准确率提升。
- 该模型能有效泛化至人类编写的程序,展现出对合成或程序生成输入之外的鲁棒性。
- ProTo 显著优于缺乏显式结构引导的普通 Transformer,尤其在长而复杂的程序上表现更优。
- 该模型具备组合能力的泛化,例如在观察到 Is_there(gold) 和 Mine(Silver) 等相关例程后,能推断出新的例程(如 Mine(Gold))。
- ProTo 在可扩展性、对原始图像输入的适应性以及对未见程序组件的处理能力方面,优于硬编码的符号规划器。
- 在稀疏奖励学习设置下,ProTo 表现优异,使其能够在无密集监督的情况下学习复杂行为(如 Minecraft 中的桥梁建造)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。