[论文解读] Neural Task Programming: Learning to Generalize Across Hierarchical Tasks
神经任务编程(NTP)是一种元学习框架,通过解释任务演示并递归地将其分解为可重用的神经子程序,使机器人能够在层次化操作任务之间实现泛化。该方法在仿真和真实机器人环境中均实现了对未见过的任务的强少样本泛化能力,这些任务在长度、拓扑结构和语义上各不相同,尤其在使用视觉输入端到端训练时表现尤为出色。
In this work, we propose a novel robot learning framework called Neural Task Programming (NTP), which bridges the idea of few-shot learning from demonstration and neural program induction. NTP takes as input a task specification (e.g., video demonstration of a task) and recursively decomposes it into finer sub-task specifications. These specifications are fed to a hierarchical neural program, where bottom-level programs are callable subroutines that interact with the environment. We validate our method in three robot manipulation tasks. NTP achieves strong generalization across sequential tasks that exhibit hierarchal and compositional structures. The experimental results show that NTP learns to generalize well to- wards unseen tasks with increasing lengths, variable topologies, and changing objectives.
研究动机与目标
- 解决在目标和初始条件各异的复杂、层次化操作任务中泛化机器人策略的挑战。
- 通过发现可重用的模块化神经程序,实现在少量演示下的单样本学习,以实现对任务变化的泛化。
- 通过将任务分层分解为可执行的子程序,支持长时程决策。
- 实现从视觉输入(例如视频)端到端训练,无需显式的状态监督。
- 在不同任务结构下提升真实机器人部署中的鲁棒性和可迁移性。
提出的方法
- NTP将任务演示(例如视频或轨迹)解释为层次化程序规范,并递归地将其分解为子任务。
- 实例化一个层次化神经程序,其中底层程序对应可执行的机器人API动作(例如 pick_and_place)。
- 每个程序调用接收当前环境观测和子规范,预测下一个子程序和子任务输入,并通过结束程序信号终止执行。
- 模型使用循环结构(例如GRU)以维持内部状态,支持子任务之间的长期依赖。
- 对于视觉输入,NTPVID(E2E)通过7层CNN联合学习策略和与任务相关的视觉特征,而NTPVID(Detector)则使用预训练的目标检测器作为状态预处理器。
- 通过在子程序之间共享参数,该框架支持跨任务的元学习,从而实现仅用少量数据即可迁移到未见过的任务实例。
实验结果
研究问题
- RQ1神经程序归纳框架能否泛化到具有不同长度和拓扑结构的未见过的层次化任务?
- RQ2NTP能否在多样化的任务目标下,仅从单一演示中实现有效的少样本泛化?
- RQ3当仅使用视觉输入(例如视频)进行端到端训练且无真实状态监督时,NTP的性能如何?
- RQ4在存在间歇性故障或动态变化等环境扰动时,NTP是否仍保持鲁棒性?
- RQ5NTP能否成功迁移到具有物理交互约束的真实机器人系统中?
主要发现
- 在真实Sawyer机器人上,NTP在20个未见过的积木堆叠任务中实现了90%的成功率,其中5%的失败由算法错误导致,5%由物理操作问题导致。
- 在物体分类任务中,NTP在10次未见过的真实世界评估中实现了80%的成功率,无算法错误,但有20%的操作失败。
- 端到端视觉模型NTPVID(E2E)优于使用预训练检测器的NTPVID(Detector),尽管其仅使用部分视觉状态信息。
- 尽管训练任务数更少(400–1000 vs. 1000)且计算量显著更大(在8张GPU上训练10天),端到端视觉模型(NTPVID(E2E))的成功率仍高于基于检测器的流水线。
- 在具有间歇性故障的对抗性环境中,使用GRU的NTP成功率从88.4%下降至42.2%,表明对动态干扰较为敏感,而标准NTP则保持了更高的鲁棒性。
- NTP在具有不同数量碗和叉子的桌面清理任务中有效泛化,在仿真中成功率介于55%至100%之间,性能下降主要归因于碰撞检测错误,而非策略错误。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。