[论文解读] VirtualHome: Simulating Household Activities via Programs
本文提出VirtualHome,一个3D模拟器,通过程序(原子动作与交互的符号化序列)生成合成的家庭活动视频。通过游戏化界面众包程序,作者训练模型从自然语言或视频中推断程序,使智能体在模拟环境中以高精度和可执行性完成复杂任务,其有效性通过人工评估和丰富的视频标注得到验证。
In this paper, we are interested in modeling complex activities that occur in a typical household. We propose to use programs, i.e., sequences of atomic actions and interactions, as a high level representation of complex tasks. Programs are interesting because they provide a non-ambiguous representation of a task, and allow agents to execute them. However, nowadays, there is no database providing this type of information. Towards this goal, we first crowd-source programs for a variety of activities that happen in people's homes, via a game-like interface used for teaching kids how to code. Using the collected dataset, we show how we can learn to extract programs directly from natural language descriptions or from videos. We then implement the most common atomic (inter)actions in the Unity3D game engine, and use our programs to "drive" an artificial agent to execute tasks in a simulated household environment. Our VirtualHome simulator allows us to create a large activity video dataset with rich ground-truth, enabling training and testing of video understanding models. We further showcase examples of our agent performing tasks in our VirtualHome based on language descriptions.
研究动机与目标
- 构建一个大规模、基于程序的家庭活动知识库,用于机器人研究。
- 开发一个3D模拟器(VirtualHome),生成具有丰富真实标注的高保真视频数据集。
- 实现从自然语言描述和视频演示中自动生成程序。
- 通过自动化指标与人工评估,评估程序推断的质量。
- 提供一个可扩展、开源的平台,用于在模拟家庭环境中训练和测试视觉与机器人智能体。
提出的方法
- 使用类似Scratch的界面众包家庭活动程序,将自然语言指令转换为符号化动作序列。
- 在Unity3D游戏引擎中实现常见原子动作(例如,拿起、打开开关),并集成物理、导航与运动学模型。
- 通过随机化环境、物体位置、智能体位置和摄像机视角,动画化程序以生成合成视频数据集。
- 训练神经模型,利用序列到序列学习与强化学习(RL)优化程序相似性(LCS)和可执行性,从自然语言中预测程序。
- 使用概率文法初始化程序生成,并通过双奖励强化学习进行优化:LCS用于语义准确性,模拟器反馈用于可执行性。
- 对合成视频进行丰富监督信号标注:动作时间戳、2D/3D姿态、类别与实例分割、深度图与光流。
实验结果
研究问题
- RQ1符号化动作序列(即程序)能否以清晰无歧义且可执行的方式有效表示复杂家庭活动?
- RQ2神经模型从家庭活动的自然语言描述中推断程序的准确度如何?
- RQ3模型能否从家庭活动的视频演示中学习生成可执行程序?
- RQ4自动生成的程序在动作序列与物体交互方面与人工标注的真实情况在多大程度上一致?
- RQ5自动化指标(如LCS、可执行性)与人工对程序质量及任务合理性判断的相关性如何?
主要发现
- 采用双奖励(LCS与可执行性)的强化学习模型在基于语言和基于视频的程序生成任务中均优于所有基线模型,LCS得分更高,可执行性显著提升。
- 同时使用LCS与模拟器奖励训练的模型在VirtualHome数据集上达到92.1%的可执行率,优于仅使用LCS的模型(85.3%)和MLE基线模型(78.9%)。
- 人工评估显示自动化指标与人工判断高度一致:LCS得分高于0.95的程序获得高分评价,验证了指标的有效性。
- 该模拟器支持构建大规模视频数据集,包含丰富的标注信息,如动作时间戳、3D姿态、分割掩码、深度图与光流,可支持下游视觉与机器人任务。
- 系统能成功从自然语言描述中生成合理的智能体行为,视频示例显示智能体可执行复杂任务,如整理床铺或烹饪晚餐。
- 模型在未见活动上的泛化能力表明,基于程序的表示可作为机器人从人类演示中学习的稳健中间语言。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。