[论文解读] Disentangling Controllable and Uncontrollable Factors of Variation by Interacting with the World
该论文提出了一种基于强化学习的方法,通过训练两个深度神经网络(DNNs)来解耦视觉环境中的可控制因素与不可控因素:一个用于可控制对象,另一个用于不可控障碍物。通过在简单环境中使用鲁棒模型对可控制DNN进行预训练,该方法实现了无需标注数据的稳定解耦,在模拟环境中表现出潜在因子与控制动作之间高度相关。
We introduce a method to disentangle controllable and uncontrollable factors of variation by interacting with the world. Disentanglement leads to good representations and is important when applying deep neural networks (DNNs) in fields where explanations are required. This study attempts to improve an existing reinforcement learning (RL) approach to disentangle controllable and uncontrollable factors of variation, because the method lacks a mechanism to represent uncontrollable obstacles. To address this problem, we train two DNNs simultaneously: one that represents the controllable object and another that represents uncontrollable obstacles. For stable training, we applied a pretraining approach using a model robust against uncontrollable obstacles. Simulation experiments demonstrate that the proposed model can disentangle independently controllable and uncontrollable factors without annotated data.
研究动机与目标
- 解决现有基于强化学习的解耦方法中缺乏对不可控障碍物表征机制的问题。
- 通过实现可控制与不可控因素的解耦,改进深度神经网络中的表征学习。
- 在无需人工标注的情况下实现解耦表征的稳定训练。
- 探究在复杂环境中是否存在障碍物时,于简单环境预训练是否能提升解耦性能。
- 在具有外在奖励的强化学习设置中评估该方法,证明其在下游任务中的实用性。
提出的方法
- 训练两个独立的DNN:一个用于表征可控制对象,另一个用于表征不可控障碍物,两者均通过强化学习进行训练。
- 采用受Thomas等人启发的自监督策略,其中最高隐藏层被约束为对单个控制动作独立响应。
- 使用在无障碍物的简单环境中训练的模型对可控制对象的DNN进行预训练,以提升其鲁棒性与稳定性。
- 将预训练参数作为可控制DNN的初始化,确保神经元对控制动作保持敏感,同时减少障碍物的影响。
- 将两个DNN的潜在特征整合到LSTM与全连接网络中,用于深度循环Q网络(DRQN)设置下的Q值预测。
- 使用随机梯度下降,固定学习率与折扣因子,并在训练期间冻结编码器,以隔离解耦的影响。
实验结果
研究问题
- RQ1基于强化学习的方法是否能在无需人工标注的情况下解耦可控制与不可控因素?
- RQ2在复杂环境中存在障碍物时,于简单环境预训练可控制DNN是否能提升解耦稳定性?
- RQ3可控制与不可控因素的潜在表征与实际控制动作及障碍物位置之间的相关性如何?
- RQ4解耦表征是否能支持具有外在奖励的下游强化学习任务?
- RQ5使用鲁棒预训练机制对解耦特征的质量有何影响?
主要发现
- 所提出的方法在模拟环境中成功实现了可控制与不可控因素的解耦,且无需任何标注数据。
- 使用简单环境中训练的模型对可控制DNN进行预训练,显著提升了训练稳定性和解耦性能。
- 在情境1中,潜在因子与控制动作的相关性在x轴方向达到0.904,y轴方向达到0.934,表明解耦效果显著。
- 在情境2中,模型在x轴方向的相关性为-0.846,y轴方向为-0.897,表明即使在复杂障碍物配置下,解耦依然具有鲁棒性。
- 当使用来自不同环境的预训练时,重建误差增加,表明在相同环境中进行预训练可获得更高质量的特征。
- VAE基线模型生成的样本模糊且不真实,凸显了所提强化学习驱动解耦方法在复杂视觉数据上的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。