[论文解读] On the Transfer of Disentangled Representations in Realistic Settings
本文提出一个大规模、高分辨率的数据集,包含100万张模拟图像和1,800张机器人机械臂操作立方体的真实世界图像,涵盖相关因素和遮挡现象。提出一种基于变自编码器(VAE)的可扩展架构,用于解耦表示学习,并表明解耦是分布外泛化能力的强预测因子,尤其在训练过程中引入输入噪声时更为显著。
Learning meaningful representations that disentangle the underlying structure of the data generating process is considered to be of key importance in machine learning. While disentangled representations were found to be useful for diverse tasks such as abstract reasoning and fair classification, their scalability and real-world impact remain questionable. We introduce a new high-resolution dataset with 1M simulated images and over 1,800 annotated real-world images of the same setup. In contrast to previous work, this new dataset exhibits correlations, a complex underlying structure, and allows to evaluate transfer to unseen simulated and real-world settings where the encoder i) remains in distribution or ii) is out of distribution. We propose new architectures in order to scale disentangled representation learning to realistic high-resolution settings and conduct a large-scale empirical study of disentangled representations on this dataset. We observe that disentanglement is a good predictor for out-of-distribution (OOD) task performance.
研究动机与目标
- 为解决在高分辨率、复杂、类真实世界设置下,存在相关因素和遮挡现象时,解耦表示学习缺乏真实感基准的问题。
- 开发一种可扩展的神经架构,以实现在高分辨率、真实感数据上的有效解耦学习。
- 评估解耦表示在分布内与分布外设置下的泛化性能,包括仿真到真实世界的迁移能力。
- 探究解耦是否可在无显式标签的情况下作为分布外泛化的代理指标。
- 探索弱监督和输入噪声对真实世界部署场景中分布外泛化性能的影响。
提出的方法
- 提出一个新的高分辨率数据集,包含100万张由机器人机械臂与立方体交互生成的模拟图像,以及1,800张真实世界标注图像,能够捕捉相关因素、遮挡和复杂结构。
- 设计一种改进的VAE架构,通过增强归纳偏置和容量,使解耦学习可扩展至高分辨率观测数据。
- 开展大规模实证研究,使用最先进解耦方法在多样化训练与评估设置下训练1,080个模型。
- 在弱监督条件下,使用重建损失和ELBO作为模型选择的代理指标,无需依赖真实标签。
- 在训练过程中应用输入噪声增强,以评估其对分布外泛化性能的影响。
- 在两种分布外场景下评估迁移性能:OOD1(仿真中存在分布外因素)和OOD2(真实世界部署),包括零样本仿真到真实世界的迁移。
实验结果
研究问题
- RQ1在逼真的机器人操作设置中,解耦表示是否能有效泛化至分布外设置,包括真实世界部署?
- RQ2在无真实标签的情况下,解耦与分布外性能之间的相关性如何?
- RQ3训练过程中引入输入噪声在多大程度上能提升对未见真实世界观测的泛化能力?
- RQ4在弱监督条件下,重建损失或ELBO是否可作为选择具备强分布外泛化能力模型的可靠代理指标?
- RQ5真实世界数据中的相关性和遮挡现象在多大程度上影响解耦方法的可扩展性与性能?
主要发现
- 解耦是分布外泛化性能的强预测因子,尤其在涉及真实世界部署的OOD2场景中表现显著。
- 解耦与OOD2泛化性能之间的相关性不可忽视,尤其在OOD2-A情形(模拟的真实世界观测)中,但在OOD2-B(真实世界图像)中则较弱。
- 在训练中添加高斯噪声可显著提升OOD2泛化性能,而对OOD1无影响,表明噪声增强了对领域偏移的鲁棒性。
- 在使用噪声训练后,模型对真实世界图像中立方体位置的预测误差低于5%的平均绝对误差,表明其在机器人应用中具有强大实用性。
- 重建损失和ELBO在弱监督设置下可作为有效的代理指标,实现无需真实标签即可选择具备良好分布外性能的模型。
- 所提出的基于VAE的架构成功将解耦学习扩展至高分辨率、真实感数据,支持在复杂相关因素上的大规模实证评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。