[论文解读] Learning in Factored Domains with Information-Constrained Visual Representations
本文提出一种基于改进的 $\beta$-VAE 的因子化强化学习模型,用于学习解耦的、信息受限的视觉表征,从而在视觉上下文Bandit任务中实现快速、样本高效的训练。通过从压缩的潜在特征中生成并评估关于奖励结构的假设,该模型实现了快速收敛——仅在两次经验后即选择最优动作,展示了学习速度与重建精度之间的权衡。
Humans learn quickly even in tasks that contain complex visual information. This is due in part to the efficient formation of compressed representations of visual information, allowing for better generalization and robustness. However, compressed representations alone are insufficient for explaining the high speed of human learning. Reinforcement learning (RL) models that seek to replicate this impressive efficiency may do so through the use of factored representations of tasks. These informationally simplistic representations of tasks are similarly motivated as the use of compressed representations of visual information. Recent studies have connected biological visual perception to disentangled and compressed representations. This raises the question of how humans learn to efficiently represent visual information in a manner useful for learning tasks. In this paper we present a model of human factored representation learning based on an altered form of a $β$-Variational Auto-encoder used in a visual learning task. Modelling results demonstrate a trade-off in the informational complexity of model latent dimension spaces, between the speed of learning and the accuracy of reconstructions.
研究动机与目标
- 探究压缩的、解耦的视觉表征如何在复杂视觉任务中支持快速学习。
- 通过利用状态与奖励的因子化表征,建模类人样本效率的强化学习。
- 考察信息受限潜在空间中重建精度与学习速度之间的权衡。
- 评估解耦表征是否能支持有效的奖励预测假设生成。
- 探索基于行为效用与任务表现的解耦性定义。
提出的方法
- 通过联合损失函数平衡重建、KL正则化与奖励预测准确率,训练改进的 $\beta$-VAE 以重建视觉输入并从潜在特征预测奖励。
- 模型采用奖励函数的因子化表征,基于对应于不同视觉属性(如眼镜、帽子)的潜在特征将其分解为独立分量。
- 利用潜在表征生成并迭代重估关于未来奖励与状态转移的假设,从而实现高效的探索与学习。
- 在包含四类刺激(眼镜、帽子、两者均有、均无)的上下文Bandit设置中,先在大规模名人面部图像数据集(22万张图像)上进行预训练,再进行微调。
- 奖励预测建模为各属性贡献的线性叠加,通过下一状态潜在特征上的值函数实现时间信用分配。
- 假设生成机制假设奖励结构为确定性且可加,从而在低样本场景中实现高效学习。
实验结果
研究问题
- RQ1信息受限的视觉表征如何影响视觉任务中强化学习的速度与准确率?
- RQ2在因子化MDP设置中,解耦的潜在表征能否支持关于奖励结构的快速假设生成?
- RQ3在压缩的潜在空间中,重建保真度与学习效率之间的权衡是什么?
- RQ4潜在表征如何随时间演化以反映基于效用的等价性?
- RQ5基于行为定义的解耦性是否能解释类人智能体中的更快学习?
主要发现
- 潜在维度较小的模型实现了更快的学习,在仅经历两次经验后即选择高奖励的Bandit臂,表现出极高的样本效率。
- 较小的潜在空间因更紧的信息瓶颈导致重建精度较低,证实了学习速度与保真度之间的权衡。
- 高价值刺激(如同时具有眼镜与帽子)的潜在表征随时间与零价值刺激的表征日益分离,表明基于效用的表征学习。
- 模型的潜在空间表现出一种基于效用的等价形式,即具有相似奖励的刺激发展出相似的表征。
- 假设生成机制通过聚焦于与奖励结果相关的显著、解耦特征,实现了快速收敛。
- 在大规模人脸数据集上进行预训练,使模型能有效迁移至上下文Bandit任务,支持从压缩视觉特征中进行泛化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。