Skip to main content
QUICK REVIEW

[论文解读] See, Hear, Explore: Curiosity via Audio-Visual Association

Victoria Dean, Shubham Tulsiani|arXiv (Cornell University)|Jul 7, 2020
Cognitive Science and Education Research参考文献 42被引用 18
一句话总结

本文提出了一种名为 See, Hear, Explore (SHE) 的新型好奇心驱动探索方法,该方法在强化学习中通过奖励智能体发现新颖的视听关联而非预测未来状态来实现。通过利用多模态感官输入,SHE 在 Atari 游戏和 Habitat 导航模拟器中均实现了更高效、更鲁棒的探索,优于基于未来预测的基线方法,尤其在噪声环境下表现更优。

ABSTRACT

Exploration is one of the core challenges in reinforcement learning. A common formulation of curiosity-driven exploration uses the difference between the real future and the future predicted by a learned model. However, predicting the future is an inherently difficult task which can be ill-posed in the face of stochasticity. In this paper, we introduce an alternative form of curiosity that rewards novel associations between different senses. Our approach exploits multiple modalities to provide a stronger signal for more efficient exploration. Our method is inspired by the fact that, for humans, both sight and sound play a critical role in exploration. We present results on several Atari environments and Habitat (a photorealistic navigation simulator), showing the benefits of using an audio-visual association model for intrinsically guiding learning agents in the absence of external rewards. For videos and code, see https://vdean.github.io/audio-curiosity.html.

研究动机与目标

  • 解决在无外部奖励的情况下强化学习中高效探索的挑战。
  • 克服基于未来预测的 curiosity 的局限性,后者对噪声敏感且在高维空间中难以训练。
  • 探究多模态关联(特别是视觉与声音之间)是否能提供更强壮、更鲁棒的内在奖励信号。
  • 在标准 Atari 环境和一个真实的逼真视觉导航模拟器(Habitat)中评估该方法。
  • 证明基于视听关联的 curiosity 能够实现比现有基线方法更高效的样本利用和更强的抗噪能力。

提出的方法

  • 该方法使用对比学习框架,训练一个多模态判别器,用于判断音频和视觉特征是否来自同一事件(正样本对)或不同事件(负样本对)。
  • 内在奖励定义为音频-视觉对比预测头的交叉熵损失,用于衡量模型关联正确感官对的能力。
  • 智能体因采取导致音频-视觉关联分类器产生高不确定性或低置信度的动作而获得奖励,表明发现了新颖的关联。
  • 音频和视觉特征通过独立的卷积神经网络(如视觉使用 ResNet-18,音频使用 1D CNN)提取,随后拼接用于对比头。
  • 该方法避免学习完整的未来状态预测器,而是专注于跨模态学习共享表征。
  • 该方法与策略端到端联合训练,使用对比损失作为内在奖励信号,以引导探索。

实验结果

研究问题

  • RQ1在强化学习中,视听关联是否能作为比未来预测更鲁棒、更有效的内在奖励信号?
  • RQ2多模态 curiosity 是否能在高随机性或传感器噪声的环境中实现更高效的探索?
  • RQ3在复杂、真实的环境(如 Habitat 模拟器)中,视听 curiosity 的表现是否优于标准 curiosity 基线?
  • RQ4基于视听关联的 curiosity 是否能在包括简单 Atari 游戏和逼真 3D 导航在内的多样化任务和环境中实现泛化?
  • RQ5与基于未来预测的 curiosity 相比,该方法是否具有更高的样本效率和更强的抗输入噪声能力?

主要发现

  • 在 12 款 Atari 游戏中的 10 款上,SHE 超过了标准 curiosity 基线,实现了更高的样本效率和更一致的探索表现。
  • 在 Habitat 模拟器中,SHE 在区域覆盖和探索效率方面显著优于基线方法,展现出在真实、复杂环境中的强大性能。
  • 该方法对输入噪声更具鲁棒性:当在视觉和音频特征中加入高斯噪声时,其性能下降幅度远小于基于未来预测的基线方法。
  • 在 MsPacman、SpaceInvaders 和 Asterix 的噪声版本中,SHE 保持了稳定的性能,而未来预测基线则表现出显著的性能下降。
  • 结合未来预测与视听对比损失的联合方法在 12 款 Atari 游戏中的 10 款上优于单独使用任一组件。
  • 消融实验证实,同时使用音频和视觉特征可提升性能,优于仅使用视觉特征,验证了多模态关联的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。