Skip to main content
QUICK REVIEW

[论文解读] Where to Look Next: Unsupervised Active Visual Exploration on 360° Input

Soroush Seifi, Tinne Tuytelaars|arXiv (Cornell University)|Sep 23, 2019
Advanced Vision and Imaging参考文献 14被引用 6
一句话总结

该论文提出了一种新颖的无监督主动视觉探索框架,适用于360°环境,通过空间记忆图与视网膜样图像片段,在无需深度强化学习或辅助网络的情况下,实现了优于先前方法的场景重建性能。该模型仅使用8个图像片段(覆盖11%的图像像素),即实现了当前最优的重建准确率(12.49 MSE ×1000)与接近理论上限的分类性能。

ABSTRACT

We address the problem of active visual exploration of large 360° inputs. In our setting an active agent with a limited camera bandwidth explores its 360° environment by changing its viewing direction at limited discrete time steps. As such, it observes the world as a sequence of narrow field-of-view 'glimpses', deciding for itself where to look next. Our proposed method exceeds previous works' performance by a significant margin without the need for deep reinforcement learning or training separate networks as sidekicks. A key component of our system are the spatial memory maps that make the system aware of the glimpses' orientations (locations in the 360° image). Further, we stress the advantages of retina-like glimpses when the agent's sensor bandwidth and time-steps are limited. Finally, we use our trained model to do classification of the whole scene using only the information observed in the glimpses.

研究动机与目标

  • 解决在相机带宽有限且观测步骤离散的360°环境中主动视觉探索的挑战。
  • 克服先前方法依赖深度强化学习或辅助网络进行策略学习的局限性。
  • 通过新颖的空间记忆图架构,保留图像片段之间的空间相关性,提升场景重建性能。
  • 通过使用视网膜样图像片段优先聚焦中心高分辨率区域,实现在带宽受限条件下的高效信息获取。
  • 通过仅使用采样片段数据,证明所学表征在下游分类任务中的可迁移性。

提出的方法

  • 采用视网膜样图像片段,其中中心16×16区域保持全分辨率,周围8个区域下采样2倍,以优化带宽使用。
  • 使用基于U-Net的局部重建模块,通过真实图像与重建图像之间的L1损失,将图像片段恢复至全分辨率。
  • 引入空间记忆图(fit-in矩阵),将上采样的图像片段存储在360°空间中的正确位置,以保留空间相关性。
  • 通过平均池化与卷积操作,对每个图像片段的瓶颈特征进行下采样,生成大小为4096的fit-in特征向量。
  • 在fit-in特征向量上使用全连接层生成下采样背景重建结果,再通过转置卷积与来自fit-in矩阵的跳跃连接进行上采样。
  • 通过多尺度L1损失联合优化整个网络,包括局部重建、完整重建与注意力模块损失;注意力模块通过重建误差进行训练,以指导图像片段的选择。

实验结果

研究问题

  • RQ1模型是否能在不使用深度强化学习或辅助网络的情况下,实现优于基线的主动360°视觉探索重建性能?
  • RQ2与LSTM等循环记忆机制相比,空间记忆图在保留图像片段间空间相关性方面有多有效?
  • RQ3在带宽受限条件下,视网膜样图像片段在提升信息效率方面能达到何种程度?
  • RQ4从图像片段中学到的表征是否能有效迁移到下游分类任务中,且仅需极少标注数据?
  • RQ5当图像片段基于真实重建误差选择时,该模型性能与理论上限相比如何?

主要发现

  • 所提方法在SUN360数据集上实现12.49 ×1000的重建MSE(RMSE 28.5),显著优于先前方法,如Side-kick Policy Learning(23.36)与Learning to Look Around(23.16)。
  • 仅使用5个图像片段(覆盖11%的图像像素),模型性能已超过先前使用6个图像片段(覆盖19%像素)的方法。
  • 随着图像片段数量增加,模型的重建性能稳步提升,且与基线方法的性能差距随时间扩大。
  • 仅使用8个图像片段,模型在分类任务中达到65%的准确率,接近全图分类器实现的理论上限65%。
  • 模型在随机图像片段选择(MSE 18.73)与基于邻域选择(MSE 16.64)的基线方法上表现更优,证明了其注意力机制的有效性。
  • 空间记忆图的使用有助于更好地保留空间结构,相比基于LSTM的方法,显著减少了重建中纹理与细节的损失。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。