[论文解读] Visual Language Modeling on CNN Image Representations
本文提出CNN-VLM,一种视觉语言建模方法,通过在预训练CNN的中级特征上训练循环神经网络语言模型(RNNLMs),评估图像的自然度。通过将沿行和列的特征序列视为'句子',该方法基于预测误差计算不自然度得分,在眼动预测任务中达到最先进性能,并在作为正则化器用于图像重建时提升了重建质量。
Measuring the naturalness of images is important to generate realistic images or to detect unnatural regions in images. Additionally, a method to measure naturalness can be complementary to Convolutional Neural Network (CNN) based features, which are known to be insensitive to the naturalness of images. However, most probabilistic image models have insufficient capability of modeling the complex and abstract naturalness that we feel because they are built directly on raw image pixels. In this work, we assume that naturalness can be measured by the predictability on high-level features during eye movement. Based on this assumption, we propose a novel method to evaluate the naturalness by building a variant of Recurrent Neural Network Language Models on pre-trained CNN representations. Our method is applied to two tasks, demonstrating that 1) using our method as a regularizer enables us to generate more understandable images from image features than existing approaches, and 2) unnaturalness maps produced by our method achieve state-of-the-art eye fixation prediction performance on two well-studied datasets.
研究动机与目标
- 为解决CNN特征对图像自然度不敏感的问题,尤其是在生成或编辑图像中。
- 开发一种方法,捕捉超越低级像素统计的高级、抽象的自然度。
- 利用眼动过程中视觉特征的可预测性作为自然度的代理指标。
- 将自然度度量应用于图像重建和眼动预测任务。
- 证明在CNN特征上进行自然度的无监督建模可提升视觉任务的性能。
提出的方法
- 从预训练网络(如VGGNet)的多个层级提取中级CNN特征。
- 对特征图进行归一化和正交化处理,以提升稳定性和可解释性。
- 在特征图的每一行和每一列上独立应用单向RNNLM,以建模序列可预测性。
- 将序列的负对数似然作为每个空间位置的不自然度度量。
- 将水平和垂直RNNLM的不自然度得分聚合为单一的不自然度图。
- 将不自然度图用作图像重建中的正则化器,或作为眼动预测的显著性图。
实验结果
研究问题
- RQ1眼动过程中高级视觉特征的可预测性能否作为图像自然度的代理?
- RQ2基于RNN的CNN特征语言建模是否比基于像素的模型更有效地检测图像中不自然的区域?
- RQ3与现有正则化器相比,将不自然度得分引入特征重建是否能提升图像重建质量?
- RQ4从CNN-VLM导出的不自然度图能否以最先进水平预测人类眼动模式?
- RQ5CNN-VLM的性能是否依赖于CNN层的选择,哪些层级最能捕捉自然度?
主要发现
- CNN-VLM在MIT1003数据集上取得了0.7096的最先进shuffle AUC得分,在CAT2000数据集上达到0.6221,优于现有方法。
- 在MIT300数据集上,CNN-VLM以0.7096的shuffle AUC排名第二,而在CAT2000数据集上排名第一,得分为0.6221。
- 当用作正则化器时,该方法显著提升了图像重建质量,生成的图像比基线方法更具可解释性和真实性。
- 高层级CNN特征(如conv5_4、conv5_1)生成的不自然度图在眼动预测中表现优于低层级特征。
- 该模型的无监督特性使其对领域偏移具有鲁棒性,因为它在训练时无需标注的眼动数据。
- 在语义内容丰富的类别(如社交、卡通、情感类)中性能最高,表明其对高级语义高度敏感。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。