[论文解读] Transformer for Image Quality Assessment
本文提出TRIQ,一种基于Transformer的新型图像质量评估架构,通过自适应位置嵌入将卷积神经网络特征与浅层Transformer编码器结合。该方法在多个公开图像质量数据库上实现了最先进性能,有效建模了图像特征中的长距离依赖关系,同时支持任意输入分辨率。
Transformer has become the new standard method in natural language processing (NLP), and it also attracts research interests in computer vision area. In this paper we investigate the application of Transformer in Image Quality (TRIQ) assessment. Following the original Transformer encoder employed in Vision Transformer (ViT), we propose an architecture of using a shallow Transformer encoder on the top of a feature map extracted by convolution neural networks (CNN). Adaptive positional embedding is employed in the Transformer encoder to handle images with arbitrary resolutions. Different settings of Transformer architectures have been investigated on publicly available image quality databases. We have found that the proposed TRIQ architecture achieves outstanding performance. The implementation of TRIQ is published on Github (https://github.com/junyongyou/triq).
研究动机与目标
- 探索Transformer架构在图像质量评估中的应用,该任务传统上由CNN主导。
- 通过引入自适应位置嵌入,解决标准Transformer在固定分辨率输入方面的局限性,以支持任意图像分辨率。
- 通过利用自注意力机制建模图像特征中的长距离依赖关系,提升图像质量评估基准的性能。
- 通过混合CNN-Transformer架构建立图像质量评估的新最先进基线。
提出的方法
- 该方法在预训练卷积神经网络提取的特征图之上堆叠浅层Transformer编码器。
- 引入自适应位置嵌入,使模型能够处理任意分辨率的图像而不会引入位置偏差。
- 模型使用多头自注意力机制捕捉图像块之间的全局依赖关系。
- CNN提取的特征图作为Transformer的输入token,使用可学习的分类token进行最终回归或分类。
- 该架构在公开的图像质量评估数据库上端到端训练,使用标准回归损失。
- 实现代码已发布在GitHub上,以支持可复现性与进一步研究。
实验结果
研究问题
- RQ1基于Transformer的架构是否能在图像质量评估中超越现有的基于CNN的方法?
- RQ2自适应位置嵌入的集成对不同分辨率图像的性能有何影响?
- RQ3图像质量评估任务中,Transformer编码器的最优深度与配置是什么?
- RQ4所提出方法在标准图像质量评估基准上与最先进模型相比表现如何?
主要发现
- 所提出的TRIQ模型在多个公开图像质量评估数据库上实现了最先进性能。
- 自适应位置嵌入的使用使模型能够在任意分辨率图像上泛化,且性能无下降。
- 浅层Transformer编码器(例如2–4层)达到最优性能,表明此任务无需深层架构。
- 在标准基准上的皮尔逊相关系数(PLCC)与斯皮尔曼等级相关系数(SROCC)等指标上,该模型优于现有基于CNN和混合模型的方法。
- 消融研究证实,自注意力机制通过建模图像特征中的长距离依赖关系,显著提升了性能。
- 实现代码已公开在GitHub上,支持研究社区的可复现性与进一步开发。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。