Skip to main content
QUICK REVIEW

[论文解读] Neural Architecture Search for Deep Image Prior

Kary Ho, Andrew Gilbert|arXiv (Cornell University)|Jan 14, 2020
Advanced Image Processing Techniques参考文献 43被引用 8
一句话总结

该论文提出NAS-DIP,一种基于进化神经架构搜索的方法,可自动发现针对内容特异的编码器-解码器网络,以增强无监督图像恢复任务中的深度图像先验(DIP)。通过在二进制基因组上使用遗传算法优化架构与元参数,NAS-DIP在去噪、图像修复和超分辨率任务中相比经典DIP实现了更优的视觉质量,且在500人的种群规模下,10–20代内即可收敛。

ABSTRACT

We present a neural architecture search (NAS) technique to enhance the performance of unsupervised image de-noising, in-painting and super-resolution under the recently proposed Deep Image Prior (DIP). We show that evolutionary search can automatically optimize the encoder-decoder (E-D) structure and meta-parameters of the DIP network, which serves as a content-specific prior to regularize these single image restoration tasks. Our binary representation encodes the design space for an asymmetric E-D network that typically converges to yield a content-specific DIP within 10-20 generations using a population size of 500. The optimized architectures consistently improve upon the visual quality of classical DIP for a diverse range of photographic and artistic content.

研究动机与目标

  • 为解决经典深度图像先验(DIP)的局限性,即依赖固定且未经优化的网络架构,在多样化图像内容上表现欠佳的问题。
  • 开发一种无需监督、内容感知的神经架构搜索(NAS)框架,针对单个图像定制编码器-解码器结构与元参数。
  • 证明通过遗传算法进行架构搜索可显著提升单图像恢复任务中的感知质量,且无需真实标签监督。
  • 探究所发现的架构是否反映潜在视觉风格,从而实现基于风格的无监督图像内容聚类。

提出的方法

  • 采用二进制字符串表示法编码非对称编码器-解码器网络的架构空间,包括滤波器大小、通道深度与跳跃连接,实现对离散且紧凑基因组的进化搜索。
  • 采用锦标赛选择、均匀交叉与位翻转变异的遗传算法,在10–20代内对500个架构的种群进行演化,以优化感知质量。
  • 以感知度量(LPIPS)作为视觉质量的代理指标评估适应度,无需真实图像,实现盲优化。
  • 搜索空间包含10个卷积阶段,支持可变的滤波器大小与通道宽度,并兼容对称与非对称的E-D结构。
  • 对架构空间进行t-SNE可视化,显示具有相似视觉风格(如铅笔素描、水彩)的网络聚类在一起,表明发现了风格相关的架构偏好。
  • 该方法应用于去噪、图像修复与超分辨率任务,损失函数定义为基于LPIPS的重建损失,用于图像恢复。

实验结果

研究问题

  • RQ1进化神经架构搜索能否在无监督条件下发现显著优于标准DIP的编码器-解码器架构,用于单图像恢复任务?
  • RQ2图像恢复的最优网络架构是否具有内容特异性,即不同图像风格是否需要不同的架构配置?
  • RQ3所发现的架构能否用于无监督方式按视觉风格对图像进行聚类?
  • RQ4在缺乏真实标签监督的情况下,何种突变率与种群规模能实现最佳收敛性与视觉质量?

主要发现

  • NAS-DIP在去噪、图像修复与超分辨率任务中均一致地提升了视觉质量,经感知度量与定性对比验证。
  • 最优突变率为5%(0.05),此时每代平均产生4次位翻转(N=5),优于更低或更高的突变率。
  • 在500人的种群规模下,10–20代内即可实现收敛,单张图像的训练在单张GPU上耗时数小时。
  • 对架构空间的t-SNE可视化显示,不同视觉风格(如漫画、3D渲染、水彩)对应明显的聚类,表明发现了风格特异的架构。
  • 在超分辨率任务中,对称E-D架构优于非对称结构;而在去噪与图像修复任务中,非对称设计表现更优。
  • 针对相同内容但不同艺术风格(如8种BAM!风格的花朵)的最优架构在架构空间中形成独立聚类,证实了内容特异性架构发现的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。