Skip to main content
QUICK REVIEW

[论文解读] InstructIR: High-Quality Image Restoration Following Human Instructions

Marcos V. Conde, Gregor Geigle|arXiv (Cornell University)|Jan 29, 2024
Advanced Image Processing Techniques被引用 4
一句话总结

InstructIR 引入了首个基于文本指导的图像复原模型,该模型利用自然语言指令指导多种退化类型(包括去噪、去雨、去模糊、去雾和低光照增强)的高质量图像复原。通过利用冻结的文本编码器和基于NAFNet的图像复原主干网络,InstructIR 实现了最先进性能,在关键基准测试中相比先前的全合一方法提升+1dB。

ABSTRACT

Image restoration is a fundamental problem that involves recovering a high-quality clean image from its degraded observation. All-In-One image restoration models can effectively restore images from various types and levels of degradation using degradation-specific information as prompts to guide the restoration model. In this work, we present the first approach that uses human-written instructions to guide the image restoration model. Given natural language prompts, our model can recover high-quality images from their degraded counterparts, considering multiple degradation types. Our method, InstructIR, achieves state-of-the-art results on several restoration tasks including image denoising, deraining, deblurring, dehazing, and (low-light) image enhancement. InstructIR improves +1dB over previous all-in-one restoration methods. Moreover, our dataset and results represent a novel benchmark for new research on text-guided image restoration and enhancement. Our code, datasets and models are available at: https://github.com/mv-lab/InstructIR

研究动机与目标

  • 解决使用自然语言指导在多种退化类型之间泛化图像复原的挑战。
  • 使单一全合一模型能够基于用户提供的文本指令进行图像复原,而非依赖预定义的退化嵌入。
  • 通过真实人工编写的提示,建立文本引导图像复原与增强的新基准。
  • 通过自然语言表达人类意图,提升在真实场景中的泛化能力和性能。
  • 证明基于文本的指令遵循方法在盲图像复原中可优于传统的提示嵌入或分类方法。

提出的方法

  • 该模型使用冻结的文本编码器(BGE-micro-v2)将人工编写的指令嵌入为上下文嵌入。
  • 基于NAFNet的图像复原主干网络通过交叉注意力机制处理退化图像和文本嵌入,使复原过程受指令条件控制。
  • 模型采用联合损失进行训练:恢复图像与真实图像之间的L1重建损失,以及从提示中进行意图分类的交叉熵损失。
  • 训练期间保持文本编码器冻结,以保留泛化能力并降低计算成本。
  • 该方法支持任意自然语言提示,实现灵活且以用户意图为导向的图像复原。
  • 模型在去噪、去雨、去模糊、去雾和低光照增强的标准基准上进行评估。

实验结果

研究问题

  • RQ1自然语言指令能否有效指导跨多种退化类型的图像复原模型?
  • RQ2与学习得到的提示嵌入或退化分类方法相比,使用人工编写的指令是否能提升复原性能?
  • RQ3仅通过文本引导,单一全合一模型能否泛化到多样化的现实世界退化场景?
  • RQ4文本编码器的选择如何影响文本引导图像复原中的性能?
  • RQ5该模型能否在保持对未见退化类型和指令泛化能力的同时,实现最先进性能?

主要发现

  • InstructIR 在五项图像复原任务中均达到最先进性能,相比先前全合一方法提升+1dB。
  • 该模型在真实世界退化场景中泛化良好,即使面对模糊或非技术性指令也能生成高质量结果。
  • 消融实验表明,不同文本编码器之间性能无显著差异,其中BGE-micro-v2在模型大小与性能之间实现最佳平衡。
  • 意图分类损失快速收敛,表明模型能有效学习将指令与正确复原任务关联。
  • 定性比较显示,InstructIR 在所有任务中均优于AirNet和PromptIR等基线模型,在视觉质量和细节恢复方面表现更优。
  • 该模型展现出强大的零样本泛化能力,无需微调即可基于多样化的人工编写提示恢复图像。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。