[论文解读] NTIRE 2022 Challenge on High Dynamic Range Imaging: Methods and Results
本论文介绍了NTIRE 2022高动态范围(HDR)成像挑战赛,该挑战赛在严格的计算约束下评估从多个低动态范围(LDR)曝光中重建HDR图像的方法。挑战赛包含两个赛道——在复杂度限制下优化保真度,以及在超过保真度基线的前提下最小化复杂度。数据集包含1500个训练样本、60个验证样本和201个测试样本,输入为多曝光LDR图像,输出为真实HDR图像,采用ALONG和VAlgo等模型取得了最先进性能,实现了高达39.417的PSNR和低于200的MAC操作数。
This paper reviews the challenge on constrained high dynamic range (HDR) imaging that was part of the New Trends in Image Restoration and Enhancement (NTIRE) workshop, held in conjunction with CVPR 2022. This manuscript focuses on the competition set-up, datasets, the proposed methods and their results. The challenge aims at estimating an HDR image from multiple respective low dynamic range (LDR) observations, which might suffer from under- or over-exposed regions and different sources of noise. The challenge is composed of two tracks with an emphasis on fidelity and complexity constraints: In Track 1, participants are asked to optimize objective fidelity scores while imposing a low-complexity constraint (i.e. solutions can not exceed a given number of operations). In Track 2, participants are asked to minimize the complexity of their solutions while imposing a constraint on fidelity scores (i.e. solutions are required to obtain a higher fidelity score than the prescribed baseline). Both tracks use the same data and metrics: Fidelity is measured by means of PSNR with respect to a ground-truth HDR image (computed both directly and with a canonical tonemapping operation), while complexity metrics include the number of Multiply-Accumulate (MAC) operations and runtime (in seconds).
研究动机与目标
- 推动高效、低复杂度的计算HDR成像技术,实现在标准硬件上的实时或交互式应用。
- 在受限计算预算下评估最先进多帧HDR融合方法的性能。
- 从PSNR、运行时间和MAC操作数等方面比较不同模型的性能。
- 利用精心筛选的多曝光LDR图像数据集,建立HDR重建在保真度与效率方面的基准。
- 激发针对轻量化、高性能HDR解决方案的研究,以实现实际部署。
提出的方法
- 挑战赛使用包含1500个训练样本、60个验证样本和201个测试样本的数据集,每个样本包含三张LDR图像(短、中、长曝光)及对应的真值HDR图像。
- 参赛者通过与真值HDR图像的PSNR以及经过色调映射后的PSNR作为保真度指标进行评估。
- 通过乘加(MAC)操作数和运行时间(秒)来衡量复杂度,以确保低复杂度约束。
- 定义了两个赛道:赛道1在固定MAC操作数限制下最大化PSNR;赛道2在超过基线PSNR的前提下最小化复杂度。
- 模型涵盖轻量级U-Net变体、注意力机制、Swin Transformer和基于小波的网络,强调效率与特征融合。
- 训练数据源自配备半透明镜面的高端双相机系统,噪声通过像素测量模型进行建模。
实验结果
研究问题
- RQ1在多帧融合中,HDR重建保真度与计算复杂度之间的权衡关系如何?
- RQ2哪些深度学习架构在严格限制MAC操作数和运行时间的前提下实现了最高PSNR?
- RQ3注意力机制与基于Transformer的设计在低复杂度HDR重建中与CNN相比表现如何?
- RQ4轻量化、移动端友好的模型是否能在复杂度约束下超越更重的网络在保真度上的表现?
- RQ5在PSNR和效率方面,最先进模型与基线方法之间的性能差距如何?
主要发现
- 表现最佳的方法ALONG实现了39.417(直接)和37.424(经色调映射)的PSNR,仅消耗198.47 GMACs和0.324秒运行时间。
- VAlgo团队实现了最低运行时间(0.061秒),PSNR为37.888(直接)和36.723(经色调映射),使用175.25 GMACs。
- antins_cv团队以0.185秒的极短运行时间实现了第二高的PSNR(38.607),消耗198.38 GMACs。
- 多个团队(包括AdeTeam和WorkFromHome)在PSNR超过38.0的前提下,MAC操作数低于200,推理时间低于0.2秒。
- 挑战赛表明,基于注意力机制和轻量级U-Net的架构可在低复杂度下实现高保真度,其效率优于标准CNN。
- 结果表明,即使在严格计算限制下,利用现代架构实现高效HDR重建是可行的。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。