[论文解读] Dynamic Scale Inference by Entropy Minimization
该论文提出在推理阶段进行迭代的无监督优化,以提升语义分割中动态尺度推理的性能。通过联合优化任务参数和尺度参数来最小化预测熵,该方法在极端尺度变化下相比前馈动态推理实现了更高的准确率和更好的泛化能力。
Given the variety of the visual world there is not one true scale for recognition: objects may appear at drastically different sizes across the visual field. Rather than enumerate variations across filter channels or pyramid levels, dynamic models locally predict scale and adapt receptive fields accordingly. The degree of variation and diversity of inputs makes this a difficult task. Existing methods either learn a feedforward predictor, which is not itself totally immune to the scale variation it is meant to counter, or select scales by a fixed algorithm, which cannot learn from the given task and data. We extend dynamic scale inference from feedforward prediction to iterative optimization for further adaptivity. We propose a novel entropy minimization objective for inference and optimize over task and structure parameters to tune the model to each input. Optimization during inference improves semantic segmentation accuracy and generalizes better to extreme scale variations that cause feedforward dynamic inference to falter.
研究动机与目标
- 解决前馈动态推理在测试阶段处理极端尺度变化时的局限性。
- 克服训练与测试尺度之间存在的泛化差距,尤其是在测试输入显著大于训练数据时。
- 开发一种在推理时自适应调整模型参数的方法,而无需改变训练过程或网络架构。
- 通过引入自顶向下的反馈优化,提升对分布外尺度变化的鲁棒性和准确性。
- 证明在推理阶段对模型参数进行迭代优化,可超越基于单步预测的动态自适应方法。
提出的方法
- 提出一种基于最小化模型预测熵的无监督推理目标,以促进产生更自信、更稳定的输出。
- 在推理过程中同时优化两组参数:用于像素级分类的任务参数,以及用于动态高斯感受野自适应的结构参数。
- 利用熵目标对这些参数进行迭代梯度更新,实现在每个输入基础上对模型的自顶向下优化。
- 保持原始模型架构和训练过程不变,仅在测试时应用优化,以针对每个输入微调自定义模型。
- 采用动态高斯感受野模型作为尺度自适应的基础,支持图像内局部尺度的变化。
- 通过允许每个输入的优化步数可变,实现计算成本与模型容量的解耦。
实验结果
研究问题
- RQ1在极端尺度偏移下,推理阶段的迭代优化是否能超越前馈动态推理的泛化性能?
- RQ2作为无监督目标的熵最小化如何增强对分布外尺度变化的鲁棒性?
- RQ3与仅优化单一参数相比,联合优化任务参数和尺度参数在推理阶段有何影响?
- RQ4在训练与测试尺度匹配的情况下,推理时优化在多大程度上能改进分布内数据的预测?
- RQ5与理想模型和对抗基线相比,该方法在可实现性能边界上的表现如何?
主要发现
- 在PASCAL VOC数据集上,该方法在3×测试尺度下达到62.3 mIoU,显著优于前馈动态基线(59.8 mIoU),并展现出更强的尺度偏移鲁棒性。
- 在分布内测试(1×)中,该方法相比前馈基线将mIoU提升了约1个百分点(70.6 vs. 69.8),表明即使在分布内也存在有效优化。
- 消融实验表明,同时优化得分和尺度参数可获得最佳性能,而仅优化其一则导致准确率下降。
- 定性结果表明,该方法能有效修正分布外尺度设置下的噪声、过度分割片段和假阴性。
- 理想优化方法在3×尺度下达到77.7 mIoU,表明动态推理仍有进一步提升空间,但该方法显著缩小了与理想性能的差距。
- 对抗基线表明,即使存在有害优化的风险,该方法仍保持有效性,证实其对优化引起的性能退化具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。