Skip to main content
QUICK REVIEW

[论文解读] Gated Domain-Invariant Feature Disentanglement for Domain Generalizable Object Detection

Haozhuo Zhang, Huimin Yu|arXiv (Cornell University)|Mar 22, 2022
Domain Adaptation and Few-Shot Learning被引用 4
一句话总结

本文提出了一种新型的门控域不变特征解耦方法(Gated Domain-Invariant Feature Disentanglement, GDIFD),用于域泛化目标检测,通过通道门控模块(Channel Gate Module, CGM)学习通道级门控信号,将域不变表征(DIR)与域特定表征(DSR)进行解耦。CGM生成近似二值的门控信号(接近0或1),以屏蔽仅属于DSR的通道,实现更清晰的通道级解耦,从而在标准基准上取得最先进性能。

ABSTRACT

For Domain Generalizable Object Detection (DGOD), Disentangled Representation Learning (DRL) helps a lot by explicitly disentangling Domain-Invariant Representations (DIR) from Domain-Specific Representations (DSR). Considering the domain category is an attribute of input data, it should be feasible for networks to fit a specific mapping which projects DSR into feature channels exclusive to domain-specific information, and thus much cleaner disentanglement of DIR from DSR can be achieved simply on channel dimension. Inspired by this idea, we propose a novel DRL method for DGOD, which is termed Gated Domain-Invariant Feature Disentanglement (GDIFD). In GDIFD, a Channel Gate Module (CGM) learns to output channel gate signals close to either 0 or 1, which can mask out the channels exclusive to domain-specific information helpful for domain recognition. With the proposed GDIFD, the backbone in our framework can fit the desired mapping easily, which enables the channel-wise disentanglement. In experiments, we demonstrate that our approach is highly effective and achieves state-of-the-art DGOD performance.

研究动机与目标

  • 通过实现域不变表征(DIR)与域特定表征(DSR)之间更清晰的解耦,提升域泛化目标检测(DGOD)性能。
  • 解决现有深度表示学习(DRL)方法依赖堆叠卷积但无法保证DSR专属通道分配的局限性。
  • 利用域类别作为属性,显式将特定通道分配给DSR,从而在通道维度上实现更有效的解耦。
  • 通过轻量级、可训练的门控机制强制实现二值化通道选择,从而获得更优的DGOD性能。

提出的方法

  • 引入通道门控模块(CGM),输出受约束的通道级门控信号 $ S_{di} $,使其接近0或1,通过一种新型门控损失实现。
  • 通过逐元素乘法将门控信号应用于主干特征 $ F_b $,以屏蔽专用于域特定信息的通道。
  • CGM 初始化为接近1的值,以鼓励最小化DSR通道的使用,从而促进DIR的高效学习。
  • 提出一种门控损失,以强制门控信号呈现二值化行为,确保通道被唯一分配给DIR或DSR。
  • 采用对抗对齐进一步促进DIR与DSR之间的独立性。
  • 框架采用共享主干网络,仅使用一个浅层编码器用于DIR,实现高效且可扩展的解耦。

实验结果

研究问题

  • RQ1通过可学习的二值化门控信号,能否有效实现域不变与域特定特征的通道级解耦?
  • RQ2与传统注意力机制相比,强制门控信号接近0或1是否能显著提升特征解耦的质量?
  • RQ3轻量级通道门控机制能否在DGOD任务中超越复杂的多主干或基于重建的DRL方法?
  • RQ4特殊初始化与门控损失的结合如何影响CGM的性能与解耦质量?
  • RQ5所提出的GDIFD方法能否在无监督域自适应目标检测(UDAOD)设置中实现相当或更优的性能?

主要发现

  • 所提出的CGM在结合特殊初始化与门控损失时表现最佳,在B&C to F基准上达到38.3%的mAP,优于所有消融实验变体。
  • 若不使用门控损失,门控信号呈现灰度值(中间值),表明DIR与DSR之间存在纠缠,导致性能下降。
  • 当同时应用特殊初始化与门控损失时,模型在B&C to F设置中仅将一个通道分配给域分类任务,最大限度减少DSR干扰。
  • 消融研究证实,门控损失与特殊初始化对实现清晰的二值化通道门控与最优解耦均至关重要。
  • 在UDAOD设置中,GDIFD相较CFA(41.4% vs. 40.2%)将mAP提升1.2%,使用相同FCOS基线,证明其具有强大的迁移能力。
  • 该方法在多个DGOD基准上均达到最先进性能,验证了其有效性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。