Skip to main content
QUICK REVIEW

[论文解读] GA-DAN: Geometry-Aware Domain Adaptation Network for Scene Text Detection and Recognition

Fangneng Zhan, Chuhui Xue|arXiv (Cornell University)|Jul 23, 2019
Handwritten Text Recognition Techniques参考文献 74被引用 5
一句话总结

该论文提出GA-DAN,一种新颖的几何感知域自适应网络,可同时在几何与外观空间中建模域偏移,用于场景文本检测与识别。通过采用多模态空间学习和解耦循环一致性损失,GA-DAN在不同域之间生成高保真度的适配图像,在场景文本基准测试中实现最先进性能,识别任务中SVTP准确率达到51.7%,CUTE达到43.1%。

ABSTRACT

Recent adversarial learning research has achieved very impressive progress for modelling cross-domain data shifts in appearance space but its counterpart in modelling cross-domain shifts in geometry space lags far behind. This paper presents an innovative Geometry-Aware Domain Adaptation Network (GA-DAN) that is capable of modelling cross-domain shifts concurrently in both geometry space and appearance space and realistically converting images across domains with very different characteristics. In the proposed GA-DAN, a novel multi-modal spatial learning technique is designed which converts a source-domain image into multiple images of different spatial views as in the target domain. A new disentangled cycle-consistency loss is introduced which balances the cycle consistency in appearance and geometry spaces and improves the learning of the whole network greatly. The proposed GA-DAN has been evaluated for the classic scene text detection and recognition tasks, and experiments show that the domain-adapted images achieve superior scene text detection and recognition performance while applied to network training.

研究动机与目标

  • 解决现有无监督域自适应方法中缺乏对几何与外观空间域偏移的联合建模问题。
  • 克服当源域与目标域在几何失真(如透视、模糊)方面存在显著差异时,场景文本任务性能下降的问题。
  • 开发一种方法,能将源域场景文本图像真实地转换为多个目标域视角,同时保持语义与结构保真度。
  • 通过生成多样化的、域自适应的图像来提升训练泛化能力,使其更好地体现目标域特征。
  • 引入解耦循环一致性损失,以平衡几何与外观空间中的适应过程,提升训练稳定性和性能。

提出的方法

  • 提出一种多模态空间学习机制,对源图像应用多种空间变换(如透视、仿射变换),生成多样化的目标域类似视图。
  • 引入空间变换判别器,用于区分真实与伪造的空间变换,实现在几何空间中的对抗学习。
  • 设计一种解耦循环一致性损失,分别在外观空间与几何空间中强制一致性,避免两者之间的干扰。
  • 采用类似Cycle-GAN的框架,包含两个生成器(G_X 和 G_Y)与两个判别器(D_X 和 D_Y),其中G_X负责将源域映射到目标域,G_Y执行反向映射。
  • 使用薄板样条(TPS)进行灵活的空间变换建模,尤其适用于处理场景文本中的弯曲与透视失真。
  • 将生成的适配图像(来自多个空间视图)作为下游场景文本检测与识别模型的训练数据,提升泛化能力。

实验结果

研究问题

  • RQ1在域偏移条件下,同时在几何与外观空间中进行自适应是否能显著提升场景文本检测与识别性能?
  • RQ2通过为每张源图像生成多个目标域类似视图的多模态空间学习,是否能比单视图自适应带来更好的泛化性能?
  • RQ3解耦循环一致性损失是否能有效平衡并稳定几何与外观空间中的学习过程?
  • RQ4与CycleGAN、CyCADA和SimGAN等最先进域自适应方法相比,GA-DAN在处理场景文本数据中的几何差异方面表现如何?
  • RQ5使用GA-DAN进行域自适应,在小型目标域场景文本识别基准(如CUTE和SVTP)上能将性能提升到何种程度?

主要发现

  • GA-DAN采用1对10适配(GA-DAN [10 AD])在SVTP数据集上达到51.7%的准确率,显著优于基线方法(42.5%)以及SOTA方法如CyCADA(43.6%)和CycleGAN(43.0%)。
  • 解耦循环一致性损失(GA-DAN [WM])相比非解耦变体(GA-DAN [WD])在SVTP上提升3.1%准确率,证明其在平衡几何与外观学习方面的有效性。
  • GA-DAN [WA](仅使用空间变换,无外观适配)在SVTP上达到36.1%准确率,优于基线与随机变换基线,证明了精确空间建模的价值。
  • 多模态空间学习(每张图像10个视图)相比1对1适配(GA-DAN [10 AD] vs. GA-DAN [WM])进一步提升性能,表明多样化空间视图有助于增强模型泛化能力。
  • GA-DAN成功生成在几何(如透视、曲率)与外观(如模糊、光照)方面均逼真的图像,如图5所示视觉验证,而像CycleGAN等方法仅适配外观。
  • CoGAN与UNIT等方法因外观过度适配导致文本语义改变、可识别性下降,泛化能力受限,凸显了在自适应中引入几何感知的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。