Skip to main content
QUICK REVIEW

[论文解读] 1st Place Solution to ICDAR 2021 RRC-ICTEXT End-to-end Text Spotting and Aesthetic Assessment on Integrated Circuit

Qiyao Wang, Pengfei Li|arXiv (Cornell University)|Apr 8, 2021
Handwritten Text Recognition Techniques参考文献 7被引用 5
一句话总结

本论文提出ICDAR 2021 RRC-ICTEXT挑战赛的第一名解决方案,采用基于YOLOv5的模型,在集成电路图像上实现端到端的文本检测与美学评估。该方法结合数据增强、合成数据生成、半监督学习、带掩码的蒸馏损失知识蒸馏,以及TensorRT推理部署,最终在任务3.1中取得59.1 mAP(排名第一),在任务3.2中取得78.7% F2分数(排名第一),推理速度达31 FPS,显存占用306MB。

ABSTRACT

This paper presents our proposed methods to ICDAR 2021 Robust Reading Challenge - Integrated Circuit Text Spotting and Aesthetic Assessment (ICDAR RRC-ICTEXT 2021). For the text spotting task, we detect the characters on integrated circuit and classify them based on yolov5 detection model. We balance the lowercase and non-lowercase by using SynthText, generated data and data sampler. We adopt semi-supervised algorithm and distillation to furtherly improve the model's accuracy. For the aesthetic assessment task, we add a classification branch of 3 classes to differentiate the aesthetic classes of each character. Finally, we make model deployment to accelerate inference speed and reduce memory consumption based on NVIDIA Tensorrt. Our methods achieve 59.1 mAP on task 3.1 with 31 FPS and 306M memory (rank 1), 78.7\% F2 score on task 3.2 with 30 FPS and 306M memory (rank 1).

研究动机与目标

  • 解决集成电路文本检测数据集中小写字母与非小写字母之间的类别不平衡问题。
  • 利用3,000张未标注样本的半监督学习方法,提升模型泛化能力与准确性。
  • 通过添加一个三分类头(用于模糊、低对比度与破损文本)将美学评估集成到检测流程中。
  • 优化推理速度与内存消耗,以满足任务3.1与3.2的3S评分标准,实现排名第一。
  • 使用NVIDIA TensorRT部署最终模型,以加速推理并降低内存占用,同时保持高精度。

提出的方法

  • 采用YOLOv5s作为学生模型,YOLOv5x作为教师模型,应用带掩码的蒸馏损失优先关注罕见类别。
  • 采用掩码知识蒸馏损失,定义为 $\text{loss}_{\text{distillation}} = \text{MSE}(f_t*\text{mask}, f_s*\text{mask}) + \text{KL}(f_{t-\text{cls}}, f_{s-\text{cls}})$,其中掩码聚焦于罕见类别且IoU较高的预测结果。
  • 利用白色字体的Windows字体与风格迁移技术生成合成小写字母,以平衡类别分布。
  • 实施重复因子采样(RFS)与数据增强(Mosaic、直方图均衡化、90°旋转)以提升模型鲁棒性。
  • 在验证集上使用带伪标签的加权集成预测(WBF)实现半监督学习。
  • 使用NVIDIA TensorRT部署最终的YOLOv5s模型,输入尺寸为672×672,批量大小为1,NMS阈值为0.1,以优化推理速度与内存占用。

实验结果

研究问题

  • RQ1在集成电路文本检测任务中,如何有效缓解小写字母与非小写字母之间的类别不平衡问题?
  • RQ2当仅有3,000张未标注样本时,半监督学习在多大程度上能提升模型性能?
  • RQ3是否可以通过统一的检测与分类头,有效同时预测字符识别结果与图像美学质量?
  • RQ4与标准蒸馏相比,使用类别感知掩码的知识蒸馏如何提升小型学生模型的性能?
  • RQ5在实际部署中,模型大小、推理速度与精度之间存在何种权衡?如何实现最优优化?

主要发现

  • 最终模型在任务3.1中实现59.1 mAP,推理速度达31 FPS,显存占用306MB,获得基准测试排名第一。
  • 在任务3.2中,模型实现78.7% F2分数,推理速度为29.68 FPS,显存占用305.88MB,同样排名第一。
  • 采用掩码的知识蒸馏使YOLOv5s在验证集上的mAP从58.5%提升至59.4%,优于标准蒸馏方法。
  • 合成数据生成使小写字母数量增加4.4k个,显著提升了罕见类别的平均精度(AP)。
  • TensorRT部署将显存消耗从745.75MB(PyTorch)降低至305.88MB,推理速度从25.45 FPS提升至31.04 FPS(任务3.1)。
  • 任务3.1的3S得分为0.74,任务3.2为0.85,表明在速度、模型大小与精度之间实现了卓越的综合优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。