[论文解读] Pedestrian Detection aided by Deep Learning Semantic Tasks
该论文提出任务辅助卷积神经网络(TA-CNN),一种多任务深度学习框架,通过从外部分割数据集迁移场景属性,联合优化行人检测与语义属性——包括行人特定属性(如“携带背包”)和场景级属性(如“树”、“道路”)。通过在不同数据源间学习共享与非共享属性的高层表征,并使用自适应多任务损失函数,TA-CNN 在 Caltech 和 ETH 数据集上的漏检率分别降低了 17% 和 5.5%,优于当前最先进深度模型。
Deep learning methods have achieved great success in pedestrian detection, owing to its ability to learn features from raw pixels. However, they mainly capture middle-level representations, such as pose of pedestrian, but confuse positive with hard negative samples, which have large ambiguity, e.g. the shape and appearance of `tree trunk' or `wire pole' are similar to pedestrian in certain viewpoint. This ambiguity can be distinguished by high-level representation. To this end, this work jointly optimizes pedestrian detection with semantic tasks, including pedestrian attributes (e.g. `carrying backpack') and scene attributes (e.g. `road', `tree', and `horizontal'). Rather than expensively annotating scene attributes, we transfer attributes information from existing scene segmentation datasets to the pedestrian dataset, by proposing a novel deep model to learn high-level features from multiple tasks and multiple data sources. Since distinct tasks have distinct convergence rates and data from different datasets have different distributions, a multi-task objective function is carefully designed to coordinate tasks and reduce discrepancies among datasets. The importance coefficients of tasks and network parameters in this objective function can be iteratively estimated. Extensive evaluations show that the proposed approach outperforms the state-of-the-art on the challenging Caltech and ETH datasets, where it reduces the miss rates of previous deep models by 17 and 5.5 percent, respectively.
研究动机与目标
- 解决行人检测中困难负样本的挑战,例如在视觉上与行人相似的树干和电线杆。
- 克服深度学习模型主要学习中级特征、难以区分模糊正负样本的局限性。
- 利用行人与场景属性的高层语义表征,提升检测的鲁棒性与泛化能力。
- 通过从现有场景分割数据集迁移知识,减少对场景属性人工标注的依赖。
- 开发一个统一的深度学习框架,协调收敛速度不同且数据分布存在偏移的多个任务。
提出的方法
- 提出任务辅助卷积神经网络(TA-CNN),联合优化行人检测与辅助语义任务:行人属性(如“性别”、“背包”)和场景属性(如“树”、“竖直”)。
- 通过结构投影,将外部场景分割数据集(如 PASCAL VOC、Cityscapes)中的场景属性标注迁移至行人数据集,避免人工标注。
- 引入共享与非共享场景属性:共享属性(在多个数据集中共现)促进跨数据集表征学习,而非共享属性则增强特征多样性。
- 设计带有可学习任务重要性系数和共享网络参数的多任务目标函数,通过随机梯度下降进行优化,以平衡不同收敛速度与数据分布偏移问题。
- 在训练前,将场景数据集的样本投影到行人数据集的结构空间中,以减小领域差距。
- 使用加权多变量交叉熵损失函数,联合训练检测与语义属性预测,通过迭代估计任务权重与网络参数。
实验结果
研究问题
- RQ1来自辅助属性的高层语义表征是否能提升行人检测性能,特别是在区分困难负样本方面?
- RQ2如何在不人工标注场景属性的前提下,有效将现有场景分割数据集的知识迁移至行人检测任务?
- RQ3共享与非共享场景属性对学习在多样化数据分布下鲁棒且泛化性强的特征有何影响?
- RQ4当任务收敛速度不同且数据源统计分布各异时,如何有效协调多任务学习?
- RQ5与当前最先进深度学习模型及手工设计特征检测器相比,联合优化语义属性在多大程度上降低了漏检率?
主要发现
- 与先前深度学习模型相比,TA-CNN 在 Caltech-Test 数据集上的对数平均漏检率降低了 17%。
- 在 ETH 数据集上,TA-CNN 的漏检率比表现最佳的深度模型低 5.5%,最终对数平均漏检率为 34.99%。
- 仅整合行人属性即可使漏检率相比仅使用主检测任务降低 5.5%。
- 引入共享场景属性后,漏检率进一步降低 1.8%,再加入非共享属性后,漏检率额外降低 1.2%。
- 与手工特征方法 FisherBoost 和 Roerei 相比,TA-CNN 在漏检率降低方面分别提升了 9.8% 和 8.5%。
- 在 ETH 数据集上,TA-CNN 超过其他深度模型(包括 SDN 和 DBN-Mul)分别 5.5% 和 6% 的漏检率降低,且相比 MultiSDP 减少了 12.7% 的漏检率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。