[论文解读] Associative Embedding: End-to-End Learning for Joint Detection and Grouping
引入关联嵌入以在单阶段网络中联合训练检测和分组,在多人姿态估计(MPII 与 MS-COCO)上达到最新结果,并展示对实例分割的适用性。
We introduce associative embedding, a novel method for supervising convolutional neural networks for the task of detection and grouping. A number of computer vision problems can be framed in this manner including multi-person pose estimation, instance segmentation, and multi-object tracking. Usually the grouping of detections is achieved with multi-stage pipelines, instead we propose an approach that teaches a network to simultaneously output detections and group assignments. This technique can be easily integrated into any state-of-the-art network architecture that produces pixel-wise predictions. We show how to apply this method to both multi-person pose estimation and instance segmentation and report state-of-the-art performance for multi-person pose on the MPII and MS-COCO datasets.
研究动机与目标
- 将联合检测和分组作为一个单阶段问题来取代两阶段流程。
- 引入关联嵌入作为每个检测的标签,编码组身份。
- 演示如何端到端训练网络,预测检测热图和嵌入标签。
- 展示在多人姿态估计任务上的最新性能。
- 说明关联嵌入在实例分割中的适用性。
提出的方法
- 使用堆叠式小时glass网络为每个目标(如人体关节)预测检测热图和一维嵌入标签热图。
- 使用检测损失(热图上的MSE)和分组损失进行训练,鼓励同一组内的检测嵌入相似,不同组的嵌入不相似。
- 将每个组定义一个参考嵌入为其成员嵌入的平均值,并在组内距离上进行惩罚,同时将不同组之间的距离按指数方式拉开。
- 解码:提取峰值检测,检索它们的标签,通过标签相似性对检测进行分组,形成最终的多人姿态或对象实例。
- 通过在不同尺度对热图求平均并拼接尺度级标签,处理多尺度预测,以获得更丰富的嵌入。
- 将该方法应用于多人姿态估计以及实例分割,作为概念验证。
实验结果
研究问题
- RQ1能否在单阶段卷积神经网络中学习检测和分组,而不需要单独的后处理分组步骤?
- RQ2每个检测的嵌入标签是否能有效识别并分离组(如不同的人)在姿态估计和分割任务中的作用?
- RQ3多尺度评估和辅助的单人 refinements 对总体性能有何影响?
- RQ4关联嵌入是否可以超越姿态估计,广泛应用于实例分割等任务?
主要发现
- 在 MPII 多人(0.663 AP, 0.865 AP50, 0.727 AP75, 0.613 AP_M, 0.732 AP_L, 0.715 AR, 0.897 AR50, 0.772 AR75, 0.662 AR_M, 0.787 AR_L)上达到最新的 AP。
- 在 MS-COCO,使用多尺度评估加可选的单人 refine 后,在 test-dev 和 test-std 上取得具有竞争力的、最新的结果。
- 表明将检测与一个简单的嵌入标签相关联即可实现端到端的分组,无需单独的聚类或 CRF 步骤。
- 显示两个热图输出(检测热图和标记热图)就足以实现跨多个关节/类别的联合检测和分组。
- 证明主要瓶颈是检测质量而非分组,因为真实检测显著提升 AP(在消融中从 59.2 提升到 94.0)。
- 将相同的关联嵌入框架扩展到实例分割,作为概念验证,在 PASCAL VOC 2012 上取得了合理的 mAP。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。