Skip to main content
QUICK REVIEW

[论文解读] Tracking Persons-of-Interest via Unsupervised Representation Adaptation

Shun Zhang, Jia‐Bin Huang|arXiv (Cornell University)|Oct 5, 2017
Face recognition and analysis参考文献 44被引用 6
一句话总结

本文提出了一种无监督表示自适应方法,用于在非约束视频中进行多人脸跟踪,通过利用时空和上下文约束微调预训练的CNN,生成视频特定的、具有判别性的面部特征。通过在自生成的训练样本上优化对称三元组损失,该方法在大幅外观变化的跨镜头场景中提升了人脸再识别性能,在电视情景喜剧和YouTube音乐视频数据集上达到了最先进水平。

ABSTRACT

Multi-face tracking in unconstrained videos is a challenging problem as faces of one person often appear drastically different in multiple shots due to significant variations in scale, pose, expression, illumination, and make-up. Existing multi-target tracking methods often use low-level features which are not sufficiently discriminative for identifying faces with such large appearance variations. In this paper, we tackle this problem by learning discriminative, video-specific face representations using convolutional neural networks (CNNs). Unlike existing CNN-based approaches which are only trained on large-scale face image datasets offline, we use the contextual constraints to generate a large number of training samples for a given video, and further adapt the pre-trained face CNN to specific videos using discovered training samples. Using these training samples, we optimize the embedding space so that the Euclidean distances correspond to a measure of semantic face similarity via minimizing a triplet loss function. With the learned discriminative features, we apply the hierarchical clustering algorithm to link tracklets across multiple shots to generate trajectories. We extensively evaluate the proposed algorithm on two sets of TV sitcoms and YouTube music videos, analyze the contribution of each component, and demonstrate significant performance improvement over existing techniques.

研究动机与目标

  • 解决在非约束视频(如电视情景喜剧和音乐视频)中,跨镜头多人脸跟踪时的大外观变化挑战。
  • 克服预训练CNN特征因训练与测试数据分布差异而导致的域偏移问题。
  • 开发一种无需人工身份标注即可学习视频特定、判别性人脸表征的方法。
  • 利用上下文和时空约束,提升跨镜头边界的人脸再识别与轨迹链接性能。
  • 在具有复杂镜头切换和外观变化的真实世界视频数据集上,验证该方法的有效性。

提出的方法

  • 利用时空和上下文约束,从给定视频中自动生成大量训练样本(包括正样本和负样本的人脸对)。
  • 在这些自生成样本上微调预训练的人脸CNN,以适应视频的特定视觉领域。
  • 提出一种对称三元组损失函数(SymTriplet),优化嵌入空间,使欧氏距离反映语义上的人脸相似性。
  • 应用层次聚类,利用自适应的判别性特征在镜头之间链接轨迹段,形成完整轨迹。
  • 利用主要角色在剧集间保持一致的事实,将一个剧集上自适应的特征迁移到其他剧集中,从而减少重新训练时间。
  • 采用Siamese/三元组网络架构,通过最小化人内距离和最大化人外距离,学习保持身份的表征。

实验结果

研究问题

  • RQ1无监督表示自适应是否能提升在具有大外观变化的非约束视频中的人脸再识别性能?
  • RQ2基于上下文和时空约束自生成的训练数据,在将预训练CNN适配到特定视频方面有多有效?
  • RQ3所提出的对称三元组损失函数是否比标准三元组损失带来更好的判别性特征学习?
  • RQ4与最先进技术相比,该方法在真实世界视频数据集上的多人脸跟踪性能提升程度如何?
  • RQ5在不牺牲性能的前提下,能否将自适应特征在同一系列的多个剧集之间迁移,以降低训练成本?

主要发现

  • 所提方法Ours-SymTriplet-Contx在电视情景喜剧数据集上达到66.7%的IDF1,优于先前最先进方法。
  • 在YouTube音乐视频数据集上,该方法达到64.8%的MOTA和69.6%的MOTA,展现出在具有挑战性的非约束序列中的强劲性能。
  • 该方法显著减少了身份切换(IDS)和碎片化(Frag),在情景喜剧数据集上IDS为802、Frag为2018,远低于基线方法的数值。
  • 利用在单集(BBT02)上自适应的特征进行迁移学习,可在其他剧集中实现66.3%的IDF1,表明自适应特征具有强大的泛化能力和可重用性。
  • 消融实验表明,上下文约束生成和对称三元组损失均对性能至关重要,二者同时移除会使IDF1下降超过5%。
  • 失败案例主要出现在单人镜头序列中,由于负样本不足,难以区分外貌相似的个体,表明需要多模态监督。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。