[论文解读] 2rd Place Solutions in the HC-STVG track of Person in Context Challenge 2021
该论文提交了2021年人类上下文挑战赛HC-STVG赛道的第二名解决方案,实现了0.30025的vIoU。该方法结合了YOLOv5与FastReID进行人体检测与重识别,利用自然语言处理(NLP)提取外观属性(性别、衣物颜色、类型),并通过带有多任务学习的跨模态Transformer实现时空定位,包括一个性别分类分支和辅助的管状结构修剪损失。
In this technical report, we present our solution to localize a spatio-temporal person in an untrimmed video based on a sentence. We achieve the second vIOU(0.30025) in the HC-STVG track of the 3rd Person in Context(PIC) Challenge. Our solution contains three parts: 1) human attributes information is extracted from the sentence, it is helpful to filter out tube proposals in the testing phase and supervise our classifier to learn appearance information in the training phase. 2) we detect humans with YoloV5 and track humans based on the DeepSort framework but replace the original ReID network with FastReID. 3) a visual transformer is used to extract cross-modal representations for localizing a spatio-temporal tube of the target person.
研究动机与目标
- 通过利用自然语言描述中提取的详细人体外观属性,提升未剪辑视频中的时空视频定位性能。
- 通过焦点损失和语言编码器冻结,缓解管状结构-句子匹配中的类别不平衡与过拟合问题。
- 通过引入一个基于外观线索的性别分类分支,增强视觉特征学习。
- 通过联合分类、回归与修剪的多任务跨模态Transformer,实现高精度定位。
提出的方法
- 使用NLP技术(包括正则匹配、关键词提取和句法分析)从文本描述中提取人体外观属性(性别、衣物颜色、类型)。
- 使用PySceneDetect在场景边界处将视频分割为片段,然后通过YOLOv5检测和DeepSort跟踪生成管状结构提议,其中FastReID替代原始ReID网络。
- 应用带有视觉与语言模态独立编码器的跨模态Transformer,并通过交叉注意力机制将管状结构提议与句子查询对齐。
- 在视觉编码器输出处引入一个性别分类分支,以监督基于外观的表征学习。
- 使用多任务损失函数,结合焦点损失(用于全局匹配)、交叉熵损失(用于性别与帧分类)和IoU损失(用于帧回归),并将管状结构修剪作为辅助任务。
- 在测试阶段对管状轨迹应用高斯平滑,并过滤掉低质量或重叠的提议。
实验结果
研究问题
- RQ1从自然语言中提取的人体外观属性在未剪辑视频的时空定位中能起到多大作用?
- RQ2在HC-STVG设置下,用FastReID替换ReID主干网络在管状结构跟踪性能上能提升多少?
- RQ3与仅分类的标准模型相比,包含性别与帧级分类的多任务学习框架是否能提升定位精度?
- RQ4使用焦点损失和语言编码器冻结在管状结构-句子匹配中如何缓解类别不平衡与过拟合问题?
- RQ5尽管在推理中不参与,包含辅助管状结构修剪分支对最终vIoU的影响如何?
主要发现
- 消融实验证明,结合焦点损失、语言编码器冻结与性别分类损失,可使vIoU从基线的0.2775提升至0.30025,最终获得第二名。
- 引入性别分类分支显著提升了模型性能,表明基线模型中对外观线索的利用仍不充分。
- 焦点损失有效缓解了正负管状结构-句子对之间严重的类别不平衡问题。
- 在训练期间冻结语言编码器可减少过拟合并提升泛化能力,且不降低性能。
- 尽管在推理中未使用,作为辅助任务训练的管状结构修剪分支可提升全局分类准确率。
- 最终模型实现了0.30025的vIoU,表明其在HC-STVG基准上表现优异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。