[论文解读] Fashion-IQ 2020 Challenge 2nd Place Team's Solution
本文提出RTIC,一种新颖的多模态组合方法,通过在N个模块中使用通道注意力机制,基于文本条件学习目标与候选图像特征之间的残差。该方法结合图像和文本编码器(ResNet-101/152,LSTM/GRU搭配GloVe嵌入),通过使用贝叶斯优化对来自多种模型的相似度分数进行加权的迭代集成策略,在Fashion-IQ 2020挑战赛中取得第二名,测试得分为48.02。
This paper is dedicated to team VAA's approach submitted to the Fashion-IQ challenge in CVPR 2020. Given a pair of the image and the text, we present a novel multimodal composition method, RTIC, that can effectively combine the text and the image modalities into a semantic space. We extract the image and the text features that are encoded by the CNNs and the sequential models (e.g., LSTM or GRU), respectively. To emphasize the meaning of the residual of the feature between the target and candidate, the RTIC is composed of N-blocks with channel-wise attention modules. Then, we add the encoded residual to the feature of the candidate image to obtain a synthesized feature. We also explored an ensemble strategy with variants of models and achieved a significant boost in performance comparing to the best single model. Finally, our approach achieved 2nd place in the Fashion-IQ 2020 Challenge with a test score of 48.02 on the leaderboard.
研究动机与目标
- 通过将图像和文本模态有效组合到共享语义空间中,提升时尚图像检索性能。
- 利用文本条件化的注意力机制,建模目标与候选图像特征之间的残差差异。
- 通过结合多个独立模型并进行优化加权的迭代集成策略,提升检索性能。
- 在不使用外部数据集进行预训练的情况下,实现在Fashion-IQ 2020基准上的最先进性能。
提出的方法
- 提出RTIC,一种多模态组合器,通过N个模块中的通道注意力机制对目标与候选图像特征之间的残差进行建模,实现门控控制。
- 采用双分支编码器:图像使用ResNet-101/152,文本使用两层LSTM+GRU,词嵌入初始化为900维的GloVe向量。
- 应用三元组损失并结合困难负样本挖掘,使用AdamW优化器,并对图像和文本编码器分别进行学习率微调。
- 采用迭代集成过程,将最佳验证得分矩阵作为新候选,通过贝叶斯优化(hyperopt)确定最优权重。
- 通过知识蒸馏技术,将图像编码器与多模态组合器的输出与DeepFashion的现成图像检索特征对齐。
- 使用数据增强技术,包括随机水平翻转、仿射变换,以及将图像缩放至224×224并保持比例的填充。
实验结果
研究问题
- RQ1基于残差的多模态组合方法是否能在时尚图像检索中超越现有方法(如TIRG)?
- RQ2一种逐步将表现最佳的得分矩阵融入模型组合的迭代集成策略,其有效性如何?
- RQ3即使不进行预训练,通过结合多样化模型并进行优化加权,性能可提升至何种程度?
- RQ4使用混合文本编码器(LSTM + GRU)和更高维特征空间是否能提升检索准确率?
主要发现
- 使用RTIC的最佳单模型在验证集上达到38.22的平均召回率,显著优于基线RTIC(33.24)。
- 四种不同模型(仅文本、IR匹配、TIRG、RTIC)的集成在验证集上达到45.05,显示出模型多样性带来的显著性能提升。
- 通过迭代集成过程,验证得分从45.05提升至47.55,表明逐步引入最佳得分矩阵的有效性。
- 在将80%的验证对纳入训练并融合额外模型结果后,最终测试得分达到48.02,相比最佳单模型性能提升25.6%。
- 在集成过程中使用贝叶斯优化进行权重选择,对最大化测试性能至关重要。
- 尽管进行了超参数调优,使用其他损失函数(如SoftTriple、Multi-Similarity、Circle loss)并未带来性能增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。