[论文解读] Regularizing Reasons for Outfit Evaluation with Gradient Penalty
本文提出了一套时尚穿搭评估系统,能够生成与人类判断一致的、属性特定的解释,准确判断穿搭为‘好’、‘一般’或‘差’。该方法采用梯度惩罚正则化类似Grad-CAM的显著性图,使模型提供的理由与专家标注的解释对齐,在包含18,108对穿搭的新型EVALUATION3数据集上实现了高精度与高可解释性。
In this paper, we build an outfit evaluation system which provides feedbacks consisting of a judgment with a convincing explanation. The system is trained in a supervised manner which faithfully follows the domain knowledge in fashion. We create the EVALUATION3 dataset which is annotated with judgment, the decisive reason for the judgment, and all corresponding attributes (e.g. print, silhouette, and material \etc.). In the training process, features of all attributes in an outfit are first extracted and then concatenated as the input for the intra-factor compatibility net. Then, the inter-factor compatibility net is used to compute the loss for judgment. We penalize the gradient of judgment loss of so that our Grad-CAM-like reason is regularized to be consistent with the labeled reason. In inference, according to the obtained information of judgment, reason, and attributes, a user-friendly explanation sentence is generated by the pre-defined templates. The experimental results show that the obtained network combines the advantages of high precision and good interpretation.
研究动机与目标
- 开发一种穿搭评估系统,不仅能提供判断结果,还能提供与时尚领域专业知识一致的、令人信服的、属性特定的解释。
- 解决现有解释方法缺乏具体、与领域专家对齐的理由的问题,这些方法常产生模糊或不一致的解释。
- 通过梯度惩罚正则化模型的注意力机制,提升模型可解释性,使其注意力(理由)与人类标注的‘好’或‘差’判断理由对齐。
- 创建并发布一个新的基准数据集EVALUATION3,包含18,108对穿搭样本,标注了判断结果、决定性理由及属性(如颜色、图案、材质)。
- 证明模型在保持高判断准确率的同时,通过理由正则化显著提升了解释的保真度。
提出的方法
- 系统使用独立的网络从穿搭中的时尚单品中提取因子内兼容性特征(如颜色、图案、材质)。
- 将这些因子内特征拼接后输入因子间兼容性网络,输出最终的判断结果(好、一般、差)。
- 通过计算判断损失相对于因子内特征的梯度,使用基于梯度的显著性图追踪判断结果的原因,方法类似于Grad-CAM。
- 应用梯度惩罚正则化,使模型的注意力(理由)与专家标注的理由对齐,确保解释不仅显著,而且在语义上与人类判断一致。
- 采用贡献差异公式——具体为‘好/差’与‘一般’判断之间的正向贡献差异——来建模判断中的决定性因素。
- 通过预定义的决策树与基于模板的生成模块,将预测的判断、理由和属性转换为自然语言解释,提升用户友好性。
实验结果
研究问题
- RQ1能否训练深度学习模型,使其不仅能生成准确的穿搭搭配判断,还能生成语义上合理、属性特定的解释,并与专家知识对齐?
- RQ2如何对基于梯度的解释方法进行正则化,以确保模型提供的理由与人类标注的理由一致,而非产生任意或误导性的注意力图?
- RQ3在建模单个时尚属性对判断的贡献时,最优的公式是什么,特别是用于区分‘好/差’与‘一般’结果时?
- RQ4梯度惩罚正则化如何影响判断准确率与解释保真度之间的权衡?
- RQ5所提出的方法能否在实际应用中泛化,例如通过将模型输出作为相对兼容性评分,用于时尚推荐?
主要发现
- 所提方法在保持高判断准确率的同时,显著提升了模型生成理由与专家标注理由之间的对齐程度,如通过理由验证准确率衡量。
- 正向贡献差异公式在准确率与方差方面均优于其他公式,在消融实验中实现了最高的平均理由准确率。
- 梯度惩罚正则化有效对齐了模型解释与人类标注理由,尤其当使用交叉熵正则化形式时,在α = 1时实现了判断与理由准确率的最佳权衡。
- 当在‘好’穿搭中改变某一属性(如颜色或图案)时,模型能正确识别出变化因素,且解释随之相应调整,展示了其学习推理能力。
- 模型在不同正则化系数下均保持高性能,判断准确率在中等α值下稳定,理由准确率随α增加而上升,达到峰值后才开始下降。
- 可通过将判断logits缩放为相对兼容性评分,将模型适配于推荐系统,实现其在时尚推荐流程中的实际部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。