Skip to main content
QUICK REVIEW

[论文解读] RMGN: A Regional Mask Guided Network for Parser-free Virtual Try-on

Lin Chao, Zhao Li|arXiv (Cornell University)|Apr 24, 2022
Generative Adversarial Networks and Image Synthesis被引用 4
一句话总结

该论文提出RMGN,一种无需解析的虚拟试穿网络,通过自适应区域掩码显式融合参考人物与目标衣物的特征,消除原始衣物残留伪影。通过引入多级特征提取器和姿态感知损失,RMGN在高分辨率、复杂姿态设置下实现了最先进性能,其保真度与真实感均优于基于解析与无需解析的方法。

ABSTRACT

Virtual try-on(VTON) aims at fitting target clothes to reference person images, which is widely adopted in e-commerce.Existing VTON approaches can be narrowly categorized into Parser-Based(PB) and Parser-Free(PF) by whether relying on the parser information to mask the persons' clothes and synthesize try-on images. Although abandoning parser information has improved the applicability of PF methods, the ability of detail synthesizing has also been sacrificed. As a result, the distraction from original cloth may persistin synthesized images, especially in complicated postures and high resolution applications. To address the aforementioned issue, we propose a novel PF method named Regional Mask Guided Network(RMGN). More specifically, a regional mask is proposed to explicitly fuse the features of target clothes and reference persons so that the persisted distraction can be eliminated. A posture awareness loss and a multi-level feature extractor are further proposed to handle the complicated postures and synthesize high resolution images. Extensive experiments demonstrate that our proposed RMGN outperforms both state-of-the-art PB and PF methods.Ablation studies further verify the effectiveness ofmodules in RMGN.

研究动机与目标

  • 解决无需解析虚拟试穿方法中参考衣物残留伪影的长期问题。
  • 在不依赖人体解析的前提下,提升虚拟试穿中高分辨率图像的生成质量。
  • 增强模型在复杂人体姿态下的鲁棒性。
  • 设计一种生成器,显式融合人物与衣物的相关特征,同时抑制干扰特征。
  • 在无需解析标注的前提下,实现与基于解析方法相当或更优的性能。

提出的方法

  • 使用多级特征提取器分别从参考人物和目标衣物中提取高分辨率特征。
  • 从两个输入的特征中自适应生成区域掩码,以指导特征融合,替代传统解析需求。
  • 区域掩码通过强调目标衣物区域并抑制原始衣物特征,实现选择性融合。
  • 引入姿态感知损失,使模型聚焦于结构一致性与身体轮廓,提升在不同姿态下的泛化能力。
  • 生成器利用区域掩码以保留目标衣物图案与色彩的方式组合特征。
  • 模型通过对抗损失与感知损失进行端到端训练,结合循环一致性与假图像采样策略,提升训练稳定性。

实验结果

研究问题

  • RQ1无需解析的虚拟试穿方法能否在不依赖人体解析的情况下实现高保真结果?
  • RQ2在无需解析的VTON中,如何改进特征融合以消除参考人物衣物的残留伪影?
  • RQ3可学习的区域掩码能否有效替代分割图,用于引导虚拟试穿中的特征融合?
  • RQ4姿态感知损失在多大程度上能提升复杂人体姿态下虚拟试穿的泛化能力?
  • RQ5在高分辨率设置下,无需解析方法能否实现与基于解析方法相当或更优的性能?

主要发现

  • RMGN在VITON数据集(512×384)上取得9.93的Fréchet Inception Distance(FID)分数,优于最先进方法。
  • 消融实验表明,若移除区域掩码,原始衣物的黑色残留将变得明显,证实其在抑制伪影中的关键作用。
  • 姿态感知损失显著提升了结构一致性,尤其在复杂姿态下,定性对比结果清晰显示其优势。
  • 增加姿态感知损失中使用的假图像数量可进一步提升图像质量,证明其有效性。
  • 用户研究表明,在A/B测试中,RMGN生成的图像被评价为比基线方法更具真实感。
  • 区域掩码的可视化结果证实,其能自适应聚焦于目标衣物区域,并有效抑制原始衣物特征,即使在袖长与姿态变化下亦保持稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。