Skip to main content
QUICK REVIEW

[论文解读] Implicit Warping for Animation with Image Sets

Arun Mallya, Ting-Chun Wang|arXiv (Cornell University)|Oct 4, 2022
Human Pose and Action Recognition被引用 8
一句话总结

本文提出了一种用于图像动画的隐式形变框架,通过单个跨模态注意力层,根据与驱动视频的对应关系,从多个源图像中选择并形变特征,实现了在单源和多源图像动画任务中的最先进性能,通过实现动态特征选择并避免显式光流预测,显著提升了性能。

ABSTRACT

We present a new implicit warping framework for image animation using sets of source images through the transfer of the motion of a driving video. A single cross- modal attention layer is used to find correspondences between the source images and the driving image, choose the most appropriate features from different source images, and warp the selected features. This is in contrast to the existing methods that use explicit flow-based warping, which is designed for animation using a single source and does not extend well to multiple sources. The pick-and-choose capability of our framework helps it achieve state-of-the-art results on multiple datasets for image animation using both single and multiple source images. The project website is available at https://deepimagination.cc/implicit warping/

研究动机与目标

  • 解决现有基于光流的图像动画方法在多源图像场景下因依赖显式逐源形变而表现受限的问题。
  • 通过利用多视角间互补的外观与姿态信息,实现基于源图像集合的高保真图像动画。
  • 构建一个统一框架,自然地从单源扩展到多源图像,无需架构重设计或临时修改。
  • 克服在平均来自多个源的形变特征时出现的特征错位与预测不一致问题。
  • 通过动态选择源集合中最合适的特征,实现在同身份与跨身份动作迁移中均达到更优的视觉质量。

提出的方法

  • 采用单个跨模态注意力层,从驱动图像计算查询(query),从源图像获取键(key)与值(value),实现特征的联合选择与形变。
  • 利用注意力得分隐式识别源图像与驱动图像之间的对应关系,避免显式光流估计。
  • 根据注意力权重从多个源图像中选择并组合特征,实现跨视角的“挑选与组合”机制。
  • 在形变特征与注意力模块之间引入残差连接,以保留结构细节并提升训练稳定性。
  • 引入可学习的键-值投影,以增强在某些源特征缺失或被遮挡时的特征共享能力。
  • 将关键点位置及其可见性强度表示为标量值,相比完整的雅可比矩阵,显著降低了表示复杂度。

实验结果

研究问题

  • RQ1是否能够通过统一框架在无需显式光流预测的前提下,同时在单源与多源图像设置中实现更优的图像动画质量?
  • RQ2与显式光流形变相比,通过跨模态注意力实现的隐式特征选择在视觉保真度与遮挡鲁棒性方面表现如何?
  • RQ3使用多源图像在多大程度上提升了动画质量,特别是在处理复杂外观(如眼睛颜色或背景纹理)时?
  • RQ4单个注意力层是否能有效处理在无逐图像光流监督条件下,跨多样化源图像的对应关系学习与特征形变?
  • RQ5在外观与动作解耦的跨身份动作迁移任务中,所提方法表现如何?

主要发现

  • 所提方法在多个数据集上均实现了单源与多源图像动画的最先进性能,多源设置下的用户偏好得分高达91.4%。
  • 在256×256分辨率的TalkingHead-1KH数据集上,相比基线FOMM方法,PSNR提升0.329,FID降低1.726,LPIPS减少0.009。
  • 消融实验表明,引入残差连接与可学习键/值投影可全面提升各项指标,FID从19.978降至18.252。
  • 视觉分析显示,该方法能通过从合适源图像中选择特征,正确保留眼睛颜色与背景纹理,而以往方法常产生幻觉或模糊输出。
  • 网络能够根据可见性与姿态自适应调整关键点强度值,即使在遮挡或极端视角下也能实现鲁棒的特征表示。
  • 通过利用多视角的互补特征,该方法减少了对幻觉生成的依赖,如图4所示,多个源区域持续为输出贡献特征,体现了稳定的特征借用模式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。