[论文解读] CelebV-HQ: A Large-Scale Video Facial Attributes Dataset
本论文提出了CelebV-HQ,一个大规模、高质量的视频面部属性数据集,包含来自15,653位身份的35,666段视频剪辑,每段视频均人工标注了83项面部属性,涵盖外观、动作和情绪。该数据集在视频生成与面部属性编辑任务中显著提升了性能,证明其在面部相关视频应用中的时序建模与时空学习方面的价值。
Large-scale datasets have played indispensable roles in the recent success of face generation/editing and significantly facilitated the advances of emerging research fields. However, the academic community still lacks a video dataset with diverse facial attribute annotations, which is crucial for the research on face-related videos. In this work, we propose a large-scale, high-quality, and diverse video dataset with rich facial attribute annotations, named the High-Quality Celebrity Video Dataset (CelebV-HQ). CelebV-HQ contains 35,666 video clips with the resolution of 512x512 at least, involving 15,653 identities. All clips are labeled manually with 83 facial attributes, covering appearance, action, and emotion. We conduct a comprehensive analysis in terms of age, ethnicity, brightness stability, motion smoothness, head pose diversity, and data quality to demonstrate the diversity and temporal coherence of CelebV-HQ. Besides, its versatility and potential are validated on two representative tasks, i.e., unconditional video generation and video facial attribute editing. Furthermore, we envision the future potential of CelebV-HQ, as well as the new opportunities and challenges it would bring to related research directions. Data, code, and models are publicly available. Project page: https://celebv-hq.github.io.
研究动机与目标
- 解决面部相关视频任务中缺乏大规模、高质量且富含面部属性标注的视频数据集的问题。
- 克服在视频数据集构建过程中面临的规模、质量与全面属性标注方面的挑战。
- 提供一个多样化且时序连贯的视频数据集,以支持视频生成、编辑与面部分析领域的高级研究。
- 通过提供基准测试,推动视频特定任务(如无条件生成与面部属性编辑)的发展。
- 通过自然的面部动态与多样的三维几何结构,促进神经渲染与动态三维人脸建模的未来研究。
提出的方法
- 利用覆盖8,376个实体与3,717个动作的多语言维基百科查询,构建大规模原始数据池,以确保多样性与规模。
- 实施自动预处理流程,结合人脸检测与对齐工具,确保最小分辨率512×512、高保真度与时序一致性。
- 设计系统化的标注流程,结合训练有素的标注人员、自动化判断与质量检查,确保83项面部属性标注的准确性与效率。
- 将属性划分为40项外观属性、35项动作属性与8项情绪属性,全面描述随时间变化与不变的面部特征。
- 应用数据过滤与质量控制,保留真实世界的数据分布,同时保持高视觉质量与多样性。
- 通过基于时序建模技术的无条件视频生成与视频面部属性编辑基线实验,验证数据集的实用性。
实验结果
研究问题
- RQ1一个大规模、高质量的视频数据集,若配备丰富的面部属性标注,是否能提升视频生成与编辑任务的性能?
- RQ2CelebV-HQ中面部属性的时序连贯性与多样性相较于现有图像与视频数据集如何?
- RQ3在视频生成中,时序建模在多大程度上能从CelebV-HQ这类属性丰富的标注中获益?
- RQ4构建大规模视频数据集并进行细粒度属性标注面临哪些关键挑战,如何系统性地解决?
- RQ5CelebV-HQ如何推动神经渲染与动态三维人脸建模的新研究方向?
主要发现
- CelebV-HQ包含35,666段高分辨率视频剪辑(最小分辨率512×512),来自15,653个唯一身份,且对83项面部属性进行了全面的人工标注。
- 统计分析表明,该数据集在年龄、种族、亮度、运动平滑度、头部姿态与数据质量方面具有强大多样性,其时序连贯性与分布丰富性超过现有图像与视频数据集。
- 基线实验表明,将时序建模引入视频生成可显著提升性能,证明该数据集在学习时空动态方面的有效性。
- 在视频面部属性编辑任务中,使用CelebV-HQ实现了显著改进,证明其在解耦与可控视频编辑中的实用性。
- 当利用时序信息时,该数据集在无条件视频生成与属性编辑等任务中实现了最先进性能,优于基于图像的基线方法。
- CelebV-HQ通过提供自然的面部动态与多样的三维几何结构,支持未来在动态NeRF、可动画NeRF与多模态人脸分析方面的研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。