[论文解读] RenderMe-360: A Large Digital Asset Library and Benchmarks Towards High-fidelity Head Avatars
RenderMe-360 引入了一个大规模、高保真的4D数字资产库,包含来自500种不同身份的超过2.43亿帧头部图像,通过60台同步的2K工业相机以30 FPS拍摄。该数据集支持在五个关键任务上对16种SOTA方法进行全面基准测试——新视角合成、新表情生成、毛发渲染、编辑以及说话头像生成,揭示了当前模型在多样化真实世界条件下鲁棒性和泛化能力方面的关键缺陷。
Synthesizing high-fidelity head avatars is a central problem for computer vision and graphics. While head avatar synthesis algorithms have advanced rapidly, the best ones still face great obstacles in real-world scenarios. One of the vital causes is inadequate datasets -- 1) current public datasets can only support researchers to explore high-fidelity head avatars in one or two task directions; 2) these datasets usually contain digital head assets with limited data volume, and narrow distribution over different attributes. In this paper, we present RenderMe-360, a comprehensive 4D human head dataset to drive advance in head avatar research. It contains massive data assets, with 243+ million complete head frames, and over 800k video sequences from 500 different identities captured by synchronized multi-view cameras at 30 FPS. It is a large-scale digital library for head avatars with three key attributes: 1) High Fidelity: all subjects are captured by 60 synchronized, high-resolution 2K cameras in 360 degrees. 2) High Diversity: The collected subjects vary from different ages, eras, ethnicities, and cultures, providing abundant materials with distinctive styles in appearance and geometry. Moreover, each subject is asked to perform various motions, such as expressions and head rotations, which further extend the richness of assets. 3) Rich Annotations: we provide annotations with different granularities: cameras' parameters, matting, scan, 2D/3D facial landmarks, FLAME fitting, and text description. Based on the dataset, we build a comprehensive benchmark for head avatar research, with 16 state-of-the-art methods performed on five main tasks: novel view synthesis, novel expression synthesis, hair rendering, hair editing, and talking head generation. Our experiments uncover the strengths and weaknesses of current methods. RenderMe-360 opens the door for future exploration in head avatars.
研究动机与目标
- 解决AR/VR和元宇宙中人类头部虚拟形象研究领域缺乏大规模、多样化且高保真4D数据集的问题。
- 克服现有数据集规模小、属性多样性狭窄(如年龄、种族、表情、配饰)以及标注稀疏的局限性。
- 支持在新视角合成、表情迁移和说话头像生成等下游任务上的全面基准测试。
- 通过统一的、公开可获取的、具备丰富多模态标注的数据集,促进鲁棒且泛化能力强的头部虚拟形象生成与编辑模型的发展。
- 利用细粒度、多层次的标注,支持下一代文本到3D头部生成、逆向渲染以及跨模态虚拟形象合成的研究。
提出的方法
- 部署自研高端数据采集系统POLICY,利用60台同步的2K工业相机,在30 FPS下以高保真度和几何精度捕捉360°人像数据。
- 采集500名多样化受试者的数据,涵盖不同年龄、种族、文化背景及表达行为,包括12种峰值表情、42段双语演讲,以及每位受试者最多12种发型。
- 生成丰富、多粒度的标注:2D/3D面部关键点、背景抠图、3D头部扫描、FLAME拟合、同步音频,以及每帧的文本描述。
- 构建全面的基准测试,评估16种前沿方法在五个核心任务上的表现:新视角合成、新表情合成、毛发渲染、发型编辑和说话头像生成。
- 在文本到3D生成实验中,结合几何先验(如3D扫描)和文本引导(如CLIP),采用Latent-NeRF和TEXTure等方法进行测试。
- 使用标准化的数据处理流程,包括关键点检测、人脸分割和视频剪裁,以确保训练和评估过程中的一致性与准确性。
实验结果
研究问题
- RQ1在大规模、高保真的4D数据集中,当前SOTA头部虚拟形象生成模型在多样化身份、表情和头部姿态下的表现如何?
- RQ2现有方法在复杂属性(如多样化发型、化妆和配饰)上的泛化能力如何?
- RQ3当应用于高保真、多样化头部虚拟形象时,当前的重建与编辑技术(如PTI、HyperStyle)存在哪些局限性?
- RQ4仅使用文本提示,文本到3D生成模型能否生成逼真的真人头部,尤其是在结合几何先验的情况下?
- RQ5不同多模态先验(如扫描数据、音频、关键点)如何影响生成头部虚拟形象的质量与一致性?
主要发现
- SOTA方法如PTI和HyperStyle在重建任务中表现强劲,但在下游编辑任务中泛化能力较差,尤其在复杂条件下表现不佳。
- TEXTure在文本到3D头部生成任务中优于Latent-NeRF和Dream Fields,生成结果更具真实感和细节,归因于其深度到图像扩散与基于网格的纹理映射技术。
- 尽管使用了几何先验和文本引导,Latent-NeRF在细粒度纹理生成方面仍表现不佳,表明将文本提示嵌入神经隐式场存在瓶颈。
- Dream Fields 仅靠文本提示无法生成完整的3D头部模型,凸显其在复杂人类头部几何结构泛化能力上的局限性。
- 基准测试表明,当前模型在化妆、配饰和非中性表情等多样化属性上缺乏鲁棒性,凸显了提升泛化能力与数据效率的迫切需求。
- RenderMe-360 首次实现了在多任务与多属性下对头部虚拟形象模型的全面评估,揭示了在真实感、多样性与可编辑性方面存在的关键缺陷,未来研究亟需弥补这些差距。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。