Skip to main content
QUICK REVIEW

[论文解读] ConfLab: A Data Collection Concept, Dataset, and Benchmark for Machine Analysis of Free-Standing Social Interactions in the Wild

Chirag Raman, Jose Vargas-Quiros|arXiv (Cornell University)|May 10, 2022
Human Mobility and Location-Based Analysis被引用 4
一句话总结

ConfLab 提出了一种新颖的、保护隐私的多模态数据采集框架,用于在真实社交场景中收集数据,通过顶部摄像头和可穿戴的九轴惯性测量单元(IMU)同步捕获48名参与者在真实会议中的高保真数据。该数据集为姿态估计、说话者检测和F-形态分析设立了新的基准,仅使用最少的音频和身体运动线索,即在关键点检测(AP75: 0.82)和说话者检测(AUC: 0.92)方面达到了最先进水平。

ABSTRACT

Recording the dynamics of unscripted human interactions in the wild is challenging due to the delicate trade-offs between several factors: participant privacy, ecological validity, data fidelity, and logistical overheads. To address these, following a 'datasets for the community by the community' ethos, we propose the Conference Living Lab (ConfLab): a new concept for multimodal multisensor data collection of in-the-wild free-standing social conversations. For the first instantiation of ConfLab described here, we organized a real-life professional networking event at a major international conference. Involving 48 conference attendees, the dataset captures a diverse mix of status, acquaintance, and networking motivations. Our capture setup improves upon the data fidelity of prior in-the-wild datasets while retaining privacy sensitivity: 8 videos (1920x1080, 60 fps) from a non-invasive overhead view, and custom wearable sensors with onboard recording of body motion (full 9-axis IMU), privacy-preserving low-frequency audio (1250 Hz), and Bluetooth-based proximity. Additionally, we developed custom solutions for distributed hardware synchronization at acquisition and time-efficient continuous annotation of body keypoints and actions at high sampling rates. Our benchmarks showcase some of the open research tasks related to in-the-wild privacy-preserving social data analysis: keypoints detection from overhead camera views, skeleton-based no-audio speaker detection, and F-formation detection.

研究动机与目标

  • 为解决在真实环境中分析非脚本化社交互动时缺乏高保真、生态有效且保护隐私的数据集的问题。
  • 推动对自然环境中细微社交动态的研究,如F-形态、说话者轮换和身体手势识别。
  • 克服以往数据集的局限性,包括姿态标注质量差、参与者数量少以及时间分辨率不足。
  • 建立一个由社区驱动的数据采集模式,将伦理考量整合到传感器设计与数据获取过程中。
  • 提供基于最少音频和完整身体运动数据的社交行为机器分析基准。

提出的方法

  • 部署了分布式传感器系统,包含八台1080p@60fps的顶部摄像头,以及配备九轴IMU、保护隐私的1250 Hz音频采集和蓝牙距离追踪功能的定制可穿戴设备。
  • 通过自定义硬件同步协议,在多个传感器流之间实现了亚秒级的跨模态同步(约13 ms延迟)。
  • 使用高效的时间连续标注流程,对17个全身关键点和社交行为进行了连续、高频率的标注。
  • 秉持“由社区、为社区”的理念,招募了48名具有不同社交动机的真实会议参与者(如新参与者、资深人士、社交拓展者、熟人)。
  • 开发并评估了三个核心基准:自上而下的姿态估计、基于骨架的无音频说话者检测,以及从身体姿态中进行F-形态检测。
  • 应用了先进模型,包括RSN用于关键点检测,Minirocket用于基于IMU的说话者分类,以及GTCG/GCFF用于F-形态分析。

实验结果

研究问题

  • RQ1是否可以在不干扰自然行为的前提下,在真实社交环境中采集到高保真、保护隐私且生态有效的数据?
  • RQ2在非受控、真实场景下,仅从顶部摄像头视角能否实现对身体关键点的准确检测?
  • RQ3仅使用身体运动(IMU)和低带宽音频,能否有效预测说话者状态,而无需直接获取面部或语音数据?
  • RQ4是否能仅从全身姿态数据中可靠地检测出F-形态配置,而无需依赖面部或音频线索?
  • RQ5多模态传感器的融合在多大程度上提升了自然环境中社交行为分析的准确性?

主要发现

  • ConfLab数据集在仅使用顶部摄像头视角进行17个关键点检测时,平均精度(AP75)达到0.82,表明即使在自上而下的视角下也表现出色。
  • 仅使用IMU数据进行说话者状态检测的AUC达到0.92,证明身体运动本身足以有效识别说话轮次,而无需音频或面部视觉数据。
  • 使用GTCG和GCFF方法进行F-形态检测,在多台摄像头上的平均F1分数超过0.75,证明社会互动的几何结构可从姿态数据中可靠推断。
  • 增加下肢关键点显著提升了关键点检测性能,AP75从0.75提升至0.82,表明腿部运动对姿态估计具有重要贡献。
  • 系统实现了亚秒级的跨模态同步(约13 ms延迟),支持对社交互动进行精细的时间分析。
  • 该数据集能够支持复杂的社交动态,如群体的分裂与合并,真实记录了48名参与者在真实环境中的多样社交动机。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。