[论文解读] Everything About You: A Multimodal Approach towards Friendship Inference in Online Social Networks
本文提出了一种多模态框架,通过结合图像、文本、话题标签、地理位置和现有好友关系,实现对在线社交网络中好友关系的推断。基于包含2200万条帖子的真实Instagram数据集,该多模态攻击在AUC上达到0.9以上,显著优于单模态方法,凸显了针对多维度数据滥用的全面隐私防护的必要性。
Most previous works in privacy of Online Social Networks (OSN) focus on a restricted scenario of using one type of information to infer another type of information or using only static profile data such as username, profile picture or home location. However the multimedia footprints of users has become extremely diverse nowadays. In reality, an adversary would exploit all types of information obtainable over time, to achieve its goal. In this paper, we analyse OSN privacy by jointly exploiting longterm multimodal information. We focus in particular on inference of social relationships. We consider five popular components of posts shared by users, namely images, hashtags, captions, geo-locations and published friendships. Large scale evaluation on a real-world OSN dataset shows that while our monomodal attacks achieve strong predictions, our multimodal attack leads to a stronger performance with AUC (area under the ROC curve) above 0.9. Our results highlight the need for multimodal obfuscation approaches towards protecting privacy in an era where multimedia footprints of users get increasingly diverse.
研究动机与目标
- 评估用户在在线社交网络中长期共享的集体多模态内容所引发的隐私风险。
- 探究结合多种模态——图像、文本、话题标签、地理位置和现有好友关系——是否能超越单模态方法,提升好友关系推断的性能。
- 开发并评估基于话题标签、图像和文本字幕的新型单模态攻击,用于好友关系推断。
- 设计并评估一种鲁棒的多模态融合框架,整合全部五个组件以最大化推断准确率。
- 展示多模态攻击在不同数据可用性和用户发帖行为下的鲁棒性与可扩展性。
提出的方法
- 提出三种新型单模态好友关系推断攻击:一种基于话题标签共现模式,一种利用基于自然语言处理的统计特征(如熵、频率)从字幕中提取,一种使用深度学习(ResNet)从图像中提取语义嵌入。
- 采用多模态融合机制,将来自所有五个组件——图像、文本、话题标签、地理位置和现有好友关系——的预测结果整合为单一、统一的推断模型。
- 使用真实世界Instagram数据集,包含来自两个城市的2200万条用户帖子,以在真实条件下训练和评估所有模型。
- 应用前沿技术:使用ResNet-50进行图像特征提取,使用TF-IDF和基于熵的特征进行文本处理,使用二分图嵌入技术进行话题标签分析。
- 采用ROC-AUC作为主要评估指标,用于比较单模态与多模态攻击的性能表现。
- 通过在不同数据可用性子集上进行测试,验证其鲁棒性,结果表明在组合多种模态时性能持续提升。
实验结果
研究问题
- RQ1话题标签共现模式是否能有效用于推断在线社交网络中的社交关系?
- RQ2当单独使用时,文本字幕和图像内容在好友关系推断中的贡献程度如何?
- RQ3与单模态方法相比,结合多种模态——图像、文本、话题标签、地理位置和现有好友关系——在多大程度上提升了好友关系推断的准确性?
- RQ4在多模态推断设置中,用户生成内容的哪些组成部分最具互补性?
- RQ5当每位用户共享的数据量不同时,多模态好友关系推断攻击的鲁棒性如何?
主要发现
- 基于话题标签的单模态攻击达到AUC 0.86,相比先前工作提升7个百分点,表现显著。
- 基于文本的攻击达到AUC 0.83,表明语言特征在好友关系推断中具有强大的预测能力。
- 基于图像的攻击达到AUC 0.637,证实视觉内容本身虽效果较弱,但仍是好友关系推断的可行信号。
- 多模态攻击结合全部五个组件,在洛杉矶数据集上达到AUC 0.92,显著超过最佳单模态结果(话题标签的0.8555)。
- 互补模态的融合带来显著的性能提升,每个新增组件均提高了整体推断准确率。
- 即使在数据可用性有限的情况下,多模态攻击仍保持鲁棒性,表明其在多样化用户行为下具有实际威胁潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。