[论文解读] Metadata-Based Detection of Child Sexual Abuse Material
本文提出了一种基于元数据的机器学习框架,通过文件路径检测儿童性虐待材料(CSAM),避免了对实际CSAM图像进行训练。利用字符级卷积神经网络(CNN),该模型实现了97%的准确率和94%的召回率,且在高置信度阈值下错误阳性率低至0.001,表现出对对抗性路径修改的强鲁棒性,并在开放数据集上展现出优异的泛化能力。
Child Sexual Abuse Media (CSAM) is any visual record of a sexually-explicit activity involving minors. CSAM impacts victims differently from the actual abuse because the distribution never ends, and images are permanent. Machine learning-based solutions can help law enforcement quickly identify CSAM and block digital distribution. However, collecting CSAM imagery to train machine learning models has many ethical and legal constraints, creating a barrier to research development. With such restrictions in place, the development of CSAM machine learning detection systems based on file metadata uncovers several opportunities. Metadata is not a record of a crime, and it does not have legal restrictions. Therefore, investing in detection systems based on metadata can increase the rate of discovery of CSAM and help thousands of victims. We propose a framework for training and evaluating deployment-ready machine learning models for CSAM identification. Our framework provides guidelines to evaluate CSAM detection models against intelligent adversaries and models' performance with open data. We apply the proposed framework to the problem of CSAM detection based on file paths. In our experiments, the best-performing model is based on convolutional neural networks and achieves an accuracy of 0.97. Our evaluation shows that the CNN model is robust against offenders actively trying to evade detection by evaluating the model against adversarially modified data. Experiments with open datasets confirm that the model generalizes well and is deployment-ready.
研究动机与目标
- 开发一种可部署的机器学习框架用于检测CSAM,避免因使用真实CSAM内容进行训练而带来的法律和伦理约束。
- 仅通过文件元数据(特别是文件路径)实现CSAM检测,使其适用于多种媒体类型和存储系统。
- 评估模型在对抗性文件路径修改下的鲁棒性,模拟犯罪分子的实际规避尝试。
- 确保在分布外的良性数据集上保持极低的错误阳性率,以支持在生产环境中的实际部署。
- 提供一个可重用的开源框架,用于在文件路径、搜索词和关键词等元数据上训练和评估CSAM检测模型。
提出的方法
- 该框架采用文本分类流程,将文件路径的字符级表示作为输入输入到机器学习模型中。
- 主要采用字符级卷积神经网络(char-CNN)作为模型架构,通过处理文件路径中的字符序列来检测与CSAM相关的模式。
- 训练流程包含多种文本表示技术和机器学习方法,模型评估在多种数据分布上进行。
- 通过生成模仿规避策略的修改后文件路径,执行对抗性测试,评估模型在真实攻击条件下的抗压能力。
- 在Common Crawl等开放的真实世界数据集上评估模型,使用分布外的良性文件路径来衡量泛化能力和错误阳性率。
- 通过调整决策阈值来平衡召回率与错误阳性率,高阈值(如0.95)可在Linux和Windows文件路径上实现低于0.001的错误阳性率。
实验结果
研究问题
- RQ1仅基于文件路径元数据训练的机器学习模型能否在避免使用CSAM图像数据的前提下,实现高准确率和低错误阳性率的CSAM检测?
- RQ2该模型在模拟犯罪分子规避行为的对抗性文件路径修改下,其鲁棒性如何?
- RQ3该模型在来自真实世界网络爬取的分布外良性文件路径上的泛化能力达到何种程度?
- RQ4在生产环境中,何种置信度阈值设置能实现召回率与错误阳性率之间的最佳权衡?
- RQ5所提出的框架能否被重用于其他基于元数据的CSAM检测任务,例如关键词或搜索词分类?
主要发现
- 表现最佳的模型——字符级CNN——在检测与CSAM相关的文件路径时,实现了97%的准确率和94%的召回率。
- 在0.95的置信度阈值下,该模型在分布外的良性数据集上,对Linux和Windows文件路径的错误阳性率均降至约0.001。
- 模型展现出强大的泛化能力,在Common Crawl数据集中不同分布的数据上均保持了极低的错误阳性率。
- 对抗性测试证实了模型的鲁棒性,即使在文件路径被修改以逃避检测的情况下,模型仍保持有效。
- 该框架实现了无需访问真实CSAM图像的可部署CSAM检测,显著降低了法律和伦理障碍。
- 该系统与媒体类型无关且可扩展,仅通过文件路径元数据即可快速扫描数千个文件存储系统。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。