[论文解读] Towards a responsible machine learning approach to identify forced labor in fisheries
本文提出一种负责任的机器学习方法,利用正样本-未标记样本学习(positive-unlabeled learning)分析船舶特征和自动识别系统(AIS)移动模式,以识别渔业中的强迫劳动。该模型在已报告的强迫劳动案例中实现了89%的召回率,在获得体面工作条件认证的船舶中实现了98%的特异性,估计多达28%的船舶可能使用强迫劳动,尤其集中在鱿鱼延绳钓和长线渔船队中。
Many fishing vessels use forced labor, but identifying vessels that engage in this practice is challenging because few are regularly inspected. We developed a positive-unlabeled learning algorithm using vessel characteristics and movement patterns to estimate an upper bound of the number of positive cases of forced labor, with the goal of helping make accurate, responsible, and fair decisions. 89% of the reported cases of forced labor were correctly classified as positive (recall) while 98% of the vessels certified as having decent working conditions were correctly classified as negative. The recall was high for vessels from different regions using different gears, except for trawlers. We found that as much as ~28% of vessels may operate using forced labor, with the fraction much higher in squid jiggers and longlines. This model could inform risk-based port inspections as part of a broader monitoring, control, and surveillance regime to reduce forced labor. * Translated versions of the English title and abstract are available in five languages in S1 Text: Spanish, French, Simplified Chinese, Traditional Chinese, and Indonesian.
研究动机与目标
- 解决由于检查有限和报告不可靠而导致的渔业中强迫劳动识别关键缺口。
- 开发一种机器学习模型,利用现有船舶数据估算强迫劳动案例的上限。
- 通过纳入负样本和多样化船舶类型(包括不同船旗国和渔具类型)提升模型的公平性和可靠性。
- 通过数据驱动的风险优先排序,支持港口检查和监测、控制与监督(MCS)制度。
- 通过在不同船舶群体中评估模型表现并最小化分类结果中的偏差,确保负责任的人工智能实践。
提出的方法
- 采用正样本-未标记样本(PU)学习方法,基于21起确认的正样本案例和66,336个未标记的船舶年数据进行训练,避免依赖完全标注的负样本数据。
- 将船舶特征(如船旗国、渔具类型、尺寸)和移动模式(如过驳作业、港口停靠、海上停留时间)作为模型特征,这些特征源自自动识别系统(AIS)数据。
- 采用监督学习框架结合PU学习算法,基于船舶的行为和结构特征估算强迫劳动的概率。
- 通过已知的获得体面工作条件认证的船舶作为负样本的代理,验证模型性能,确保高特异性。
- 对不同船旗国和渔具类型进行公平性评估,以评估模型在召回率和精确率方面的差异。
- 通过新检查数据和扩展的船舶类别持续更新和优化模型,以提高泛化能力并减少偏差。
实验结果
研究问题
- RQ1能否利用AIS数据和船舶特征,通过正样本-未标记样本机器学习模型有效估算全球渔船队中强迫劳动的上限?
- RQ2模型性能在不同船旗国和渔具类型之间如何变化,特别是在召回率和公平性方面?
- RQ3在缺乏确认负样本标签的情况下,AIS导出的移动模式和船舶特征在多大程度上可预测强迫劳动行为?
- RQ4此类模型如何支持基于风险的港口检查,并改善监测、控制与监督(MCS)系统?
- RQ5模型在不同地区和渔具类型之间性能差异的后果,对公平执法和政策实施意味着什么?
主要发现
- 模型在识别已知强迫劳动案例方面实现了89%的召回率,表明其对报告事件具有强大的检测能力。
- 模型表现出98%的特异性,正确将98%的获得体面工作条件认证的船舶分类为非强迫劳动案例。
- 大多数船舶类型和地区的召回率较高,但拖网渔船的性能明显较低。
- 估计约28%的捕鱼船舶可能使用强迫劳动,其中鱿鱼延绳钓和长线渔船队的比率显著更高。
- 模型性能因渔具类型而异,长线和鱿鱼延绳钓船舶检测到的风险更高,表明针对性的检查策略可能有效。
- 公平性评估揭示了不同船旗国和渔具类型之间模型性能的差异,凸显了持续监控偏差和优化模型的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。