[论文解读] Feature Based Task Recommendation in Crowdsourcing with Implicit Observations
本文提出了两种新颖的任务推荐模型——基于特征的NNLS(Feat-Based-NNLS)与IFTS(IFTS)——用于公民科学众包平台,利用隐式的工作者-任务完成历史与显式任务特征(例如位置)进行推荐。通过建模工作者对任务特征的偏好,并在潜在空间中引入任务相似性,该方法显著优于基线模型,在真实世界的eBird数据集上,Feat-Based-NNLS的MPR得分达到5.68。
Existing research in crowdsourcing has investigated how to recommend tasks to workers based on which task the workers have already completed, referred to as {\em implicit feedback}. We, on the other hand, investigate the task recommendation problem, where we leverage both implicit feedback and explicit features of the task. We assume that we are given a set of workers, a set of tasks, interactions (such as the number of times a worker has completed a particular task), and the presence of explicit features of each task (such as, task location). We intend to recommend tasks to the workers by exploiting the implicit interactions, and the presence or absence of explicit features in the tasks. We formalize the problem as an optimization problem, propose two alternative problem formulations and respective solutions that exploit implicit feedback, explicit features, as well as similarity between the tasks. We compare the efficacy of our proposed solutions against multiple state-of-the-art techniques using two large scale real world datasets.
研究动机与目标
- 为解决由于任务发现效率低下导致的公民科学众包平台高延迟与低满意度问题。
- 通过整合隐式的工作者-任务交互(例如完成次数)与显式任务特征(例如位置),提升任务推荐的准确性。
- 建模工作者对任务特征的偏好,而非仅依赖历史完成数据或显式评分。
- 开发优化框架,相较于传统负信号假设,更有效地处理隐式反馈。
- 在大规模真实世界公民科学数据集(eBird)上,使用严格指标评估所提出的模型。
提出的方法
- 提出特征偏好模型(Feat-Based-NNLS),利用非负最小二乘法学习工作者对任务特征的偏好,最小化观测值与预测值之间加权误差,以实现任务完成次数的准确预测。
- 引入置信度加权矩阵 $ Q $,其中 $ q_{wi} = 1 + \beta \times c_{wi} $,以增强高置信度正向信号(已完成任务)的影响。
- 对工作者-特征偏好矩阵 $ X $ 施加非负性约束,通过交替优化求解 $ \text{argmin}_X \big\| (Y^T Q^w Y + \theta I) X - Y^T Q^w P_w \big\text{^2} $。
- 提出潜在因子模型(IFTS),联合学习工作者与任务的潜在因子 $ U $ 和 $ V $,并通过正则化项强制在潜在空间中使相似任务保持相似性。
- 定义任务相似度为 $ \text{sim}(t_i, t_j) = \frac{1}{1 + e^{-Y_i^T Y_j}} $,利用任务特征矩阵 $ Y $ 引导潜在因子对齐。
- 使用交替优化求解 $ U $ 和 $ V $,在正则化与相似性约束下,对两个矩阵均采用闭式更新。
实验结果
研究问题
- RQ1在任务推荐中引入显式任务特征(例如位置)是否能提升性能,相较于仅依赖隐式反馈的模型?
- RQ2使用非负最小二乘法建模工作者对任务特征的偏好,与传统协同过滤中假设未观察到的交互为负信号相比,表现如何?
- RQ3在潜在因子空间中强制相似任务保持相似性,能在多大程度上提升推荐准确性?
- RQ4所提出的模型——Feat-Based-NNLS与IFTS——在真实世界公民科学数据上与最先进基线模型相比表现如何?
- RQ5为何将未观察到的交互视为“负样本”的模型在此情境下表现不佳?如何能更优地建模隐式反馈?
主要发现
- Feat-Based-NNLS在eBird数据集上取得了最佳的平均百分位排名(MPR)得分5.68,显著优于所有基线模型。
- Implicit-ALS-Neg基线模型表现较差(MPR = 17.3),因其错误地将未观察到的交互建模为负向偏好,这在本情境下不成立。
- Feat-Based-Reg(正则化回归基线)的MPR得分为13.706,表明显式特征的整合可显著提升性能,优于仅依赖隐式反馈的模型。
- IFTS的MPR得分为6.87,表明在潜在空间中引入任务相似性可提升推荐质量,优于标准潜在因子模型。
- 精确率-召回率曲线分析表明,Feat-Based-NNLS在所有召回阈值下均能更稳定地将相关任务排在前排推荐结果中。
- 在 $ q_{wi} $ 中选择 $ \beta = 50 $ 作为置信度加权参数为最优,其能有效放大高完成次数信号,同时避免过拟合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。