[论文解读] CrowdRev: A platform for Crowd-based Screening of Literature Reviews
CrowdRev 是一个基于众包和人工智能的平台,通过使用一种名为最短运行(Shortest Run, SR)的动态贝叶斯投票策略,加速并降低了系统性文献综述(SLRs)中文献筛选的时间与成本。该平台在极短时间内以极低成本实现了作者级别的分类准确率,同时自动放弃难以处理的案例,防止资源浪费。
In this paper and demo we present a crowd and crowd+AI based system, called CrowdRev, supporting the screening phase of literature reviews and achieving the same quality as author classification at a fraction of the cost, and near-instantly. CrowdRev makes it easy for authors to leverage the crowd, and ensures that no money is wasted even in the face of difficult papers or criteria: if the system detects that the task is too hard for the crowd, it just gives up trying (for that paper, or for that criteria, or altogether), without wasting money and never compromising on quality.
研究动机与目标
- 为应对系统性文献综述(SLRs)中手动筛选日益增长的负担与低效问题,此类筛选通常耗时数月,且存在遗漏相关研究的风险。
- 在保持与专家作者相当的分类准确率的同时,降低 SLR 筛选的时间与成本。
- 开发一种能够智能选择将哪些(论文,标准)对进行众包的系统,避免高成本或难以处理的决策。
- 通过记录标准、投票与决策逻辑,实现筛选过程的透明化,以支持可重现性与可审计性。
- 通过灵活的交互模式与可定制策略,同时支持非专家作者与高级研究人员。
提出的方法
- CrowdRev 使用一种基于贝叶斯推断的算法,称为最短运行(SR),根据当前投票结果与先验概率,估算某一标准是否适用于某篇论文的概率。
- 系统基于预期成本与决策置信度,动态选择下一个需查询的(论文,标准)对,优先选择有望快速且准确做出决策的组合。
- 系统估算每个标准的众包准确率,并利用该数据计算以较少投票数达成共识的概率,从而最小化成本。
- 通过定期的“蜜罐”测试与初始资格检查(如 70% 准确率或 SLR 认证徽章)来过滤低质量工作者。
- 作者可分阶段启动筛选,系统在投票进行过程中实时更新成本与准确率估计。
- 对于研究人员,平台支持对不同投票策略与标签聚合方法的实验,包括来自文献中的方法(如 Dawid-Skene、Whitehill)。
实验结果
研究问题
- RQ1基于众包的系统是否能在降低时间与成本的同时,实现与专家作者相当的分类准确率?
- RQ2系统如何智能地优先选择需众包的(论文,标准)对,以最小化成本并最大化决策速度?
- RQ3在面对模糊或难以分类的论文时,应采用何种机制以确保系统的鲁棒性?
- RQ4混合众包-AI 方法在多大程度上可提升 SLR 筛选的效率与可靠性?
- RQ5如何通过记录所有标准、投票与决策逻辑,使筛选过程具备透明性与可重现性?
主要发现
- CrowdRev 将 SLR 筛选的时间与成本分别缩短至数小时与作者成本的一小部分,同时保持高准确率。
- 系统可自动放弃无法以合理成本达成共识的案例,防止资源浪费,且不损害质量。
- 最短运行(SR)算法通过基于贝叶斯概率估计,优先处理高影响、低成本的(论文,标准)对,实现近乎即时的分类。
- 平台提供实时成本与准确率估计,使作者可分阶段投入,并在任何时间点停止。
- 系统通过记录所有标准、投票与决策逻辑,支持透明化,这些记录可作为已发表 SLR 的补充材料。
- 基于仿真的预算曲线使用户能够可视化不同策略与投资水平下的预期精确率与召回率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。