[论文解读] A Corpus of Sentence-level Revisions in Academic Writing: A Step towards Understanding Statement Strength in Communication
本文引入了首个大规模的学术写作中句子级修订语料库,用于研究陈述强度的变化。通过从 arXiv 论文收集并标注了 386 对修订内容,作者发现其中 74.4% 涉及强度变化,人工标注者表现出中等一致性(Fleiss’ Kappa = 0.322),揭示了语言特征和领域特定术语如何影响科学传播中感知强度的关键见解。
The strength with which a statement is made can have a significant impact on the audience. For example, international relations can be strained by how the media in one country describes an event in another; and papers can be rejected because they overstate or understate their findings. It is thus important to understand the effects of statement strength. A first step is to be able to distinguish between strong and weak statements. However, even this problem is understudied, partly due to a lack of data. Since strength is inherently relative, revisions of texts that make claims are a natural source of data on strength differences. In this paper, we introduce a corpus of sentence-level revisions from academic writing. We also describe insights gained from our annotation efforts for this task.
研究动机与目标
- 为解决科学传播中陈述强度这一被研究不足的问题,该问题影响同行评审结果和公众认知。
- 创建一个大规模、公开可用的学术论文句子级修订语料库,以研究强度差异。
- 调查非专家标注者如何感知技术性陈述中的强度变化,揭示专家与公众理解之间的差异。
- 探讨语言特征(如缓和、具体性及领域术语)对感知陈述强度的影响。
- 为未来自动化检测强度变化及改善科学传播的研究提供支持。
提出的方法
- 从多版本 arXiv 论文中收集了 108,000 对句子级修订,筛选出有效且非平凡的修改。
- 在去除处理错误后,随机选取 1,000 对,使用 Amazon Mechanical Turk 进行标注,标注标签包括:更强、更弱、强度无变化、我无法判断。
- 应用 Fleiss’ Kappa 评估标注者间的一致性,仅关注具有绝对多数标签的样本(n=386)。
- 分析标注者评论,识别推理模式,如过度依赖具体性或对领域术语的感知。
- 采用保守的标注阈值以确保可靠性,舍弃无共识的样本。
- 进行定性分析,以发现偏见,例如长度或具体性影响感知强度,即使与逻辑强度无关。
实验结果
研究问题
- RQ1非专家标注者如何感知学术写作中技术性陈述的强度差异?
- RQ2缓和、具体性及领域术语等语言特征在多大程度上影响感知的陈述强度?
- RQ3非专家标注者在识别科学修订中强度变化时的一致性水平如何?
- RQ4约束和范围变化如何影响对陈述强度的感知,特别是在逻辑含义与直觉判断冲突时?
- RQ5标注者评论能否揭示可用于建模科学传播中陈述强度的可推广特征?
主要发现
- 在 386 对具有多数共识的修订对中,74.4% 被归类为强度变化,表明在学术写作过程中,陈述强度常被调整。
- Fleiss’ Kappa 在这 386 对样本中为 0.322,表明标注者间存在中等一致性,尽管任务复杂。
- 标注者经常将更具体的陈述标记为更强,即使具体性不影响逻辑强度,表明存在对细节的启发式偏见。
- 参与者常以不同于专家的方式解释领域术语(如 'vectors' 与 'images',或 'adapt' 与 'discover'),表明公众理解存在差距。
- 更长的陈述常被认为更强,即使附加内容在逻辑上无关,凸显了强度评估中的感知偏见。
- 标注者评论表明,'compelling evidence' 被视为强于 'compelling experimental evidence',暗示范围缩小可能被误认为强度增加。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。