[论文解读] CHQ-Summ: A Dataset for Consumer Healthcare Question Summarization
本文介绍了CHQ-Summ,一个包含1,507个消费者医疗健康问题的新数据集,附有专家标注的摘要、问题焦点和问题类型。该数据集源自Yahoo Answers,可用于训练和评估医疗相关查询的抽象摘要模型,其中BART和ProphetNet在ROUGE和BERTScore指标上表现最佳,尽管自动指标可能无法完全反映事实正确性。
The quest for seeking health information has swamped the web with consumers' health-related questions. Generally, consumers use overly descriptive and peripheral information to express their medical condition or other healthcare needs, contributing to the challenges of natural language understanding. One way to address this challenge is to summarize the questions and distill the key information of the original question. To address this issue, we introduce a new dataset, CHQ-Summ that contains 1507 domain-expert annotated consumer health questions and corresponding summaries. The dataset is derived from the community question-answering forum and therefore provides a valuable resource for understanding consumer health-related posts on social media. We benchmark the dataset on multiple state-of-the-art summarization models to show the effectiveness of the dataset.
研究动机与目标
- 为解决消费者医疗健康问题(CHQ)摘要领域缺乏大规模、由领域专家标注的数据集的问题。
- 提升自动摘要系统在处理冗长且包含冗余信息的医疗相关查询时的性能。
- 提供一个来自真实世界社区论坛(Yahoo Answers)的多样化、高质量数据集,以支持患者生成的医疗问题的抽象摘要研究。
- 增加问题焦点和问题类型的标注,以增强模型的可解释性和任务特异性。
- 在新数据集上对最先进预训练语言模型进行基准测试,并使用ROUGE和BERTScore指标评估其摘要效果。
提出的方法
- 数据集从Yahoo! Answers L6语料库构建,通过基于启发式策略的过滤方法筛选出‘医疗保健’类别的问题。
- 使用Stanza生物医学和临床NLP模型识别问题标题和内容中的医学实体。
- 过滤掉内容少于10个词的无关或低信息量问题,以确保质量和摘要的相关性。
- 由领域专家手动为每个选定问题生成摘要,生成的参考摘要捕捉了关键医学信息。
- 数据集包含问题焦点(主要医学实体)和问题类型(如治疗、诊断、症状)的标注。
- 在训练集上对预训练模型(T5、BART、PEGASUS、ProphetNet)进行微调,输入最大长度为300个标记,输出长度为50个标记,并采用束搜索解码。
实验结果
研究问题
- RQ1最先进预训练语言模型在摘要真实世界社区论坛中的消费者医疗健康问题方面效果如何?
- RQ2ROUGE和BERTScore指标在评估CHQ摘要质量时与人类判断的相关性有多大?
- RQ3额外的标注(如问题焦点和问题类型)是否能提升摘要模型的性能或可解释性?
- RQ4抽象摘要模型在不同评估指标下的表现如何变化,特别是在考虑事实正确性时?
- RQ5自动评估指标(如ROUGE)在捕捉医疗问题生成摘要的事实一致性方面存在哪些局限性?
主要发现
- ProphetNet在验证集上取得了最高的ROUGE分数,而BART在测试集上ROUGE-1、ROUGE-2和ROUGE-L指标上优于其他模型。
- BERTScore结果显示,BART在测试集上生成的摘要与参考摘要具有最高的语义相似度,表明其语义对齐能力出色。
- ROUGE-1和ROUGE-L分数始终高于ROUGE-2,反映出一元语法和最长公共子序列匹配相比二元语法重叠更具宽容性。
- 尽管ROUGE分数较高,BART和PEGASUS在某些情况下生成了事实错误的摘要,凸显了ROUGE作为唯一评估指标的局限性。
- T5生成的摘要明显长于其他模型,而ProphetNet和BART生成的摘要在内容和结构上最接近参考摘要。
- 人工检查发现,高自动评分并不能保证事实正确性,强调了在医疗摘要任务中进行人工评估的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。