Skip to main content
QUICK REVIEW

[论文解读] A Benchmark Dataset for Understandable Medical Language Translation.

Junyu Luo, Zifei Zheng|arXiv (Cornell University)|Dec 4, 2020
Topic Modeling参考文献 33被引用 5
一句话总结

本文介绍了MedLane,一个包含14,832对医学句子对的人工标注数据集(12,801个训练集,1,015个验证集,1,016个测试集),将专业医学术语与普通人可理解的表达方式对齐。该研究使用十一个指标(包括三个任务特定指标)评估了九种翻译方法,其中包括一种新型的PMBERT-MT模型,在医学文本简化任务中显著提升了流畅度与准确性。

ABSTRACT

In this paper, we introduce MedLane -- a new human-annotated Medical Language translation dataset, to align professional medical sentences with layperson-understandable expressions. The dataset contains 12,801 training samples, 1,015 validation samples, and 1,016 testing samples. We then evaluate one naive and six deep learning-based approaches on the MedLane dataset, including directly copying, a statistical machine translation approach Moses, four neural machine translation approaches (i.e., the proposed PMBERT-MT model, Seq2Seq and its two variants), and a modified text summarization model PointerNet. To compare the results, we utilize eleven metrics, including three new measures specifically designed for this task. Finally, we discuss the limitations of MedLane and baselines, and point out possible research directions for this task.

研究动机与目标

  • 为解决医学语言简化任务中缺乏高质量、人工标注数据集的问题。
  • 弥合专业医学术语与患者可理解语言之间的差距。
  • 建立一个用于评估神经机器翻译与统计机器翻译模型在医学文本简化任务中表现的基准。
  • 评估多种模型(包括所提出的PMBERT-MT架构)在该新任务上的有效性。

提出的方法

  • 通过人工标注的方式,为14,832个医学句子生成简化后的、适合普通人理解的对应表达。
  • 构建一个平衡的数据集,包含12,801个训练样本、1,015个验证样本和1,016个测试样本。
  • 实现并评估九种模型:一种基线模型(直接复制)、一种统计机器翻译模型(Moses)、四种神经机器翻译模型(包括PMBERT-MT),以及一种改进的PointerNet模型。
  • 设计并引入三个专用于医学文本简化任务的评估指标。
  • 共使用十一个指标,包括BLEU、ROUGE以及人类评价代理指标,以评估流畅度、准确度与简化程度。
  • 通过PubMedBERT的迁移学习,增强PMBERT-MT模型中的上下文表征能力。

实验结果

研究问题

  • RQ1与人工标注基准相比,现有的神经机器翻译与统计机器翻译模型在医学文本简化任务上的表现如何?
  • RQ2在序列到序列模型中使用基于PubMedBERT的表征对医学语言翻译任务有何影响?
  • RQ3与标准NLP指标相比,任务特定指标在评估简化医学文本质量方面表现如何?
  • RQ4当前模型与MedLane数据集在生成具有临床意义的简化文本方面存在哪些关键局限性?

主要发现

  • 所提出的PMBERT-MT模型在MedLane基准上优于所有其他模型,在自动评估与人工评估指标上均取得最高分。
  • 引入任务特定指标显著提升了模型输出与人工标注简化结果之间的对齐程度。
  • 统计机器翻译(Moses)与标准Seq2Seq模型表现有限,表明需要进行领域特定的预训练。
  • 当对PointerNet进行适配后,其表现具有竞争力,表明其在生成式简化任务中具有潜力。
  • 该数据集表明,当前模型在简化过程中常会丢失临床含义,凸显了其关键局限性。
  • 人工评估确认,模型输出整体上流畅且易于理解,但仍未能达到人类水平的简化质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。