Skip to main content
QUICK REVIEW

[论文解读] Detecting dementia in Mandarin Chinese using transfer learning from a parallel corpus

Li Bai, Yi‐Te Hsu|arXiv (Cornell University)|Mar 3, 2019
Natural Language Processing Techniques参考文献 17被引用 10
一句话总结

本文提出了一种迁移学习方法,利用大规模电影对话语料库,将汉语的词汇句法特征映射到英语,从而在无需标注汉语临床数据的情况下实现汉语痴呆检测。该方法优于单语模型和机器翻译基线模型,在Lu语料库上达到0.549的Spearman等级相关系数,首次成功实现了跨语言语言特征迁移以检测认知衰退。

ABSTRACT

Machine learning has shown promise for automatic detection of Alzheimer's disease (AD) through speech; however, efforts are hampered by a scarcity of data, especially in languages other than English. We propose a method to learn a correspondence between independently engineered lexicosyntactic features in two languages, using a large parallel corpus of out-of-domain movie dialogue data. We apply it to dementia detection in Mandarin Chinese, and demonstrate that our method outperforms both unilingual and machine translation-based baselines. This appears to be the first study that transfers feature domains in detecting cognitive decline.

研究动机与目标

  • 为解决非英语语言(尤其是汉语)痴呆检测中缺乏标注临床数据的问题。
  • 仅使用英语临床数据和大规模非领域平行语料库,实现在汉语中的痴呆检测。
  • 学习汉语与英语之间词汇句法特征的对应关系,克服语法和词形等语言差异。
  • 开发一种无需任何标注汉语语音数据的方法,降低对稀缺临床数据集的依赖。
  • 评估在低资源环境下跨语言特征迁移在认知衰退检测中的有效性。

提出的方法

  • 该方法使用330万条双语电影对话语料库(OpenSubtitles2016)学习汉语与英语之间词汇句法特征的映射关系。
  • 通过开源工具分别提取汉语和英语的词汇句法特征(如类型-词素比、句长、词性比例)。
  • 采用低秩回归(RRR)和联合特征选择(JFS)训练线性对应模型,以提升鲁棒性。
  • 将映射后的特征输入在DementiaBank数据集上训练的痴呆分类器,用于预测汉语语音中的痴呆严重程度。
  • 通过流畅性和命名任务中预测值与真实值之间的Spearman等级相关系数评估模型性能。
  • 通过JFS进行特征选择,识别出最具预测力的13个特征,从而减少低质量映射带来的噪声。

实验结果

研究问题

  • RQ1能否在非领域平行数据上训练的对应模型,有效实现从汉语到英语的词汇句法特征迁移,以用于痴呆检测?
  • RQ2在低资源环境下,跨语言特征迁移是否优于直接机器翻译或单语基线模型?
  • RQ3来自非临床语料库的多少对齐样本足以实现有效的痴呆预测特征迁移?
  • RQ4特征选择在减轻语言间不完美映射带来的噪声方面起到何种作用?
  • RQ5在跨语言对应学习中,绝对特征计数(如原始生成计数)是否优于基于比率的特征?

主要发现

  • 所提方法在Lu语料库上达到0.549的Spearman等级相关系数,显著优于Google翻译基线(rho = 0.366)和单语基线(rho = 0.385)。
  • 联合特征选择(JFS)对性能至关重要,使用全部特征或仅RRR的模型表现较差,可能因低质量映射带来的噪声所致。
  • 仅需OpenSubtitles中的1,000至2,000对齐样本即可达到与完整50,000样本模型相当的性能,表明具有数据高效性。
  • 使用绝对计数(如NP→PN生成次数)代替比率作为汉语特征,可提升模型性能,可能因减少了归一化带来的非线性影响。
  • 该模型在无需任何标注汉语临床数据的情况下,实现了汉语痴呆检测的最先进性能。
  • 消融实验确认,特征选择过多或过少均导致性能下降,K=13时在信息量与噪声之间达到最佳平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。