[论文解读] Prototypical Q Networks for Automatic Conversational Diagnosis and Few-Shot New Disease Adaption
本文提出原型Q网络(ProtoQN),一种新颖的深度强化学习模型,用于自动对话式诊断,通过利用真实的医生-患者对话历史,学习疾病和症状的共享原型嵌入。通过将原型网络整合到Q-learning中,ProtoQN在监督学习和少样本学习设置下均达到最先进性能,显著优于DQN基线模型,尤其在仅用少量标注样本适应新疾病时表现更优。
Spoken dialog systems have seen applications in many domains, including medical for automatic conversational diagnosis. State-of-the-art dialog managers are usually driven by deep reinforcement learning models, such as deep Q networks (DQNs), which learn by interacting with a simulator to explore the entire action space since real conversations are limited. However, the DQN-based automatic diagnosis models do not achieve satisfying performances when adapted to new, unseen diseases with only a few training samples. In this work, we propose the Prototypical Q Networks (ProtoQN) as the dialog manager for the automatic diagnosis systems. The model calculates prototype embeddings with real conversations between doctors and patients, learning from them and simulator-augmented dialogs more efficiently. We create both supervised and few-shot learning tasks with the Muzhi corpus. Experiments showed that the ProtoQN significantly outperformed the baseline DQN model in both supervised and few-shot learning scenarios, and achieves state-of-the-art few-shot learning performances.
研究动机与目标
- 解决基于DQN的医疗对话系统在新疾病出现且训练数据有限时,少样本适应能力差的问题。
- 通过利用真实世界医生-患者对话历史而非仅依赖模拟器生成的交互,提升对话策略训练的样本效率。
- 通过学习症状和疾病的共享可迁移表示(通过原型嵌入),实现对新疾病的快速且稳健的适应。
- 证明直接建模真实对话动态可提升策略学习效果,相较于仅使用模拟器预训练,在数据稀缺条件下优势更明显。
- 在无需手工设计特征或外部医学知识的前提下,实现医疗对话策略学习的最先进少样本性能。
提出的方法
- 通过使用神经编码器对来自Muzhi语料库的真实医生-患者对话历史进行编码,构建疾病和症状的原型嵌入。
- 将原型网络推理机制整合到深度Q网络(DQN)中,基于当前状态嵌入与学习到的疾病/症状原型之间的相似性计算Q值。
- 使用共享嵌入空间,通过状态表示与原型向量之间的度量学习预测Q值,从而实现少样本泛化。
- 在部分疾病上进行预训练,并在少量新疾病样本上进行微调,通过从预训练疾病中随机采样进行数据增强,以防止灾难性遗忘。
- 在微调过程中引入噪声以评估模型鲁棒性,模拟真实对话中的变异性。
- 使用标准DQN目标进行训练,结合经验回放和目标网络,但将标准的状态-动作Q值学习替换为基于原型的相似性匹配。
实验结果
研究问题
- RQ1与标准DQN相比,基于原型的Q网络是否能提升自动对话式诊断中的少样本适应性能?
- RQ2利用真实医生-患者对话历史学习可迁移的疾病和症状表示嵌入是否有效?
- RQ3当仅用少量样本适应新疾病时,ProtoQN模型是否能保持对先前学习疾病的性能?
- RQ4在少样本适应过程中,ProtoQN模型对噪声或可变对话输入的鲁棒性如何?
- RQ5所提出的方法是否能在不依赖外部领域特定特征的情况下,实现少样本医疗对话策略学习的最先进性能?
主要发现
- 在监督学习中,ProtoQN在Muzhi语料库上取得了70.42%的成功率,显著优于DQN基线(65%)。
- 在少样本学习中,ProtoQN在零噪声条件下的平均成功率为63.47%,高于DQN的59.51%,表现出更优的少样本泛化能力。
- 即使在噪声水平增加至0.3时,ProtoQN仍保持稳定性能(噪声为0.3时为62.32%),而DQN则持续退化。
- 模型对噪声表现出强鲁棒性,归因于匹配网络中基于原型的推理具有类似集成的特性。
- ProtoQN在微调过程中成功防止了灾难性遗忘,既保留了对预训练疾病的记忆,又能适应新疾病。
- 结果证实,通过原型嵌入从真实对话历史中学习,可实现比仅使用模拟器训练更快、更有效的策略适应。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。