Skip to main content
QUICK REVIEW

[논문 리뷰] Finding Similar Medical Questions from Question Answering Websites

Yaliang Li, Liuyi Yao|arXiv (Cornell University)|2018. 10. 14.
Expert finding and Q&A systems참고 문헌 24인용 수 6
한 줄 요약

이 논문은 밀도 벡터 표현을 학습하여 커뮤니티 기반 Q&A 웹사이트에서 의미적으로 유사한 의료 질문을 찾는 엔드 투 엔드 LSTM 기반 시스템을 제안한다. 이 방법은 세부적인 의료 정보를 효과적으로 포착하고 표현의 다양성을 다루며, 실제 모성-소아 Q&A 데이터셋에서 미해결된 질문에 대해 관련된 과거 질문을 식별할 때 높은 정밀도와 순위 상관관계를 달성한다.

ABSTRACT

The past few years have witnessed the flourishing of crowdsourced medical question answering (Q&A) websites. Patients who have medical information demands tend to post questions about their health conditions on these crowdsourced Q&A websites and get answers from other users. However, we observe that a large portion of new medical questions cannot be answered in time or receive only few answers from these websites. On the other hand, we notice that solved questions have great potential to solve this challenge. Motivated by these, we propose an end-to-end system that can automatically find similar questions for unsolved medical questions. By learning the vector presentation of unsolved questions and their candidate similar questions, the proposed system outputs similar questions according to the similarity between vector representations. Through the vector representation, the similar questions are found at the question level, and the diversity of medical questions expression issue can be addressed. Further, we handle two more important issues, i.e., training data generation issue and efficiency issue, associated with the LSTM training procedure and the retrieval of candidate similar questions. The effectiveness of the proposed system is validated on a large-scale real-world dataset collected from a crowdsourced maternal-infant Q&A website.

연구 동기 및 목표

  • 높은 처리량과 제한된 응답 능력으로 인해 커뮤니티 기반 Q&A 플랫폼에서 해결되지 않은 의료 질문 문제를 해결하기 위해.
  • 기존에 해결된 질문들을 지식 자료로 활용하여 새로운 의료 질문에 대한 즉각적인 응답을 가속화하기 위해.
  • 의료 표현의 의미 다양성과 임상 세부 정보를 다루는 데에 한계가 있는 키워드 기반 및 단어 유사도 방법의 한계를 극복하기 위해.
  • 딥러닝을 사용하여 의료 질문의 의미 있는 벡터 표현을 학습하는 엔드 투 엔드 시스템을 개발하기 위해.
  • 대규모 실세계 모성-소아 Q&A 데이터셋에서 시스템의 효과성을 검증하기 위해.

제안 방법

  • 의료 질문을 의미적이고 임상적 세부 정보를 포착하는 고정 길이의 실수 값 벡터 표현으로 인코딩하기 위해 장기 단기 기억망(LSTM) 네트워크를 사용한다.
  • 단어 시퀀스로부터 맥락적이고 의미적인 정보를 학습하기 위해, 대규모 해결된 의료 질문 코퍼스에서 LSTM 모델을 훈련한다.
  • 질문의 임베딩 간 유사도(예: 코사인 유사도)를 활용하여 가장 관련성이 높은 과거 질문을 검색한다.
  • 동의어 대체를 활용한 데이터 증강 전략을 도입하여 다양한 훈련 예시를 생성하고 표현 변동에 대한 강건성을 향상시킨다.
  • 학습된 임베딩 기반으로 근사 최근접 이웃 기법을 활용하여 검색 파이프라인의 효율성을 최적화한다.
  • 문장 수준와 단어 수준의 표현을 조합하는 하이브리드 접근 방식을 사용하여 의미 매칭 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1LSTM 기반 문장 인코딩이 짧고 임상적으로 세부적인 의료 질문의 의미를 효과적으로 포착할 수 있는가?
  • RQ2학습된 벡터 표현이 동일한 의료 개념의 다양한 표현 방식으로 일반화되는 정도는 어떠한가?
  • RQ3벡터 유사도가 의미적으로 유사한 의료 질문을 식별하는 데에 키워드 기반 또는 단어 유사도 방법보다 얼마나 뛰어나게 작용하는가?
  • RQ4시스템은 대규모 실세계 의료 Q&A 데이터셋에 대해 높은 검색 정밀도를 유지하면서 확장 가능한가?
  • RQ5인간 평가자 평가와 자동화된 지표 간에 유사한 질문 검색의 관련성 평가에서 어떤 차이가 있는가?

주요 결과

  • 제안된 시스템은 인간 평가를 통해 검증된 바, 관련된 유사 질문을 식별할 때 높은 정밀도와 강한 순위 상관관계를 달성한다.
  • 동의어 대체(예: 'baby' vs. 'child')가 적용된 질문 간 유사도가 1.0에 가까운 수준을 유지하여 의미적 인코딩의 강건성을 보여준다.
  • 수정된 버전인 'My child has recurrent thrush. How to cure it?'에 대해 벡터 유사도 0.99를 기록한 유사 질문을 시스템이 식별했다.
  • 의료 의미가 변경되었을 경우(예: 'thrush'에서 'cold'로) 유사도가 급격히 감소(0.52로)함으로써 임상적 의미에 민감하게 반응함을 입증했다.
  • 사례 연구를 통해 검색된 유사 질문들이 환자에게 의미 있고 임상적으로 관련성이 있다는 것이 확인되었다.
  • 이해관계자의 세부적인 임상 정보와 표현의 다양성을 포착함으로써 기존의 키워드 기반 및 단어 유사도 기반 접근 방식을 뛰어넘는 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.