Skip to main content
QUICK REVIEW

[논문 리뷰] CHQ-Summ: A Dataset for Consumer Healthcare Question Summarization

Shweta Yadav, Deepak Gupta|arXiv (Cornell University)|2022. 06. 14.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 전문가가 앵커판한 요약, 질문 초점, 질문 유형을 포함한 1,507개의 소비자 의료질문을 포함한 새로운 데이터셋인 CHQ-Summ을 소개한다. 이 데이터셋은 Yahoo Answers에서 유래되었으며, 건강 관련 질의에 대한 개략적 요약 모델의 훈련과 평가를 가능하게 하며, BART와 ProphetNet이 ROUGE 및 BERTScore 메트릭에서 최고 성능을 보였지만, 자동 메트릭은 사실적 정확성을 완전히 반영하지 못할 수 있음.

ABSTRACT

The quest for seeking health information has swamped the web with consumers' health-related questions. Generally, consumers use overly descriptive and peripheral information to express their medical condition or other healthcare needs, contributing to the challenges of natural language understanding. One way to address this challenge is to summarize the questions and distill the key information of the original question. To address this issue, we introduce a new dataset, CHQ-Summ that contains 1507 domain-expert annotated consumer health questions and corresponding summaries. The dataset is derived from the community question-answering forum and therefore provides a valuable resource for understanding consumer health-related posts on social media. We benchmark the dataset on multiple state-of-the-art summarization models to show the effectiveness of the dataset.

연구 동기 및 목표

  • 소비자 의료질문(CHQ) 요약을 위한 대규모이자 도메인 전문가가 앵커판한 데이터셋의 부족을 해결하기 위해.
  • 일반적으로 길고 부가적인 정보를 포함하는 건강 관련 질의의 자동 요약 시스템 성능을 향상시키기 위해.
  • 실제 커뮤니티 포럼( Yahoo Answers)에서 유래한 다양하고 고품질의 데이터셋을 제공하여 환자가 생성한 건강 질문에 대한 개략적 요약 연구를 지원하기 위해.
  • 모델의 해석 가능성과 작업의 구체성을 향상시키기 위해 질문 초점과 질문 유형에 대한 추가 앵커판을 포함하기 위해.
  • 새로운 데이터셋에서 최신의 사전 훈련된 언어 모델을 벤치마킹하고, ROUGE 및 BERTScore 메트릭을 사용하여 요약 성능을 평가하기 위해.

제안 방법

  • 데이터셋은 Yahoo! Answers L6 코퍼스에서 유래되었으며, 히우리스틱 기반 전략을 사용해 '의료' 카테고리에 속하는 질문을 필터링하였다.
  • 의료 실체는 Stanza 생물의학 및 임상 NLP 모델을 사용해 질문 제목과 내용에서 식별되었다.
  • 내용이 10단어 미만인 불필요하거나 저품질의 질문은 제거되어 품질과 요약 관련성을 확보하였다.
  • 도메인 전문가가 각 선택된 질문을 수동으로 요약하여 핵심 의료 정보를 반영한 기준 요약을 생성하였다.
  • 질문 초점(주요 의료 실체)과 질문 유형(예: 치료, 진단, 증상)에 대한 앵커판이 포함되어 있다.
  • 사전 훈련된 모델(T5, BART, PEGASUS, ProphetNet)은 최대 입력 길이 300 토큰, 출력 길이 50 토큰로 훈련 세트에서 미세조정되었으며, 비드 서치 디코딩 방식을 사용하였다.

실험 결과

연구 질문

  • RQ1최신의 사전 훈련된 언어 모델은 실제 커뮤니티 포럼에서 유래한 소비자 의료질문의 요약에 얼마나 효과적인가?
  • RQ2ROUGE와 BERTScore 메트릭이 CHQ 요약의 품질 평가에서 인간 평가와 얼마나 상관관계가 있는가?
  • RQ3질문 초점과 질문 유형과 같은 추가 앵커판은 요약 모델의 성능 또는 해석 가능성 향상에 기여하는가?
  • RQ4개략적 요약 모델의 성능은 다양한 평가 메트릭에서 어떻게 달라지며, 특히 사실적 일관성 측면에서 어떻게 평가되는가?
  • RQ5ROUGE와 같은 자동 평가 메트릭은 건강 질문 요약 생성 요약의 사실적 일관성을 얼마나 잘 포착하는가?

주요 결과

  • 검증 세트에서 ProphetNet이 가장 높은 ROUGE 점수를 기록했으며, 테스트 세트에서는 BART가 ROUGE-1, ROUGE-2, ROUGE-L에서 다른 모델들을 압도했다.
  • BERTScore 결과는 BART가 테스트 세트에서 기준 요약과 가장 높은 의미적 유사도를 보였음을 보여주며, 강력한 의미적 일치를 의미한다.
  • ROUGE-1과 ROUGE-L 점수는 ROUGE-2보다 항상 높았으며, 이는 유니그램과 최장 공통 부분 수열 매칭이 바이그램 오버랩보다 더 관용적인 경향을 보임을 반영한다.
  • 높은 ROUGE 점수에도 불구하고 BART와 PEGASUS는 일부 경우에 사실적으로 잘못된 요약을 생성했으며, 이는 ROUGE가 유일한 평가 메트릭으로서의 한계를 드러낸다.
  • T5는 다른 모델들보다 훨씬 더 긴 요약을 생성했으며, ProphetNet과 BART는 기준 요약과 내용과 구조에서 가장 유사한 요약을 생성했다.
  • 수동 점검 결과, 높은 자동 점수는 사실적 정확성을 보장하지 못하며, 건강 요약 작업에서 인간 평가의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.