[논문 리뷰] Query-focused Extractive Summarisation for Biomedical and COVID-19 Complex Question Answering
이 논문은 BioASQ 챌린지에서 생물의학 및 코로나19 질문 응답을 위한 맥쿼리 대학교의 질의 중심 추출 요약 접근법을 제시한다. 이는 DistilBERT와 sBERT 임베딩을 사용하여 질문에 대한 관련성에 따라 후보 문장을 평가하고, 상위 점수를 받은 문장들이 답변을 구성한다. 주요 발견은 BioASQ10b의 훈련 데이터 후반부에서 훈련을 수행할 경우 성능 향상이 이루어지며, 이는 초기 훈련 샘플에 잠재적인 편향이 있음을 시사한다.
This paper presents Macquarie University's participation to the two most recent BioASQ Synergy Tasks (as per June 2022), and to the BioASQ10 Task~B (BioASQ10b), Phase~B. In these tasks, participating systems are expected to generate complex answers to biomedical questions, where the answers may contain more than one sentence. We apply query-focused extractive summarisation techniques. In particular, we follow a sentence classification-based approach that scores each candidate sentence associated to a question, and the $n$ highest-scoring sentences are returned as the answer. The Synergy Task corresponds to an end-to-end system that requires document selection, snippet selection, and finding the final answer, but it has very limited training data. For the Synergy task, we selected the candidate sentences following two phases: document retrieval and snippet retrieval, and the final answer was found by using a DistilBERT/ALBERT classifier that had been trained on the training data of BioASQ9b. Document retrieval was achieved as a standard search over the CORD-19 data using the search API provided by the BioASQ organisers, and snippet retrieval was achieved by re-ranking the sentences of the top retrieved documents, using the cosine similarity of the question and candidate sentence. We observed that vectors represented via sBERT have an edge over tf.idf. BioASQ10b Phase B focuses on finding the specific answers to biomedical questions. For this task, we followed a data-centric approach. We hypothesised that the training data of the first BioASQ years might be biased and we experimented with different subsets of the training data. We observed an improvement of results when the system was trained on the second half of the BioASQ10b training data.
연구 동기 및 목표
- 코로나19 및 일반 생물의학 분야의 복잡한 생물의학 질문 응답을 위한 강력하고 종단간(end-to-end) 시스템 개발.
- 문장 평가 및 검색 단계의 최적화를 통해 질의 중심 추출 요약의 답변 품질 향상.
- 훈련 데이터 구성이 모델 성능에 미치는 영향, 특히 잠재적 데이터 편향이 존재할 경우의 영향 조사.
- 스니펫 검색을 위한 다양한 임베딩 모델(sBERT 대비 tf.idf)과 재정렬 전략의 효과성 평가.
- 선택적 훈련 데이터 사용과 같은 데이터 중심 접근법이 표준 훈련 방식을 능가할 수 있는지 규명.
제안 방법
- 질의에 대한 관련성에 따라 후보 문장을 평가하는 문장 분류 기반 추출 요약 프레임워크를 활용.
- DistilBERT 또는 ALBERT를 사용하여 문장 임베딩을 생성하고, 단어 임베딩에 평균 풀링을 적용하여 문장 수준의 표현을 형성.
- 문장 위치를 이산 토큰으로 인코딩하여 문장 임베딩에 연결함으로써 모델 성능 향상.
- ReLU 및 시그모이드 활성화 함수를 갖는 다층 퍼셉트론을 사용하여 각 문장을 관련 또는 비관련으로 분류하고, 상위-n 점수를 받은 문장들이 최종 답변을 구성.
- 스니펫 검색을 위해 질문과 문장 임베딩 간의 코사인 유사도를 사용하며, sBERT가 tf.idf 기반 벡터보다 우수한 성능을 보였다.
- BioASQ10b Phase B에서 데이터 중심 전략을 적용하여 훈련 데이터를 처음부터 점진적으로 제거하여 편향과 성능 영향을 평가.
실험 결과
연구 질문
- RQ1생물의학 질문 응답에서 tf.idf 대비 sBERT 임베딩을 사용할 경우 스니펫 검색 성능 향상이 이루어지는가?
- RQ2특히 훈련 데이터의 후반부에서 훈련하는 데이터 중심 접근법(예: 후반부 훈련 데이터 사용)이 BioASQ10b Phase B에서 모델 일반화 및 성능 향상에 기여하는가?
- RQ3종단간 질문 응답 시스템에서 검색된 문서 및 스니펫의 품질이 최종 답변 품질에 어느 정도 영향을 미치는가?
- RQ4BioASQ10b 훈련 데이터의 초기 샘플들에 데이터 편향이 존재하는가, 이를 포함했을 때 성능 저하가 관찰되는가에 대한 증거가 있는가?
- RQ5완전한 훈련 데이터 대비 부분 훈련 데이터에서 다양한 초모델 설정이 모델 성능에 미치는 영향은 어떠한가?
주요 결과
- 문장 유사도 평가에 sBERT 임베딩을 사용할 경우 tf.idf 기반 접근법보다 유의미하게 뛰어난 성능을 보였으며, 더 나은 의미적 일치를 의미한다.
- 교차 검증에서 가장 높은 성능을 보인 모델은 BioASQ10b 훈련 데이터의 후반 50%만 사용하여 훈련한 것으로, ROUGE-SU4 F1 점수는 0.311을 기록했으며, 이는 초기 데이터에서 훈련했을 때의 낮은 점수와 대비된다.
- 후반부 데이터에서의 강력한 교차 검증 성능에도 불구하고, 제출된 런에서는 전체 데이터 또는 후반 50% 데이터에서 훈련했을 때의 성능 차이가 미미했으며, 두 경우 모두 배치 간 유사한 F1 점수를 기록했다.
- 최종 시스템 출력은 런 간 거의 동일했으며, 이는 훈련 데이터 서브셋에 관계없이 예측이 매우 일관됨을 시사한다.
- 하이퍼파라미터 튜닝 결과, 드롭아웃=0.6 및 1 에포크 훈련 설정이 완전한 데이터와 부분 훈련 데이터 설정 모두에서 최적의 성능을 냈다.
- 결과적으로 BioASQ10b 훈련 데이터의 초기 샘플들이 편향되거나 대표성이 떨어질 수 있음을 시사하며, 이를 제거함으로써 성능 향상이 이루어졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.