Skip to main content
QUICK REVIEW

[논문 리뷰] SemEval-2023 Task 7: Multi-Evidence Natural Language Inference for Clinical Trial Data

Maël Jullien, Marco Valentino|arXiv (Cornell University)|2023. 05. 04.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 임상 시험 데이터에서 다중 증거 자연어 추론(NLI) 및 증거 선택을 위한 벤치마크인 SemEval-2023 Task 7를 제시한다. 이 작업은 복잡한 다단계 및 수치적 추론을 요구한다. 최고 성능을 보인 시스템은 함의 작업에서 F1 스코어 0.856, 증거 선택 작업에서 0.853을 기록했으며, 생물의학 전훈련보다 모델 크기가 더 큰 영향을 미쳤다.

ABSTRACT

This paper describes the results of SemEval 2023 task 7 -- Multi-Evidence Natural Language Inference for Clinical Trial Data (NLI4CT) -- consisting of 2 tasks, a Natural Language Inference (NLI) task, and an evidence selection task on clinical trial data. The proposed challenges require multi-hop biomedical and numerical reasoning, which are of significant importance to the development of systems capable of large-scale interpretation and retrieval of medical evidence, to provide personalized evidence-based care. Task 1, the entailment task, received 643 submissions from 40 participants, and Task 2, the evidence selection task, received 364 submissions from 23 participants. The tasks are challenging, with the majority of submitted systems failing to significantly outperform the majority class baseline on the entailment task, and we observe significantly better performance on the evidence selection task than on the entailment task. Increasing the number of model parameters leads to a direct increase in performance, far more significant than the effect of biomedical pre-training. Future works could explore the limitations of large models for generalization and numerical inference, and investigate methods to augment clinical datasets to allow for more rigorous testing and to facilitate fine-tuning. We envisage that the dataset, models, and results of this task will be useful to the biomedical NLI and evidence retrieval communities. The dataset, competition leaderboard, and website are publicly available.

연구 동기 및 목표

  • 임상 시험 보고서에서 다중 증거 자연어 추론을 위한 시스템을 개발하고 평가하는 것. 이 작업은 다단계 및 수치적 추론을 요구한다.
  • NLP 모델이 함의 예측을 뒷받침하는 증거를 임상 시험 문서에서 검색하는 성능을 평가하는 것.
  • 모델 크기와 생물의학 전훈련이 임상 NLP 작업의 추론에 미치는 영향을 조사하는 것.
  • 증거 기반 의료 및 임상 의사결정 지원 시스템을 발전시키기 위해 공개 가능한 데이터셋과 벤치마크를 제공하는 것.

제안 방법

  • 이 작업은 자연어 문장과 해당 함의 레이블(함의, 모순, 중립)이 주어진 2,000건 이상의 임상 시험 보고서(CTRs)로 구성된 데이터셋을 사용한다.
  • 참가자들은 두 가지 작업을 수행하도록 요구되었다: (1) 문장과 CTR 사이의 함의 관계를 예측하고, (2) 레이블을 뒷받침하는 증거를 CTR에서 추출한다.
  • NLI4CT 데이터셋은 음성 재작성 전략을 사용하여, 각 CTR 전제에 대해 하나의 함의 문장과 하나의 모순 문장을 생성하였다.
  • 시스템 평가는 함의 및 증거 선택 작업 모두에서 F1 스코어를 사용하였으며, 결과는 공개 리더보드에 집계되었다.
  • 시스템 행동 분석을 통해 증거 추출과 추론의 순서를 포함한 분석을 수행하였고, 확인 편향 및 통계적 오염을 평가하였다.
  • 성능 향상에 기여하는 표면적 패턴이나 토큰 분포 편향이 존재하지 않는지 확인하기 위해 통계적 탄력성 검사를 수행하였다.
Figure 1: We propose two tasks for reasoning on clinical trial data expressed in natural language. Firstly, to predict the entailment of a Statement and a CTR premise, and secondly, to extract evidence to support the label.
Figure 1: We propose two tasks for reasoning on clinical trial data expressed in natural language. Firstly, to predict the entailment of a Statement and a CTR premise, and secondly, to extract evidence to support the label.

실험 결과

연구 질문

  • RQ1최신 NLP 모델은 임상 시험 데이터에서 다중 증거 NLI 및 증거 선택 작업에서 얼마나 잘 수행되는가?
  • RQ2모델 크기와 생물의학 전훈련 간의 상대적 영향은 임상 NLI 작업 성능에 어떤가?
  • RQ3증거 선택과 함의 분류의 순서가 시스템 성능에 영향을 미치는가?
  • RQ4문장의 통계적 오염 또는 표면적 패턴이 모델 예측에 어느 정도 영향을 미치는가?
  • RQ5다단계 및 수치적 추론에 의존할 때, 시스템은 임상 NLI에 효과적으로 일반화할 수 있는가?

주요 결과

  • 최고 성능 시스템인 @THiFLY는 함의 작업에서 F1 스코어 0.856, 증거 선택 작업에서 0.853을 기록했다.
  • 대부분의 제출된 시스템은 함의 작업에서 다수 클래스 기반선을 크게 뛰어나지 못했으며, 이는 높은 난이도를 의미한다.
  • 증거 선택 작업의 성능는 함의 작업보다 항상 높았으며, 이는 증거 선택이 덜 도전적인 작업임을 시사한다.
  • 모델 크기를 증가시키는 것이 생물의학 전훈련보다 더 강력한 긍정적 영향을 미쳤으며, 전훈련은 비교적 미미한 영향을 미쳤다.
  • 증거 선택을 추론 이전에 수행한 시스템은 유의미하게 더 높은 F1 및 정밀도 스코어를 기록하여, 확인 편향을 피한 것으로 나타났다.
  • 테스트 세트에서 함의 클래스 간에 토큰 분포나 길이 편향이 유의미하게 발견되지 않아, 데이터셋이 통계적 오염에 대해 탄력적임을 확인했다.
Figure 2: Graph comparing system F1 scores across the entailment task and the evidence selection task
Figure 2: Graph comparing system F1 scores across the entailment task and the evidence selection task

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.