[논문 리뷰] Investigating Large Language Models and Control Mechanisms to Improve Text Readability of Biomedical Abstracts
이 연구는 공중보건 독해력 향상을 위해 생물의학 초록을 단순화하기 위해 대규모 언어 모델(Large Language Models, LLMs)과 제어 메커니즘을 조사한다. PLABA 데이터셋을 사용하여 도메인 편집 및 프롬프트 기반 학습을 적용하여 BART-Large와 같은 모델에 제어 토큰을 도입함으로써 의미 유지와 단순화 품질의 균형을 이루며 SARI 점수 46.54를 기록하여 기존 모델들을 능가한다.
Biomedical literature often uses complex language and inaccessible professional terminologies. That is why simplification plays an important role in improving public health literacy. Applying Natural Language Processing (NLP) models to automate such tasks allows for quick and direct accessibility for lay readers. In this work, we investigate the ability of state-of-the-art large language models (LLMs) on the task of biomedical abstract simplification, using the publicly available dataset for plain language adaptation of biomedical abstracts ( extbf{PLABA}). The methods applied include domain fine-tuning and prompt-based learning (PBL) on: 1) Encoder-decoder models (T5, SciFive, and BART), 2) Decoder-only GPT models (GPT-3.5 and GPT-4) from OpenAI and BioGPT, and 3) Control-token mechanisms on BART-based models. We used a range of automatic evaluation metrics, including BLEU, ROUGE, SARI, and BERTscore, and also conducted human evaluations. BART-Large with Control Token (BART-L-w-CT) mechanisms reported the highest SARI score of 46.54 and T5-base reported the highest BERTscore 72.62. In human evaluation, BART-L-w-CTs achieved a better simplicity score over T5-Base (2.9 vs. 2.2), while T5-Base achieved a better meaning preservation score over BART-L-w-CTs (3.1 vs. 2.6). We also categorised the system outputs with examples, hoping this will shed some light for future research on this task. Our code, fine-tuned models, and data splits are available at \url{https://github.com/HECTA-UoM/PLABA-MU} \begin{IEEEkeywords} Large Language Models, Text Simplification, Biomedical NLP, Control Mechanisms, Health Informatics \end{IEEEkeywords}
연구 동기 및 목표
- 생물의학 초록의 복잡성을 자연어 처리 기법을 활용해 단순화하여 공중보건 독해력 향상을 목표로 한다.
- 자동 평가 및 인간 평가 지표를 사용하여 최신 LLM의 생물의학 텍스트 단순화 성능을 평가한다.
- 제어 메커니즘과 프롬프트 기반 학습이 단순화 품질과 의미 유지에 미치는 영향을 조사한다.
- 편집된 모델과 코드를 포함한 PLABA 데이터셋을 활용해未래 연구를 위한 벤치마크를 제공한다.
- LLM이 생성한 일반어 초록에서 단순화 수준과 의미 정확성 간의 상충 관계를 탐색한다.
제안 방법
- PLABA 데이터셋을 기반으로 인코더-디코더 모델(T5, SciFive, BART)과 디코더 전용 모델(GPT-3.5, GPT-4, BioGPT)을 편집한다.
- GPT 기반 모델의 단순화 출력을 생성하기 위해 프롬프트 기반 학습(Prompt-based Learning, PBL)을 적용하며, 제로샷 및 원샷 프롬프팅을 사용한다.
- BART 기반 모델에 제어 토큰 메커니즘을 구현하여 의미 내용 유지를 유지하면서도 단순화를 유도한다.
- BART 모델의 효율적 편집을 위해 LoRA를 사용하여 계산 비용을 절감한다.
- 2개의 기준 텍스트를 사용한 테스트 세트에서 BLEU, ROUGE, SARI, BERTScore 등의 자동 평가 지표를 사용해 출력을 평가한다.
- 814개의 문장 쌍에 대해 간단함과 의미 유지 정도 평가 점수를 포함한 인간 평가를 수행하여 정성적 성능을 평가한다.
실험 결과
연구 질문
- RQ1PLABA 데이터셋의 생물의학 초록 단순화에서 다양한 LLM 아키텍처는 어떻게 성능을 내는가?
- RQ2제어 토큰 메커니즘이 BART 기반 모델의 단순화 품질과 의미 유지에 얼마나 기여하는가?
- RQ3자동 평가 지표와 생물의학 텍스트 단순화에서 인간 평가 간의 상관관계는 어떠한가?
- RQ4LLM이 생성한 일반어 초록에서 단순화 깊이와 의미 정확성 간의 상충 관계는 무엇인가?
- RQ5GPT 모델에 대해 원샷 프롬프팅이 편집된 모델과 경쟁 가능한 성능을 낼 수 있는가?
주요 결과
- 제어 토큰을 적용한 BART-Large(BART-L-w-CT)가 SARI 점수 46.54를 기록하여 단순화에서 뛰어난 생성 품질을 보였다.
- T5-Base가 BERTScore 72.62를 기록하여 다른 모델들보다 더 강한 의미 유지 능력을 보였다.
- 인간 평가에서 BART-L-w-CT는 단순함 점수 2.9를 기록했으며(T5-Base의 2.2와 비교), 더 나은 단순화 성능를 보였다. 반면 T5-Base는 의미 유지 점수 3.1을 기록했고(BART-L-w-CT의 2.6와 비교), 더 뛰어난 의미 유지 능력을 보였다.
- 자동 평가 지표는 일관되지 않은 순위를 보였다: BART는 SARI에서 뛰어났지만 BERTScore에서는 뒤졌으며, 이는 단순화와 정확성 간의 상충 관계를 드러냈다.
- GPT-3.5와 GPT-4는 원샷 프롬프팅을 통해 경쟁 가능한 성능를 기록하여 이 작업에서 강력한 제로샷 일반화 능력을 보였다.
- 본 연구는 재현성과 향후 벤치마크를 위해 https://github.com/HECTA-UoM/PLABA-MU 에서 편집된 모델, 코드, 데이터 분할을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.