[논문 리뷰] LLMs May Perform MCQA by Selecting the Least Incorrect Option
이 논문은 대규모 언어 모델(Large Language Models, LLMs)을 평가하기 위한 기준으로서 다중선택형질문해답(MCQA)의 타당성을 도전하며, LLMs가 종종 '가장 잘못되지 않은' 선택지를 고르는 경향이 있다는 점을 드러낸다. 다양한 질문 형식을 통해 수행한 체계적 실험을 통해 저자들은 모델 성능이 답변 선택지의 미세한 변화에 따라 크게 요동치는 Response Variability Syndrome(REVAS)를 규명하였으며, 이는 MCQA가 진정한 이해도를 측정하는 데 있어 신뢰할 수 없음을 시사한다.
In the field of NLP, Large Language Models (LLMs) have markedly enhanced performance across a variety of tasks. However, the comprehensive evaluation of LLMs remains an inevitable challenge for the community. Recently, the adoption of Multiple Choice Question Answering (MCQA) as a benchmark for assessing LLMs has gained considerable traction. However, concerns regarding the robustness of this evaluative method persist. Building upon previous discussions on the issue of extit{variability}, we reveal an additional dimension of concern: LLMs may perform MCQA by selecting the least incorrect option rather than distinctly correct. This observation suggests that LLMs might regard multiple options as correct, which could undermine the reliability of MCQA as a metric for evaluating LLMs. To address this challenge, we introduce an enhanced dataset augmentation method for MCQA, termed MCQA+, to provide a more accurate reflection of the model performance, thereby highlighting the necessity for more sophisticated evaluation mechanisms in the assessment of LLM capabilities.
연구 동기 및 목표
- LLMs를 평가하기 위한 MCQA의 신뢰성을 조사하기 위해.
- 동일한 질문이 재구성되거나 재형식화될 때 LLM의 응답에 나타나는 일관성의 결여를 규명하기 위해.
- LLMs가 질문의 의미를 진정으로 이해하는 것이 아니라, 결함이 있는 선택지들 중에서 가장 타당성이 높은 것을 고르는지 검토하기 위해.
- 학습 중에 부정(틀린) 답변 선택지를 포함하는 것이 모델의 강건성과 일관성 향상에 기여하는지 탐색하기 위해.
- 반응 변동성을 고려하고 표면적인 패턴 매칭이 아닌 깊은 이해를 장려하는 개선된 평가 프레임워크를 제안하기 위해.
제안 방법
- 저자들은 MCQA 인스턴스의 여러 변형을 생성: 원본, 답변 선택지 순서 변경, 참/거짓 형식으로 변환.
- LLaMA2-13B, Baichuan2-13B, ChatGPT 3.5 등을 포함한 여러 LLMs를 사용해 이러한 변형에 대해 응답 일관성 측정.
- Baichuan2-7B-Base를 사용한 통제 실험: 양성(정답) 및 부정(오답) 답변 쌍을 학습하여 부정 예시의 영향 평가.
- 세 가지 학습 전략 비교: SFT 전용, 양성 인스턴스에서의 사전학습 후 SFT, 양성 및 부정 인스턴스에서의 사전학습 후 SFT.
- 질문 구조에 대한 일반화 능력을 테스트하기 위해 MCQA 및 참/거짓 형식 모두 평가.
- 구성 요소 간 예측 이동을 통계적으로 분석하여, 동일한 기반 질문에도 불구하고 모델 출력이 크게 변동하는 REVAS 현상 규명.
실험 결과
연구 질문
- RQ1동일한 질문이 다른 답변 순서나 형식으로 제시될 때 LLM의 성능이 일관성 유지되는가?
- RQ2LLMs가 MCQA 과정에서 질문의 의미적 이해보다 선택지의 상대적 타당성에 얼마나 의존하는가?
- RQ3사전학습 또는 미세조정 중에 부정(틀린) 답변 선택지를 포함하는 것이 LLM의 응답 일관성 향상과 REVAS 감소에 기여하는가?
- RQ4왜 유도적 선택지가 포함되면 기존에 정확했던 질문을 LLMs가 자주 잘못 분류하는가?
- RQ5MCQA는 진정으로 지식 습득과 추론 능력을 평가하는 데 타당한 대체 기준인가, 아니면 주로 패턴 매칭 능력을 측정하는가?
주요 결과
- LLMs는 같은 질문이 재형식화되거나 답변 선택지 순서가 바뀔 경우 심각한 반응 변동성(REsponse Variability Syndrome, REVAS)를 보이며, 이는 일관되지 않은 추론을 시사한다.
- 소수 샘플 설정에서, 39.23%에서 57.99%의 LLMs가 오류가 있는 선택지를 제거할 경우 初기 잘못된 판단을 수정함으로써, 모델 예측이 선택지 내용에 매우 민감하게 반응함을 보여준다.
- 양성(정답) 답변 인스턴스만으로 사전학습한 결과, MCQA 정확도는 15.59% 감소하고 참/거짓 정확도는 16.83% 감소하여, 양성 전용 학습이 일반화 능력에 악영향을 준다는 것을 시사한다.
- 사전학습 단계에서 부정(틀린) 답변 인스턴스를 포함시킨 결과, 참/거짓 정확도는 30.53% 향상되고 MCQA 정확도는 8.38% 향상되어, 잘못된 선택지를 학습하는 것이 유의미한 가치가 있음을 입증한다.
- 연구 결과는 LLMs가 종종 정답이 아닌 '가장 잘못되지 않은' 선택지를 고르는 경향이 있다는 점을 확인하며, 이는 질문의 의미를 완전히 이해하지 못할 가능성을 암시한다.
- 실험 결과는 표준 MCQA 벤치마크에서의 높은 정확도가 실제 이해도를 반영하지 못하며, 답변 선택지의 미세한 변형에 의해 성능이 크게 하락함을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.