[논문 리뷰] Assessing and Enhancing the Robustness of Large Language Models with Task Structure Variations for Logical Reasoning
이 논문은 선택지 랜덤 재배열 및 정답을 '다른 선택지 중 어느 것도 맞지 않다'로 대체함으로써 작업 구조를 변형시켜 세 가지 증강된 논리적 추론 데이터셋—ReClor-plus, LogiQA-plus, LogiQAv2-plus—을 제안한다. 원본 데이터셋에서는 뛰어난 성능을 보였지만, GPT-3.5 및 GPT-4와 같은 대규모 언어모델(LLM)은 이러한 변형에서 성능이 크게 저하됨을 확인하여 낮은 내성적 저항성을 드러낸다. 본 연구는 지시 미세튜닝과 논리 기반 데이터 증강 기법이 일반화 능력과 내성적 저항성을 크게 향상시킴을 입증하며, 특히 고도의 변형 비율을 적용한 대규모 훈련 세트(10,000건 이상)에서 두드러진 효과를 보인다.
Large language models (LLMs), such as LLaMA, Alpaca, Vicuna, GPT-3.5 and GPT-4, have advanced the performance of AI systems on various natural language processing tasks to human-like levels. However, their generalisation and robustness when performing logical reasoning has not been sufficiently assessed. To comprehensively evaluate this ability, we develop three new logical reasoning datasets named "ReClor-plus", "LogiQA-plus" and "LogiQAv2-plus" that extend standard logical reasoning datasets to evaluate the robustness of the LLM's reasoning. For each, we create three subsets: the first with randomly shuffled options, the second with the correct choices replaced by "none of the other options is correct", and the third with a combination of shuffling and substitution. Experiments on these datasets show that these simple augmentations greatly hinder the models' performance. Despite their high performance on the original publicly available datasets, we find that all models perform poorly on these newly constructed datasets. We also demonstrate that introducing task variations into the training set can markedly improve the model's performance on both the original and our developed datasets. Finally, we show that applying logic-driven data augmentation for fine-tuning and prompting can enhance generalisation in both discriminative and generative models, offering a path to improving their robustness for tasks involving logical reasoning. Source code and data are made publicly available at https://github.com/Strong-AI-Lab/Logical-and-abstract-reasoning.
연구 동기 및 목표
- 논리적 추론 작업에서 구조적 변형에 노출된 대규모 언어모델(LLM)의 일반화 및 내성적 저항성에 대해 조사한다.
- 기존 논리적 추론 데이터셋에서의 기억화 및 과적합 위험을 해소하기 위해 작업 구조의 다양성을 도입한다.
- 지시 미세튜닝, 프롬프팅, 데이터 증강 기법이 논리적 추론 작업에서 분포 변화에 대한 LLM의 내성적 저항성 향상에 기여하는지 평가한다.
- 훈련 데이터 크기와 변형 비율이 생성형 및 분류형 LLM의 일반화 능력에 미치는 영향을 분석한다.
- 모델 크기(예: LLaMA-7B에서 LLaMA-65B까지)가 제로샷 평가 조건에서 변형된 논리적 추론 작업에서 성능 향상과 상관관계가 있는지 확인한다.
제안 방법
- 저자들은 두 가지 변형—선택지의 무작위 재배열 및 정답을 '다른 선택지 중 어느 것도 맞지 않다'로 대체—를 적용하여 세 가지 새로운 데이터셋—ReClor-plus, LogiQA-plus, LogiQAv2-plus—을 생성한다.
- 각 데이터셋은 원본 형식, 선택지 재배열, 정답 교체의 세 하위집합을 포함하며, 모델의 내성적 저항성에 대한 체계적 평가를 가능하게 한다.
- 분류형(LReasoner, MERIt 등) 및 생성형(GPT-3.5, GPT-4, LLaMA, Alpaca, Vicuna 등) LLM을 대상으로 제로샷 및 미세튜닝 설정에서 실험를 수행한다.
- 지시 미세튜닝 과정에서 논리 기반 데이터 증강 기법을 적용하여 추론 일반화 능력을 향상시키며, 프롬프팅을 추가로 활용해 성능을 더욱 향상시킨다.
- 훈련 세트에서 다양한 데이터 변형 비율(5%에서 50%까지)을 적용하여, 분포 외 구조로의 일반화 능력을 평가한다.
- 모델 크기 비교를 위해 LLaMA 모델(7B에서 65B 파라미터)을 사용하여 제로샷 평가 조건에서 확장성 영향을 평가한다.
실험 결과
연구 질문
- RQ1선택지 재배열 또는 정답 교체와 같은 구조적 변형에 직면했을 때 대규모 언어모델은 논리적 추론 작업에서 내성적 저항성을 보일 수 있는가?
- RQ2지시 미세튜닝과 논리 기반 데이터 증강 기법이 분류형 및 생성형 LLM의 분포 외 추론 작업에 대한 내성적 저항성과 일반화 능력을 향상시킬 수 있는가?
- RQ3훈련 데이터셋의 크기가 논리적 추론 작업에서 데이터 변형의 효과를 통한 일반화 향상에 영향을 미치는가?
- RQ4LLaMA-7B에서 LLaMA-65B까지의 모델 크기와 제로샷 평가 조건에서 변형된 논리적 추론 작업의 성능 간 유의미한 상관관계가 존재하는가?
- RQ5비교적 단순한 CoT 프롬프팅만으로도, 미세튜닝 및 데이터 증강 전략에 비해 논리적 추론의 내성적 저항성 향상에 어느 정도 기여하는가?
주요 결과
- GPT-3.5와 GPT-4는 원본 논리적 추론 데이터셋에서는 뛰어난 성능을 보였지만, 'Shuffle-RepAns' 변형 형식에서는 정확도가 11.3%까지 급격히 하락하여 기억화 또는 표면적 패턴 의존성에 기반함을 시사한다.
- 지시 미세튜닝을 통해 분류형 LLM은 순열 불변성(permutation invariance)을 달성하여 선택지 순서에 관계없이 예측이 일관되게 유지됨을 확인하였으며, 이는 기억화가 아닌 추론 능력 향상을 의미한다.
- 10,000건 이상의 훈련 샘플을 가진 훈련 세트에서는 선택지 재배열과 정답 교체를 동시에 적용한 고비율 변형(예: 50%)이 생성형 LLM인 GPT-3.5 및 GPT-4의 일반화 능력을 크게 향상시킨다.
- 논리 기반 데이터 증강과 프롬프팅의 조합은 분류형 및 생성형 LLM의 성능을 향상시키며, 특히 LogiQAv2-plus 데이터셋에서 내성적 저항성이 향상됨을 입증한다.
- LLaMA 모델(7B에서 65B 파라미터) 간 제로샷 평가 조건에서 Shuffle-RepAns 형식에서 성능 차이가 유의미하게 관찰되지 않아, 모델 크기만으로는 내성적 저항성이 결정되지 않음을 시사한다.
- 10,000건 미만의 훈련 세트에서는 데이터 변형의 효과가 효과적이지 않으며, 이는 효과적인 데이터 증강을 위한 임계값 효과를 나타낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.