Skip to main content
QUICK REVIEW

[논문 리뷰] Accurate, yet inconsistent? Consistency Analysis on Language Understanding Models

Myeongjun Jang, Deuk Sin Kwon|arXiv (Cornell University)|2021. 08. 15.
Topic Modeling참고 문헌 45인용 수 7
한 줄 요약

이 논문은 문맥을 유지하는 변형 기법(역순 및 동의어 치환 등)을 적용하여 미세조정된 사전학습된 언어 모델(PLMs)의 일관성 평가를 위한 CALUM 프레임워크를 소개한다. 실험 결과, 현재의 PLMs는 의미적으로 동일한 입력에 대해 자주 일관성 없는 예측을 내놓지만, 의미적 텍스트 유사도(STS) 작업을 포함한 다중작업 학습을 통해 평균 13%의 일관성 향상을 달성한다.

ABSTRACT

Consistency, which refers to the capability of generating the same predictions for semantically similar contexts, is a highly desirable property for a sound language understanding model. Although recent pretrained language models (PLMs) deliver outstanding performance in various downstream tasks, they should exhibit consistent behaviour provided the models truly understand language. In this paper, we propose a simple framework named consistency analysis on language understanding models (CALUM)} to evaluate the model's lower-bound consistency ability. Through experiments, we confirmed that current PLMs are prone to generate inconsistent predictions even for semantically identical inputs. We also observed that multi-task training with paraphrase identification tasks is of benefit to improve consistency, increasing the consistency by 13% on average.

연구 동기 및 목표

  • 사전학습된 언어 모델(PLMs)이 의미적으로 동일한 입력에 대해 일관된 행동을 보이는지 조사하는 것.
  • 다양한 언어 이해 작업과 언어에서 PLMs의 하한 일관성 능력을 평가하는 것.
  • 의미적 텍스트 유사도(STS) 작업을 포함한 다중작업 학습이 모델의 일관성 향상에 기여하는지 탐색하는 것.
  • 작업 특화 데이터 증강 또는 인간이 애너테이션한 변형에 의존하지 않는 일반화 가능한 평가 프레임워크를 개발하는 것.

제안 방법

  • 의미를 유지하는 경미한 변형(예: 문장 순서 뒤집기 또는 동의어 치환)을 적용하는 CALUM 프레임워크를 제안한다.
  • 의미적으로 동일한 입력 쌍을 생성하기 위해 역순(REVERSE) 및 동의어 기반(SIGNAL) 변형을 사용하여 일관성 평가를 수행한다.
  • MT-DNN 아키텍처를 사용한 다중작업 학습 설정을 활용하며, 인코더는 공유하고 분류기는 작업별로 별도로 구성한다.
  • 주요 NLP 작업(MNLI, QNLI, RTE 등)과 보조 STS 작업(QQP, MRPC)을 함께 학습시켜 일관성에 미치는 영향을 평가한다.
  • 일관성은 변형된 입력 쌍 간에 예측이 동일하게 유지된 비율로 측정한다.
  • 다양한 백본 모델(RoBERTa, Electra, GPT2)을 대상으로 단일작업 모델과 다중작업 모델(Multitask-Para 및 Multitask-All) 간의 일관성과 정확도를 비교한다.

실험 결과

연구 질문

  • RQ1미세조정된 PLMs가 의미적으로 동일한 입력에 대해 얼마나 일관성 없는 예측을 내놓는가?
  • RQ2의미적 텍스트 유사도(STS) 작업을 포함한 다중작업 학습이 PLMs의 일관성 향상에 기여하는가?
  • RQ3STS 작업을 보조 목표로 포함하는 것과 다른 비-STs 작업을 포함하는 것 간의 일관성 향상 정도를 비교할 경우 어떤가?
  • RQ4STS 기반 다중작업 학습의 이점은 인코더 기반 모델과 디코더 기반 모델 간의 아키텍처 차이에 따라 일반화되는가?

주요 결과

  • 현재의 PLMs는 의미적으로 동일한 입력에 대해 심각한 일관성 결여를 보이며, 다양한 작업과 언어에서 일관성 없는 예측을 내놓는다.
  • STS 작업(QQP 및 MRPC)을 포함한 다중작업 학습은 평가된 모든 작업과 모델에서 평균 13%의 일관성 향상을 이끌어낸다.
  • STS 작업만을 사용하는 Multitask-Para 모델은 일관성에서 단일작업 기반 모델을 항상 뛰어넘으며, 특히 REVERSE 경우에서 두드러진 성능 향상을 보여, STS 데이터만으로도 일관성 향상이 가능함을 시사한다.
  • 인코더 기반 모델(RoBERTa, Electra)의 경우 Multitask-All 모델(모든 다섯 개 작업 포함)이 Multitask-Para 모델보다 높은 일관성을 달성했지만, 항상 유의미한 차이가 있는 것은 아니었다.
  • 디코더 기반 모델(GPT2)의 경우 REVERSE 경우에서 Multitask-Para 모델이 Multitask-All 모델보다 더 높은 일관성을 보였으며, 이는 모델 아키텍처에 따라 보조 작업을 활용하는 방식의 차이가 있음을 시사한다.
  • 정확도에 유의미한 하락이 동반되지 않음으로써, 일관성 향상의 이점이 주 작업 성능을 희생시키지 않음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.