[논문 리뷰] Negated LAMA: Birds cannot fly
이 논문은 사전에 학습된 언어 모델(PLMs)의 사실 지식 유지 능력을 평가하기 위해 부정과 오류 유도 자극을 위한 두 가지 탐색 작업을 도입한다. 연구 결과, PLMs는 부정된 문장과 부정되지 않은 문장의 콘셉스 질문을 구분하지 못하며, 불필요한 오류 유도 자극에 쉽게 혼란스러워지므로 인간처럼 사실 지식을 학습하는 데 상당한 한계가 있음을 시사한다.
Building on Petroni et al. (2019), we propose two new probing tasks analyzing factual knowledge stored in Pretrained Language Models (PLMs). (1) Negation. We find that PLMs do not distinguish between negated (Birds cannot [MASK]) and non-negated (Birds can [MASK]) cloze questions. (2) Mispriming. Inspired by priming methods in human psychology, we add misprimes to cloze questions (Talk? Birds can [MASK]). We find that PLMs are easily distracted by misprimes. These results suggest that PLMs still have a long way to go to adequately learn human-like factual knowledge.
연구 동기 및 목표
- 사전에 학습된 언어 모델(PLMs)이 부정된 문장과 부정되지 않은 사실적 문장 간의 정확한 표현과 구분을 할 수 있는지 조사하기 위해.
- PLMs가 콘셉스 스타일 질문에서 관련 없거나 오해의 소지가 있는 맥락적 단서에 의해 방해받는지 여부를 검토하기 위해.
- PLMs가 인간처럼 추론하고 강건성을 갖춘 방식으로 사실 지식을 내재화하는 정도를 평가하기 위해.
- PLMs의 사실 지식 표현에 근본적인 약점을 드러내는 탐색 작업을 개발하기 위해.
제안 방법
- 콘셉스 질문을 부정된 형태(예: '새들은 [MASK]할 수 없다')와 비부정된 형태(예: '새들은 [MASK]할 수 있다')로 제시하는 부정 탐색 작업을 설계한다.
- 두 형태 모두 동일한 사실 지식(예: '날다'가 정답)을 사용하여 모델의 부정 처리 능력을 고립적으로 평가한다.
- 콘셉스 질문 이전에 관련 없거나 오해의 소지가 있는 단어(예: '말하다?')를 오류 유도 자극으로 도입하여 모델의 강건성을 테스트한다.
- 마스크된 토큰에 대한 모델 예측을 측정하여, 부정이나 오류 유도 자극이 모델의 출력에 이해를 반영하는 방식으로 영향을 미치는지 평가한다.
- 표준, 부정된, 오류 유도 자극이 포함된 콘셉스 질문 간의 예측 정확도와 신뢰도를 비교한다.
- 탐색 프레임워크를 LAMA 벤치마크(Petroni 등, 2019)에 기반으로 하되, 부정 및 오류 유도 자극 변형을 추가로 확장한다.
실험 결과
연구 질문
- RQ1문장이 부정되었을 때 PLMs가 콘셉스 질문에서 정답을 올바르게 식별할 수 있는가?
- RQ2오류 유도 자극이 콘셉스 질문의 모델 예측에 유의미하게 영향을 미치는가?
- RQ3부정된 문장과 오류 유도 자극이 포함된 콘셉스 질문에서의 성능이 표준 사실 기반 콘셉스 질문에서의 성능과 비교해 어떻게 다른가?
- RQ4구문적 및 맥락적 변형에 노출되었을 때 PLMs가 인간처럼 사실 지식를 이해하는 정도는 어느 정도인가?
주요 결과
- PLMs는 부정된 문장과 부정되지 않은 문장의 콘셉스 질문을 구분하지 못하며, 둘 다 정답에 유사한 확률을 부여하는 경우가 많다.
- 문장이 부정되었을 때도 모델의 정확도나 신뢰도에 유의미한 감소가 없어, 부정 처리 능력이 떨어지는 것으로 나타났다.
- '말하다?'와 같은 오류 유도 자극이 모델의 예측에 유의미하게 영향을 미쳐 잘못되거나 일관되지 않은 출력을 유도한다.
- 모델의 예측은 의미적으로 관련 없는 맥락에 쉽게 흔들리므로, 약한 추론 능력과 주의 집중 제어 능력을 보인다.
- 이러한 결과는 PLMs가 사실 지식를 인간처럼 강건하고 체계적인 사실로 저장하는 것이 아니라, 취약하고 맥락에 민감한 방식으로 저장한다는 것을 시사한다.
- 이러한 발견은 PLMs가 인간 인지와 유사한 방식으로 사실 지식를 학습하고 적용하는 데에 중요한 격차가 있음을 드러낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.