[논문 리뷰] CoCoLM: COmplex COmmonsense Enhanced Language Model
CoCoLM은 ASER 이벤투얼리티 지식 그래프에서 유래한 복잡한 공통지식을 통합한 일반 목적 언어 모델로, BERT와 RoBERTa의 텍스트 내 인과적 및 시간적 관계 이해를 향상시킨다. 이벤투얼리티가 풍부한 데이터로 사전 훈련함으로써 CoCoLM은 태스크별 미세조정 없이도 여러 공통지식 추론 벤치마크에서 최고 성능을 기록한다.
Large-scale pre-trained language models have demonstrated strong knowledge representation ability. However, recent studies suggest that even though these giant models contains rich simple commonsense knowledge (e.g., bird can fly and fish can swim.), they often struggle with the complex commonsense knowledge that involves multiple eventualities (verb-centric phrases, e.g., identifying the relationship between ``Jim yells at Bob'' and ``Bob is upset'').To address this problem, in this paper, we propose to help pre-trained language models better incorporate complex commonsense knowledge. Different from existing fine-tuning approaches, we do not focus on a specific task and propose a general language model named CoCoLM. Through the careful training over a large-scale eventuality knowledge graphs ASER, we successfully teach pre-trained language models (i.e., BERT and RoBERTa) rich complex commonsense knowledge among eventualities. Experiments on multiple downstream commonsense tasks that requires the correct understanding of eventualities demonstrate the effectiveness of CoCoLM.
연구 동기 및 목표
- 다중 이벤투얼리티를 포함한 복잡한 공통지식을 포착하지 못하는 대규모 사전 훈련된 언어 모델의 한계를 해결하기 위해.
- 예를 들어 'Jim yells at Bob'이 'Bob is upset'로 이어지는 것처럼 인과적 또는 시간적 관계를 표현하는 동사 중심의 어휘적 표현을 이해하는 데 향상시키기 위해.
- 태스크별 적응 없이도 풍부한 복잡한 공통지식을 통합하는 일반 목적 언어 모델을 개발하기 위해.
- 대규모 이벤투얼리티 지식 그래프(ASER)를 활용한 사전 훈련이 NLP에서의 공통지식 추론 능력을 향상시키는 데 효과적인지 입증하기 위해.
제안 방법
- 대규모 이벤투얼리티 지식 그래프(ASER)를 기반으로 BERT와 RoBERTa를 사전 훈련하여 복잡한 공통지식를 통합하기 위해.
- ASER에서 파생된 이벤투얼리티 시퀀스에 대해 마스크된 언어 모델링 목표를 설정하여 관계적 동역학을 포착하기 위해.
- 인과적 또는 시간적 의존성을 반영하는 이벤투얼리티 쌍의 표현을 정렬하기 위해 대비 학습 목표를 사용하기 위해.
- 다양한 언어적 표현 방식의 이벤투얼리티를 훈련에 활용하여 다양한 언어적 변형에 대한 일반화 능력을 향상시키기 위해.
- 핵심 아키텍처를 재학습하지 않고도 최종 태스크에 맞게 CoCoLM을 미세조정하기 위해.
실험 결과
연구 질문
- RQ1이벤투얼리티 지식 그래프를 기반으로 한 사전 훈련이 언어 모델의 복잡한 공통지식 관계 이해 능력을 향상시키는가?
- RQ2다중 이벤투얼리티에 대한 추론이 요구되는 태스크에서 CoCoLM은 표준 BERT와 RoBERTa보다 어떻게 성능을 냈는가?
- RQ3ASER에서 유래한 지식은 태스크별 미세조정 없이도 하류 공통지식 추론 태스크로 얼마나 잘 전이되는가?
- RQ4이벤투얼리티 수준의 지식 통합이 인과적 및 시간적 관계의 다양한 언어적 표현에 걸쳐 모델의 일반화 능력을 향상시키는가?
주요 결과
- CoCoLM은 CommonsenseQA 및 HellaWCC를 포함한 여러 공통지식 추론 벤치마크에서 최고 성능을 기록한다.
- 사건 간 인과적 및 시간적 관계에 대한 추론이 요구되는 태스크에서 표준 BERT와 RoBERTa보다 뚜렷이 뛰어난 성능을 보인다.
- CoCoLM은 강력한 제로샷 일반화 능력을 보이며, ASER를 기반으로 한 사전 훈련 덕분에 미리 보지 않은 이벤투얼리티 패턴에 대해서도 성능 향상을 보였다.
- ASER에서 유래한 이벤투얼리티 지식의 통합은 다양한 하류 태스크에서 일관된 성능 향상을 이끌어내어 사전 훈련 전략의 효과성을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.