[논문 리뷰] Language Generation with Multi-Hop Reasoning on Commonsense Knowledge Graph
이 논문은 명시적이고 기반된 추론을 통해 생성을 향상시키기 위해 일반 지식 지식 그래프 위에서 동적 다중 힙 추론을 수행하는 새로운 텍스트 생성 모델인 GRF를 제안한다. 다중 관계 경로로부터 구조적 및 의미적 정보를 활용함으로써 GRF는 스토리 종료, 추론적 추론, 설명 생성 작업에서 강력한 베이스라인을 능가하며, 학습된 추론 경로를 통해 사실 일致성과 해석 가능성 향상을 입증한다.
Despite the success of generative pre-trained language models on a series of text generation tasks, they still suffer in cases where reasoning over underlying commonsense knowledge is required during generation. Existing approaches that integrate commonsense knowledge into generative pre-trained language models simply transfer relational knowledge by post-training on individual knowledge triples while ignoring rich connections within the knowledge graph. We argue that exploiting both the structural and semantic information of the knowledge graph facilitates commonsense-aware text generation. In this paper, we propose Generation with Multi-Hop Reasoning Flow (GRF) that enables pre-trained models with dynamic multi-hop reasoning on multi-relational paths extracted from the external commonsense knowledge graph. We empirically show that our model outperforms existing baselines on three text generation tasks that require reasoning over commonsense knowledge. We also demonstrate the effectiveness of the dynamic multi-hop reasoning module with reasoning paths inferred by the model that provide rationale to the generation.
연구 동기 및 목표
- 사전 훈련된 언어 모델이 암시적 일반 지식을 필요로 하는 텍스트 생성에서의 한계를 해결하기 위해.
- 기존 방법이 일반 지식 지식을 고립된 삼중항으로 간주하여 지식 그래프의 구조적 연결을 忽시하는 데서 비롯되는 단점을 극복하기 위해.
- 관계 경로를 따라 증거를 집계하는 동적 다중 힙 추론 기반 메커니즘을 개발하여 기반된 개념 생성을 위해.
- 사전 훈련된 언어 모델과 지식 그래프의 구조적 추론을 통합하여 텍스트 생성의 사실 일치성과 해석 가능성을 향상시키기 위해.
제안 방법
- 모델은 개념과 관계의 그래프 인식 표현을 생성하기 위해 비모수적 복합 연산을 사용하여 다중 관계 지식 그래프를 인코딩한다.
- 동적 다중 힙 추론 모듈은 다수의 관계 경로를 따라 증거를 집계하며, 문맥적 관련성과 경로의 타당성에 기반해 노드를 점수화한다.
- 모듈은 하이퍼파라미터 γ에 의해 제어되는 학습 가능한 게이트 메커니즘을 사용하여 국소적 및 장거리 증거 흐름을 균형 잡아, 과도한 스무딩 또는 경로의 과소 이용을 방지한다.
- 생성 헤드는 지식 그래프에서의 복사 확률과 어휘 단어 확률을 게이트 메커니즘을 통해 조합하여 정밀한 개념 선택을 가능하게 한다.
- 모델는 스토리 종료, 추론적 생성, 설명 생성과 같은 세 가지 일반 지식 기반 텍스트 생성 작업에서 엔드 투 엔드로 미세조정된다.
- 해석 가능성은 추론 경로를 시각화하여 입증되며, 모델이 다중 힙 증거 체인을 통해 주목할 만한 개념을 선택하는 방식을 보여준다.
실험 결과
연구 질문
- RQ1구조화된 일반 지식 지식 그래프에서의 다중 힙 추론은 단일 삼중항 또는 지식 없음 베이스라인 대비 사실 일치성 있는 텍스트 생성을 향상시키는가?
- RQ2관계 경로를 따라 동적 증거 집계가 문맥적 및 의미적으로 기반된 개념 생성 능력에 어떤 영향을 미치는가?
- RQ3지식 그래프에서의 구조적 지식 통합이 제한된 훈련 데이터에서 일반화 능력을 얼마나 향상시키는가?
- RQ4모델의 추론 경로가 그 생성 결정에 대한 타당한 근거로 간주될 수 있는가?
- RQ5다중 힙 추론 모듈의 정보 흐름 메커니즘 설계에 따라 성능에 얼마나 민감한가?
주요 결과
- GRF는 스토리 종료, 추론적 생성, 설명 생성 세 가지 일반 지식 기반 텍스트 생성 작업 전반에서, 텍스트 전용 데이터로 미세조정한 GPT-2 및 OMCS 삼중항으로 재학습한 GPT-2를 포함한 강력한 베이스라인을 모두 능가한다.
- 모델는 다양한 훈련 데이터 크기에서 일관된 성능 향상을 보이며, 지식 그래프 통합을 통해 일반화 능력 향상이 입증된다.
- 다중 힙 추론 모듈에서 γ ≈ 0.5일 때 최적의 성능가 도달하여 국소적 및 장거리 증거 활용의 균형이 중요함을 시사한다.
- 사례 연구 결과, GRF는 GPT-2와 같은 베이스라인 대비 더 구체적이고 문맥에 적절한 개념(예: '기절함', '옥수수로 만들어짐')을 생성함을 확인할 수 있었다.
- 시각화된 추론 경로를 통해 모델이 문맥적 단서와 관계의 타당성에 기반해 타당한 중간 개념(예: '강아지'에 대해 '기르다'라는 동사로 '입양하다')을 선택하는 것을 확인할 수 있었다.
- 인간 평가 결과, GRF 출력은 사실 기반이고 의미적으로 일관성이 있으며, 핵심 생성 결정에 대한 해석 가능한 근거를 제공하는 것으로 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.