Skip to main content
QUICK REVIEW

[논문 리뷰] GraphFormers: GNN-nested Language Models for Linked Text Representation.

Junhan Yang, Zheng Liu|arXiv (Cornell University)|2021. 05. 06.
Topic Modeling참고 문헌 42인용 수 9
한 줄 요약

GraphFormers는 사전 fine-tuned 언어 모델의 각 트랜스포머 레이어 내에 그래프 신경망을 통합하여 주변 정보를 반복적으로 활용함으로써 텍스트 표현을 향상시키는 새로운 아키텍처를 제안한다. 이는 종단 간 통합 방식으로 연결된 텍스트 표현 품질을 향상시키며, 단방향 버전은 높은 효율성을 제공하고 대규모 데이터셋에서 더 강력한 기준 모델과 유사한 성능을 달성한다.

ABSTRACT

Linked text representation is critical for many intelligent web applications, such as online advertisement and recommender systems. Recent breakthroughs on pretrained language models and graph neural networks facilitate the development of corresponding techniques. However, the existing works mainly rely on cascaded model structures: the texts are independently encoded by language models at first, and the textual embeddings are further aggregated by graph neural networks. We argue that the neighbourhood information is insufficiently utilized within the above process, which restricts the representation quality. In this work, we propose GraphFormers, where graph neural networks are nested alongside each transformer layer of the language models. On top of the above architecture, the linked texts will iteratively extract neighbourhood information for the enhancement of their own semantics. Such an iterative workflow gives rise to more effective utilization of neighbourhood information, which contributes to the representation quality. We further introduce an adaptation called unidirectional GraphFormers, which is much more efficient and comparably effective; and we leverage a pretraining strategy called the neighbourhood-aware masked language modeling to enhance the training effect. We perform extensive experiment studies with three large-scale linked text datasets, whose results verify the effectiveness of our proposed methods.

연구 동기 및 목표

  • 연결된 텍스트 표현에서 계단식 모델 구조의 한계를 해결하기 위해, 주변 정보가 충분히 활용되지 않는 문제를 해결하기 위해.
  • 트랜스포머 아키텍처 내에서 반복적이고 이방향 주변 정보 추출을 통해 텍스트 표현 품질을 향상시키기 위해.
  • 강력한 성능을 유지하면서 계산 비용을 줄이는 효율적인 단방향 GraphFormers 버전을 설계하기 위해.
  • 문맥적 및 구조적 의존성 학습을 향상시키기 위해, 주변 정보를 고려한 마스킹된 언어 모델링 전략을 개발하기 위해.

제안 방법

  • GraphFormers는 언어 모델의 각 트랜스포머 레이어에 그래프 신경망을 직접 통합하여, 각 토큰이 자신의 컨텍스트뿐 아니라 지식 그래프 내의 이웃 노드를 모두 고려할 수 있도록 한다.
  • 모델은 그래프 구조를 따라 반복적인 메시지 전달 메커니즘을 활용하여, 다중 라운드의 주변 집합을 통해 토큰 표현을 정교화한다.
  • 마스킹된 토큰 예측과 그래프 구조 인식 표현 학습을 동시에 최적화하기 위해 새로운 전사전 학습 목표인 주변 정보 인식 마스킹된 언어 모델링을 도입한다.
  • 단방향 GraphFormers 버전은 메시지 전달을 단일 방향으로 제한하여 계산량을 줄이면서도 대부분의 성능 향상을 유지한다.
  • 텍스트 및 구조적 정보가 별도로 처리되는 것이 아니라 종단 간 학습이 가능하도록 아키텍처를 설계하여, 함께 최적화되도록 한다.
  • 대부분의 표현 학습 과정에서 주변 노드의 중요도를 동적으로 조정하기 위해 그래프 구조적 특징을 강화한 어텐션 메커니즘을 활용한다.

실험 결과

연구 질문

  • RQ1트랜스포머 레이어 내에 GNN을 내장함으로써 계단식 아키텍처를 초월해 연결된 텍스트 표현을 향상시킬 수 있는가?
  • RQ2트랜스포머 레이어 내에서 반복적인 주변 정보 집합이 표현 품질에 어떤 영향을 미치는가?
  • RQ3GraphFormers에서 이방향 대비 단방향 메시지 전달을 사용할 경우 성능와 효율성 간의 상호 교환 관계는 어떠한가?
  • RQ4주변 정보 인식 마스킹된 언어 모델링 전사전 학습 전략이 하류 표현 학습에 얼마나 기여하는가?
  • RQ5대규모 연결된 텍스트 벤치마크에서 GraphFormers는 최신 기준 모델과 비교해 어떻게 성능을 내는가?

주요 결과

  • GraphFormers는 세 개의 대규모 연결된 텍스트 데이터셋에서 최신 기준 성능을 달성하여, 계단식 모델 대비 뛰어난 표현 품질을 입증한다.
  • 단방향 GraphFormers 버전은 전체 이방향 버전과 유사한 성능을 달성하면서도 계산 비용을 크게 줄였다.
  • 주변 정보 인식 마스킹된 언어 모델링 전사전 학습 전략은 하류 표현 학습에서 측정 가능한 향상을 이끌어냈다.
  • 트랜스포머 레이어 내에서 반복적인 주변 인코딩은 정적 또는 단일 라운드 집합보다 그래프 구조적 정보를 더 효과적으로 활용한다.
  • 다양한 평가 지표에서 일관된 성능 향상을 보이며, 내장된 GNN-트랜스포머 아키텍처의 효과성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.