Skip to main content
QUICK REVIEW

[논문 리뷰] Augmenting Transformers with KNN-Based Composite Memory for Dialogue

Angela Fan, Claire Gardent|arXiv (Cornell University)|2020. 04. 27.
Topic Modeling참고 문헌 48인용 수 18
한 줄 요약

이 논문은 다양한 소스—예를 들어 위키백과, 이미지, 대화 기록—로부터 외부 지식을 효율적이고 확장 가능한 방식으로 접근할 수 있도록 K-최근접 이웃 검색을 사용해 사전에 인코딩된 지식 기반으로 KNN 기반 정보 검색(KIF) 모듈을 제안한다. 이 방법은 대화의 자연스러움과 사실 기반 성능을 햖스켜, 인간 평가 기반 응답 품질이 검색 전용 모델과 비슷한 성능을 달성한 워즈더위키백과 및 엔진징이미지챗에서 최신 기술 수준을 달성한다.

ABSTRACT

Various machine learning tasks can benefit from access to external information of different modalities, such as text and images. Recent work has focused on learning architectures with large memories capable of storing this knowledge. We propose augmenting generative Transformer neural networks with KNN-based Information Fetching (KIF) modules. Each KIF module learns a read operation to access fixed external knowledge. We apply these modules to generative dialog modeling, a challenging task where information must be flexibly retrieved and incorporated to maintain the topic and flow of conversation. We demonstrate the effectiveness of our approach by identifying relevant knowledge required for knowledgeable but engaging dialog from Wikipedia, images, and human-written dialog utterances, and show that leveraging this retrieved information improves model performance, measured by automatic and human evaluation.

연구 동기 및 목표

  • 생성형 대화 모델이 다양한 모odal(예: 텍스트, 이미지, 대화 기록)에서 동적으로 관련 외부 지식을 검색하고 통합할 수 있도록 하기.
  • 메모리 자체를 훈련하지 않고도 큰 고정된 외부 지식 기반에서 관련 정보를 효율적으로 검색하는 과제를 해결하기.
  • 다양한 지식을 맥락 인식 표현과 결합하여 기계학습 가능한 방식으로 확장 가능하게 하여 대화 품질을 향상시키기.
  • 모델의 응답을 조절하는 특정이고 인간이 읽을 수 있는 지식 요소를 검색함으로써 해석 가능성 확보하기.
  • 자동 평가 및 인간 평가를 통한 다중 모odal, 다중 소스 환경에서 KIF의 효과성 평가하기.

제안 방법

  • KIF 모듈은 위키백과 문장이나 이미지-발화 쌍과 같은 사전에 인코딩된 외부 소스에서 관련 지식을 K-최근접 이웃(KNN) 검색을 통해 검색한다.
  • 각 KIF 모듈은 대화 맥락에서 유도된 쿼리 임베딩을 바탕으로 유사도 측정 기준을 사용해 고정된 메모리 백업에서 가장 가까운 이웃을 검색한다.
  • 검색된 지식은 재임베딩되며, 가중치 합을 계산하는 학습 가능한 게이팅 메커니즘을 통해 조합된다.
  • 모델은 검색된 지식을 맥락 표현과 연결하여 디코더에 통합함으로써 엔드 투 엔드 훈련이 가능하게 한다.
  • 다중 스텝 검색은 KIF를 층 또는 순차적으로 여러 번 적용함으로써 모방되며, 중복 검색을 방지하기 위한 제약 조건이 적용된다.
  • FAISS와 같은 효율적인 라이브러리를 활용해 GPU 가속 KNN 추론을 구현함으로써 대규모 메모리 백업에 대한 확장성 확보

실험 결과

연구 질문

  • RQ1KNN 기반 검색이 대화 맥락에서 다양한 다중 모달 소스(예: 위키백과, 이미지, 대화 기록)로부터 관련 지식을 효과적으로 식별할 수 있는가?
  • RQ2검색된 지식을 통합함으로써 생성형 대화 모델의 사실 정확도와 자연스러움이 어떻게 향상되는가?
  • RQ3다양한 지식 소스와 다중 스텝 검색을 사용할 경우 모델 성능에 어떤 영향을 미치는가?
  • RQ4게이팅 메커니즘이 불필요하거나 노이즈가 많은 검색된 정보를 걸러내는 데 모델의 능력에 어떤 영향을 미치는가?
  • RQ5쿼리 표현 방식(예: 이전 발화, 대화 맥락, 턴 번호)의 선택이 검색 품질과 최종 성능에 어느 정도 영향을 미치는가?

주요 결과

  • KIF를 통한 트랜스포머 개선 모델은 워즈더위키백과 데이터셋에서 F1 스코어 27.4를 기록하여 이전 발화나 대화 맥락만을 사용하는 모델보다 뛰어난 성능을 보였다.
  • 대화 맥락과 턴 임베딩을 통합함으로써 이전 발화만을 사용하는 것보다 F1 스코어가 1.0 포인트 향상되었다.
  • 다양한 네트워크 깊이에서 지식을 검색하는 데 다수의 KIF 모듈을 사용한 결과 F1 스코어 26.5를 기록했으며, 단일 모듈를 사용한 다중 검색 설정(26.9 F1)과 유사한 성능을 보여, 층에 걸쳐 검색을 분산하는 데 유의미한 이점이 없음을 시사했다.
  • 2~3단계의 다중 스텝 검색은 성능 향상에 기여하지 않았으며, 이는 각 발화가 단일 지식 문장에 기반하여 설계된 데이터셋의 특성 때문일 가능성이 높다.
  • 게이팅 메커니즘이 없는 상태에서 관련 없는 지식 소스(예: 퍼스나챗)를 포함시켰을 경우 성능이 저하되었지만, 게이팅 메커니즘이 복구함으로써 거의 전체 성능을 회복함으로써 노이즈 필터링에 효과적임을 입증했다.
  • K=3일 때 KNN 성능이 최적임을 확인하였으며, 이 이상의 K 값을 증가시킬 경우 가중치 합에서 정보의 흐림 현상이 발생해 성능 저하가 발생했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.