[논문 리뷰] Attention-guided Generative Models for Extractive Question Answering
이 논문은 사전 훈련된 생성형 질문-답변 모델에서 교차 attention 패턴을 사용하여 답변 스파ن을 추출하는 방법을 제안한다. 이는 추가 파rameter 없이 추출형 QA를 가능하게 한다. 생성형과 추출형 목표를 함께 훈련시킴으로써, 더 적은 파rameter로 오픈 도메인 QA에서 최고 성능을 달성하고, attention 유도 스파인 패기지 메커니즘을 통해 환각 없는 추론을 가능하게 한다.
We propose a novel method for applying Transformer models to extractive question answering (QA) tasks. Recently, pretrained generative sequence-to-sequence (seq2seq) models have achieved great success in question answering. Contributing to the success of these models are internal attention mechanisms such as cross-attention. We propose a simple strategy to obtain an extractive answer span from the generative model by leveraging the decoder cross-attention patterns. Viewing cross-attention as an architectural prior, we apply joint training to further improve QA performance. Empirical results show that on open-domain question answering datasets like NaturalQuestions and TriviaQA, our method approaches state-of-the-art performance on both generative and extractive inference, all while using much fewer parameters. Furthermore, this strategy allows us to perform hallucination-free inference while conferring significant improvements to the model's ability to rerank relevant passages.
연구 동기 및 목표
- 사전 훈련된 생성형 모델 내의 교차 attention 패턴을 추출형 답변 스파인 예측을 위한 내장된 아키텍처 우선순위로 활용하기 위해.
- 생성형과 추출형 목표를 함께 훈련시켜 추출형 및 생성형 QA 성능을 모두 향상시키기 위해.
- 생성형 QA에서의 환각을 줄이기 위해 교차 attention에 맞춰진 스파인을 패기지 메커니즘으로 사용하기 위해.
- 교차 attention 점수를 통로의 관련성에 대한 대체 지표로 사용하여 통로 재정렬을 향상시키기 위해.
- attention 기반 증거를 폭 드러내어 블랙박스 생성형 QA 시스템의 해석 가능성을 향상시키기 위해.
제안 방법
- 생성된 토큰과 입력 컨텍스트 토큰 간의 디코더 교차 attention 가중치를 사용하여 답변에 가장 관련성이 높은 컨텍스트 스파인을 식별한다.
- 교차 attention이 지도 학습에서 참값 답변 스파인과 일치하도록 유도하는 미분 가능한 스파인 추출 손실을 적용한다.
- 표준 크로스 엔트로피 손실과 attention 일치 기반의 스파인 추출 손실을 조합한 손실을 사용하여 단일 시퀀스-투-시퀀스 Transformer 모델을 훈련한다.
- 생성 출력이 맥락을 벗어나 있거나 환각된 경우, 상위-k attention 가중치를 가진 컨텍스트 토큰들을 패기지 답변으로 사용한다.
- 답변 관련 토큰에 대한 attention 가중치의 합을 사용해 통로 점수를 계산하여 검색된 통로를 재정렬한다.
- attention 메커니즘을 통로 검색을 위한 약한 감독 신호로 활용하여 추가 훈련 없이도 재정렬 성능을 향상시킨다.
실험 결과
연구 질문
- RQ1생성형 QA 모델 내의 교차 attention 패턴을 아키텍처 수정 없이 정확한 답변 스파인 추출에 사용할 수 있는가?
- RQ2생성형과 추출형 목표를 함께 훈련하면 추출형 및 생성형 QA 작업 양쪽 성능이 향상되는가?
- RQ3attention 기반 스파인 추출이 생성형 QA에서 환각을 방지하는 효과적인 패기지 메커니즘이 될 수 있는가?
- RQ4교차 attention 점수는 검색 시스템에서 통로의 관련성에 대한 신뢰할 수 있는 대체 지표가 될 수 있는가?
- RQ5attention 패턴을 사용하면 오픈 도메인 환경에서 생성형 QA 모델의 해석 가능성은 향상되는가?
주요 결과
- 제안된 attention 유도 스파인 추출 방법은 더 적은 파rameter를 사용하면서도 최고 수준의 추출형 모델과 유사한 성능을 달성한다.
- NaturalQuestions와 TriviaQA에서, 단일 통합 아키텍처로 생성형 및 추출형 추론에서 최고 성능을 기록한다.
- 교차 attention에 맞춰진 스파인을 패기지로 사용함으로써 환각을 줄여 산업용 QA 시스템의 신뢰성을 향상시킨다.
- 교차 attention 점수는 통로의 관련성에 효과적인 대체 지표로 기능하여 이전의 신경 기반 검색 기반 모델 대비 통로 재정렬 성능을 향상시킨다.
- FiD 모델에서 추출형 감독을 함께 훈련함으로써 통로 재정렬 정확도가 5.5%p 향상되었으며, 이는 표 4에 나타나 있다.
- 증거 기반 attention 패턴을 폭 드러냄으로써 생성형 QA 출력의 투명성과 신뢰성을 높여 모델의 해석 가능성을 향상시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.