Skip to main content
QUICK REVIEW

[논문 리뷰] P-Adapters: Robustly Extracting Factual Information from Language Models with Diverse Prompts

Benjamin Newman, Prafulla Kumar Choubey|arXiv (Cornell University)|2021. 10. 14.
Topic Modeling인용 수 11
한 줄 요약

P-Adapters는 냉각된 대규모 언어 모델(LLMs)의 임bedding 레이어와 첫 번째 어텐션 레이어 사이에 위치하는 경량의 훈련 가능한 어댑터로, 자연어 프롬프트를 최적화된 연속 프롬프트로 변환하여 사실 정보 추출을 향상시킵니다. 자연어 프롬프팅만으로는 12–26%의 정밀도 향상과 36–50%의 일관성 향상을 달성하며, 성공의 주요 원인은 프롬프트의 주제 실체에 대한 LLM의 임베딩에 접근할 수 있다는 데에 있습니다.

ABSTRACT

Recent work (e.g. LAMA (Petroni et al., 2019)) has found that the quality of the factual information extracted from Large Language Models (LLMs) depends on the prompts used to query them. This inconsistency is problematic because different users will query LLMs for the same information using different wording, but should receive the same, accurate responses regardless. In this work we aim to address this shortcoming by introducing P-Adapters: lightweight models that sit between the embedding layer and first attention layer of LLMs. They take LLM embeddings as input and output continuous prompts that are used to query the LLM. Additionally, we investigate Mixture of Experts (MoE) models that learn a set of continuous prompts ("experts") and select one to query the LLM. They require a separate classifier trained on human-annotated data to map natural language prompts to the continuous ones. P-Adapters perform comparably to the more complex MoE models in extracting factual information from BERT and RoBERTa while eliminating the need for additional annotations. P-Adapters show between 12-26% absolute improvement in precision and 36-50% absolute improvement in consistency over a baseline of only using natural language queries. Finally, we investigate what makes P-Adapters successful and conclude that a significant factor is access to the LLM's embeddings of the original natural language prompt, particularly the subject of the entity pair being queried.

연구 동기 및 목표

  • 의미적으로 동일하지만 어휘가 다른 프롬프트를 사용할 때 LLM에서 사실 정보 추출의 일관성 문제를 해결하기 위해.
  • 추론 시 관계 애너테이션이나 주제 정체성 정보가 필요 없이 자연어 프롬프트만을 요구하는 방법을 개발하기 위해.
  • 사용자 중심 환경에서 프롬프트 변형이 불가피한 상황에서 냉각된 LLM의 사실 추출의 강건성과 정확도를 향상시키기 위해.
  • LLM의 프롬프트 주제에 대한 내부 임베딩에 접근하는 것이 성능에 상당한 기여를 하는지 조사하기 위해.

제안 방법

  • P-Adapters는 냉각된 LLM의 임베딩 레이어와 첫 번째 어텐션 레이어 사이에 삽입되는 경량 신경망으로, 입력 임베딩을 받아 연속 프롬프트를 출력합니다.
  • 이 어댑터는 훈련 시 관계 애너테이션이나 주제 정체성을 요구하지 않고, 오직 (프롬프트, 객체) 쌍만을 사용해 엔드 투 엔드로 훈련됩니다.
  • 모델은 다양한 자연어 프롬프트를 공통의 최적의 연속 프롬프트 표현으로 매핑함으로써 사실 예측 성능을 향상시킵니다.
  • 다양한 표현 방식으로 같은 사실을 묘사하는 프롬프트들이 동일한 예측 객체로 매핑되도록 함으로써, 암묵적으로 일관성을 장려합니다.
  • Prefix P-Adapter는 학습 가능한 프리픽스 토큰을 사용해 입력을 조건화하는 반면, Rewrite P-Adapter는 연속 공간에서 프롬프트를 재구성하려고 시도합니다.
  • 이 방법은 관계 애너테이션과 주제 정체성을 기반으로 관계별 전문가 프롬프트를 선택해야 하는 Mixture-of-Experts (MoE) 모델과 비교됩니다.

실험 결과

연구 질문

  • RQ1추론 시 관계 애너테이션이나 주제 정체성을 요구하지 않고도 냉각된 LLM에서 사실 정보 추출을 향상시킬 수 있을까?
  • RQ2LLM의 프롬프트 주제에 대한 내부 임베딩에 접근하는 것이 프롬프트 적응 방법의 성능에 어떤 영향을 미치는가?
  • RQ3경량 어댑터 모델이 다양한 프롬프트 표현 방식에 대해 자연어 프롬프팅에 비해 정밀도와 일관성 측면에서 얼마나 뛰어난 성능을 낼 수 있는가?
  • RQ4관계 자체가 아니라 전체 자연어 프롬프트를 기반으로 어댑터를 조건화하는 것이 더 나은 일반화 성능을 이끌어내는가?
  • RQ5더 적은 감독 신호를 사용하면서도 P-Adapters가 다른 프롬프트 최적화 방법보다 뛰어난 성능을 내는 이유는 무엇인가?

주요 결과

  • P-Adapters는 자연어 프롬프팅만으로는 12–26%의 정밀도 향상과 36–50%의 일관성 향상을 달성하며, 사실 추출 작업에서 뛰어난 성능을 보입니다.
  • LLM의 프롬프트 주제에 대한 임베딩에 접근할 수 없는 경우 P-Adapters의 성능은 크게 떨어지며, 이는 주제 인식 표현이 핵심임을 시사합니다.
  • 관계 애너테이션과 주제 정체성을 요구하는 더 복잡한 Mixture-of-Experts (MoE) 모델과 비교해도 P-Adapters는 유사한 성능을 보이며, 이러한 요구 조건이 필요하지 않습니다.
  • Prefix P-Adapter 버전은 MoE 모델에 근접한 성능을 달성하여, 단순한 프리픽스 테이닝이 매우 효과적일 수 있음을 시사합니다.
  • 최적의 프롬프트 튜닝을 해도 오라클 방법은 내분포 객체에 대해 50%의 정밀도, 외분포 객체에 대해 25%의 정밀도에 그치며, 이는 프롬프트 최적화의 본질적 한계를 보여줍니다.
  • 이 연구는 LLM의 사실 지식가 프롬프트 어휘에 매우 민감하며, P-Adapters를 통한 소규모이고 학습 가능한 프롬프트 조정이 신뢰성 향상에 크게 기여할 수 있음을 확인합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.