[논문 리뷰] PEER: A Collaborative Language Model
PEER는 인간의 글쓰기를 시뮬레이션하기 위해 계획, 편집, 설명, 반복적으로 작동하는 협업형 언어 모델을 훈련시키며, Wikipedia 편집 이력과 합성 인필링을 활용하여 새로운 도메인에 일반화합니다.
Textual content is often the output of a collaborative writing process: We start with an initial draft, ask for suggestions, and repeatedly make changes. Agnostic of this process, today's language models are trained to generate only the final result. As a consequence, they lack several abilities crucial for collaborative writing: They are unable to update existing texts, difficult to control and incapable of verbally planning or explaining their actions. To address these shortcomings, we introduce PEER, a collaborative language model that is trained to imitate the entire writing process itself: PEER can write drafts, add suggestions, propose edits and provide explanations for its actions. Crucially, we train multiple instances of PEER able to infill various parts of the writing process, enabling the use of self-training techniques for increasing the quality, amount and diversity of training data. This unlocks PEER's full potential by making it applicable in domains for which no edit histories are available and improving its ability to follow instructions, to write useful comments, and to explain its actions. We show that PEER achieves strong performance across various domains and editing tasks.
연구 동기 및 목표
- 단일 패스 생성을 넘어 협력적 글쓰기가 필요하다는 필요성을 제시한다.
- 반복적 텍스트 편집을 모델링하기 위한 프레임워크(Plan, Edit, Explain, Repeat)를 제안한다.
- PEER를 도메인 일반 편집에 대한 학습시키기 위해 Wikipedia 편집 이력과 합성 인필링을 활용한다.
- 데이터 다양성과 품질을 높이기 위해 편집 프로세스의 누락된 구성요소를 인필링하여 자기훈련을 가능하게 한다.
- 협업 언어 모델 연구를 지원하기 위해 모델, 데이터 및 코드를 공개한다.
제안 방법
- PEER를 편집 계획, 편집 적용, 변화 설명 사이를 교대하는 반복적 프로세스로 모델링한다.
- 편집을 증거에 기반하도록 검색된 배경 문서를 입력에 보강한다.
- 편집 프로세스의 누락된 부분을 추론하기 위해 여러 PEER 변형을 학습한다(PEER-Edit, PEER-Undo, PEER-Explain, PEER-Document).
- 합성 데이터 생성(infill)을 사용하여 PEER-Undo 및 관련 변형을 통해 Wikipedia 편집을 넘는 학습 데이터를 확장한다.
- 훈련 및 추론 중 출력 방향을 제어하는 토큰(계획, 설명 길이, 종료 동작, 문서 포함)을 적용한다.
- Wikipedia 편집 이력을 전처리하여 x_t에서 x_{t+1}로의 튜플을 계획 p_t, 편집, 설명 e_t 및 관련 문서 D_t와 함께 구축한다.
실험 결과
연구 질문
- RQ1PEER가 편집 이력이 없는 도메인에서도 계획을 따르고 편집을 수행할 수 있으며, PEER-Undo를 사용한 자기훈련으로 이를 도울 수 있는가?
- RQ2Wikipedia 기반의 계획을 인간이 작성한 지시로 옮길 수 있으며, PEER-Explain의 합성 계획이 이를 개선할 수 있는가?
- RQ3PEER가 인용과 인용문을 사용하여 편집을 정당화하는 데 효과적인가, 그리고 PEER-Document가 도움이 되는가?
- RQ4반복적 PEER 편집이 단일 패스 생성에 비해 자율적이고 계획-유도 사용에 어떤 차이가 있는가?
- RQ5도메인 적응과 합성 데이터가 PEER의 작업 성능에 어떤 영향을 미치는가?
주요 결과
- PEER는 Wikipedia 및 비-Wikipedia 도메인에서 자연 편집에 대해 기준선보다 높은 성능을 보인다.
- 합성 편집을 사용하는 도메인 적응 버전(PEER-Undo)은 교차 도메인 성능을 개선하며, Gardening, Politics, Movies 하위 집합에서 눈에 띄는 향상을 보인다.
- 계획과 문서는 상호 보완적 정보를 제공하며, 둘 다 제거하면 성능이 실질적으로 악화된다.
- 인간이 작성한 계획을 따르는 것이 하위 편집 작업으로 이어지며, PEER-Explain의 합성 계획이 결과를 더 향상시키는 것으로 나타난다.
- 인용 및 생성 문서를 활용하는 PEER 변형은 우수한 설명력과 업데이트 품질의 향상을 보여준다.
- 반복적 PEER 편집은 계획으로 안내될 때 특히 단일 패스 생성에 비해 경쟁력 있는 결과를 낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.