[논문 리뷰] Generating Representative Headlines for News Stories
이 논문은 인간 레이블이 없는 훈련 데이터를 사용하여 대표적인 헤드라인을 생성할 수 있도록 거리 감독(distant supervision)과 다중 수준 미리 훈련(multi-level pre-training)을 활용하는 신경 헤드라인 생성 모델인 NHNet을 제안한다. 자기 투표 기반의 기사 어텐션 메커니즘을 도입함으로써 다수의 기사 간 공통 정보를 효과적으로 포착하여, 청소된 데이터셋과 노이즈가 있는 데이터셋 모두에서 베이스라인 모델을 능가하며 고비용의 인간 레이블링에 대한 의존도를 감소시킨다.
Millions of news articles are published online every day, which can be overwhelming for readers to follow. Grouping articles that are reporting the same event into news stories is a common way of assisting readers in their news consumption. However, it remains a challenging research problem to efficiently and effectively generate a representative headline for each story. Automatic summarization of a document set has been studied for decades, while few studies have focused on generating representative headlines for a set of articles. Unlike summaries, which aim to capture most information with least redundancy, headlines aim to capture information jointly shared by the story articles in short length, and exclude information that is too specific to each individual article. In this work, we study the problem of generating representative headlines for news stories. We develop a distant supervision approach to train large-scale generation models without any human annotation. This approach centers on two technical components. First, we propose a multi-level pre-training framework that incorporates massive unlabeled corpus with different quality-vs.-quantity balance at different levels. We show that models trained within this framework outperform those trained with pure human curated corpus. Second, we propose a novel self-voting-based article attention layer to extract salient information shared by multiple articles. We show that models that incorporate this layer are robust to potential noises in news stories and outperform existing baselines with or without noises. We can further enhance our model by incorporating human labels, and we show our distant supervision approach significantly reduces the demand on labeled data.
연구 동기 및 목표
- 동일한 사건을 보도하는 여러 기사로 구성된 뉴스 스토리에 대해 간결하고 대표적인 헤드라인을 생성하는 문제를 해결하기 위해.
- 거리 감독 접근법을 도입하여 인간 레이블이 필요한 훈련 데이터에 대한 의존도를 줄이기 위해.
- 기사의 노이즈 또는 일관성 없는 내용에 대한 모델의 강건성을 향상시키기 위해 자기 투표 기반의 기사 어텐션 메커니즘을 설계하기 위해.
- 367만 개의 스토리로 구성된 수작업으로 정제된 최초의 데이터셋인 NewSHead를 공개하여 다중 문서 헤드라인 생성 분야의 새로운 벤치마크를 설정하기 위해.
- 비정규화된 코퍼스에서 품질과 양의 균형을 고려한 다중 수준 미리 훈련 프레임워크를 통해 모델 성능을 향상시키기 위해.
제안 방법
- 뉴스 스토리 클러스터에서 가장 대표적인 기사 제목을 사용해 훈련을 위한 대체 헤드라인(proxy headline)으로 삼는 거리 감독 방법을 제안하여 인간 레이블이 필요한 헤드라인 훈련 데이터가 필요 없도록 한다.
- 다양한 품질과 양의 비정규화된 코퍼스를 포함하는 다중 수준 미리 훈련 프레임워크를 도입하여 인간이 수작업으로 정제한 데이터를 넘어서는 일반화 능력을 향상시킨다.
- 기사 간 상호 관련성을 투표 메커니즘으로 모델링하여 다수의 기사에 걸쳐 공통으로 나타나는 핵심 내용을 집약하는 자기 투표 기반의 기사 어텐션 레이어를 설계한다.
- 거리 감독 데이터에 맞추어 미세조정된 Transformer 기반의 인코더-디코더 아키텍처를 사용하며, 자기 투표 어텐션 레이어가 공통된 스토리 수준의 정보에 집중하도록 한다.
- 거리 감독 데이터와 소량의 인간 레이블을 결합하여 성능을 추가로 향상시키며, 데이터 효율성을 입증한다.
- 367만 개의 뉴스 스토리(각각 3~5개의 기사로 구성)를 포함하는 NewSHead 벤치마크를 평가에 활용하여 기존 방법들과의 철저한 비교를 가능하게 한다.

실험 결과
연구 질문
- RQ1인간 레이블이 없는 헤드라인 훈련을 위해 거리 감독 접근법이 효과적으로 작동할 수 있는가?
- RQ2다양한 비정규화된 코퍼스를 사용한 다중 수준 미리 훈련이 인간이 수작업으로 정제한 데이터만으로 훈련한 것에 비해 헤드라인 생성 성능을 얼마나 향상시키는가?
- RQ3자기 투표 기반의 기사 어텐션 메커니즘이 노이즈가 있거나 일관성 없는 기사 내용에 대한 모델의 강건성을 얼마나 향상시키는가?
- RQ4제안된 모델은 청소된 데이터셋과 노이즈가 있는 데이터셋 모두에서 어떻게 성능을 발휘하며, 다양한 데이터 품질 수준에서의 일반화 능력은 어떠한가?
- RQ5대규모 거리 감독 데이터와 소량의 인간 레이블을 결합할 경우, 모델 성능을 크게 향상시킬 수 있는가?
주요 결과
- 제안된 거리 감독 접근법은 이전까지 가장 큰 다중 문서 요약 데이터셋보다 6배 더 큰 데이터셋을 활용해 훈련할 수 있게 하여 인간 레이블에 대한 의존도를 크게 감소시켰다.
- 다중 수준 미리 훈련 프레임워크로 훈련된 모델는 인간이 수작업으로 정제한 코퍼스만으로 훈련된 모델보다 성능이 뛰어나, 고용량이지만 낮은 품질의 비정규화된 데이터를 통합하는 데서 유의미한 이점이 있음을 입증했다.
- 자기 투표 기반의 기사 어텐션 메커니즘은 청소된 데이터셋과 노이즈가 있는 데이터셋 모두에서 베이스라인 모델보다 뛰어난 성능을 달성하여 모델의 강건성을 향상시켰다.
- NHNet은 NewSHead 벤치마크에서 기존 방법들을 능가하는 최신 기술 수준의 성능을 달성하여 ROUGE 및 인간 평가 지표 모두에서 뛰어난 결과를 보였다.
- 소량의 인간 레이블을 사용한 미세조정은 성능을 추가로 향상시켰으며, 거리 감독 데이터가 다운스트림 적응을 위한 효과적인 사전 훈련 데이터로 기능한다는 점을 보여주었다.
- 367만 개의 뉴스 스토리로 구성된 수작업으로 정제된 NewSHead 데이터셋의 공개는 다중 문서 헤드라인 생성 분야에 있어 최초로 종합적인 벤치마크를 제공하며, 향후 연구와 평가를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.