[논문 리뷰] Saved You A Click: Automatically Answering Clickbait Titles
이 논문은 레딧의 'SavedYouAClick' 및 페이스북의 'StopClickbait' 페이지에서 사용자가 생성한 답변을 기반으로, 추출형(RoBERTa)과 개괄형(T5) 질문-답변 모델을 미세조정하여 클릭베이트 제목에 자동으로 답변을 생성하는 시스템을 제안한다. 미세조정 후, 추출형 모델은 ROUGE 점수에서 승리하고, 개괄형 모델은 BERTscore에서 높은 점수를 기록하며 더 유창하고 문법적으로 올바른 응답을 생성한다.
Often clickbait articles have a title that is phrased as a question or vague teaser that entices the user to click on the link and read the article to find the explanation. We developed a system that will automatically find the answer or explanation of the clickbait hook from the website text so that the user does not need to read through the text themselves. We fine-tune an extractive question and answering model (RoBERTa) and an abstractive one (T5), using data scraped from the 'StopClickbait' Facebook pages and Reddit's 'SavedYouAClick' subforum. We find that both extractive and abstractive models improve significantly after finetuning. We find that the extractive model performs slightly better according to ROUGE scores, while the abstractive one has a slight edge in terms of BERTscores.
연구 동기 및 목표
- 시간 낭비를 유발하는 클릭베이트 제목 문제를 해결하기 위해 클릭베이트 제목에 대한 간결한 답변을 자동으로 생성하는 것.
- 클릭베이트 스포일러가 추출형 및 개괄형 QA 접근 방식을 사용해 닫힌 도메인 질문-답변 작업으로 모델링될 수 있는지 탐색하는 것.
- 새로가져온 사용자 생성 클릭베이트 답변 데이터셋에 대해 미세조정된 추출형 및 개괄형 모델의 성능을 평가하는 것.
- 클릭베이트 훅에 대해 정확하고, 유창하며 사실적으로 올바른 답변을 생성하는 데서 추출형 모델과 개괄형 모델의 강점과 약점을 비교하는 것.
제안 방법
- 레딧의 'SavedYouAClick' 및 페이스북의 'StopClickbait' 페이지에서 2,538개의 레딧 게시물과 1,287개의 페이스북 게시물을 크롤링하여 (컨텍스트, 질문, 답변) 데이터셋을 구성하였다.
- SQuAD2.0과 NewsQA에서 미리 훈련된 추출형 QA 모델(RoBERTa)을 크롤링한 데이터로 미세조정하였으며, 수동으로 레이블링된 답변 구간이 없었다.
- 동일한 데이터셋을 기반으로 개괄형 QA 모델(T5)을 미세조정하여, 원본 텍스트에 정확히 존재하지는 않지만 새로운 어휘로 재구성된 답변을 생성하도록 하였다.
- ROUGE와 BERTscore 메트릭을 사용해 두 모델의 성능을 정량적으로 평가하였으며, BERTscore는 기준 답변과의 의미 유사도를 측정하였다.
- 골드 답변 구간이 누락된 상황에서, 스폐닝BERT 등의 자기지도 기반 스파이크 탐지 기법을 적용해 추출형 모델의 답변 구간을 근사하였다.
- 모델 출력의 유창성, 사실적 정확성, 어휘 재구성 정확도를 평가하기 위해 테스트 예시에 대한 정성적 분석을 수행하였다.
실험 결과
연구 질문
- RQ1추출형 및 개괄형 QA 모델이 소셜 포럼에서 사용자가 생성한 답변만을 사용해 클릭베이트 제목에 효과적으로 답변을 생성할 수 있는가?
- RQ2ROUGE와 BERTscore 메트릭은 추출형 모델과 개괄형 모델이 생성한 답변의 품질 평가에서 어떻게 비교되는가?
- RQ3사용자가 생성한 클릭베이트 스포일러 데이터로 미세조정하면, 미리 보지 않은 클릭베이트 제목에 대해 모델 성능이 유의미하게 향상되는가?
- RQ4특히 사실적 일致성과 유창성 측면에서, 어떤 상황에서 추출형 모델이 개괄형 모델보다 우수하고, 반대로 어떤 상황에서 개괄형 모델이 우수한가?
- RQ5클릭베이트 제목이 모호하거나 목록 기반 또는 의미적으로 모호한 경우, 두 모델 유형의 주요 실패 원인은 무엇인가?
주요 결과
- 미세조정을 통해 추출형(RoBERTa) 및 개괄형(T5) 모델 모두 레딧과 페이스북 데이터에서 성능 향상을 크게 보였다.
- 추출형 모델은 ROUGE-F1 점수에서 더 높은 성능을 보였다 (예: 레딧에서 RoBERTa-SQuAD 미세조정 모델의 경우 47.20점), 이는 더 뛰어난 스파이크 매칭 정확도를 의미한다.
- 개괄형 모델은 BERTscore에서 추출형 모델을 앞섰다 (예: 레딧에서 RoBERTa-SQuAD의 경우 90.26점 대비 88.54점), 이는 기준 답변과의 의미 유사도가 더 높다는 것을 시사한다.
- 개괄형 모델은 더 유창하고 문법적으로 올바르며 어휘를 재구성한 응답을 생성했지만, 추출형 모델은 어휘 재구성으로 인한 사실 오류를 더 잘 방지하는 일관성을 보였다.
- 두 모델 모두 목록 기반 클릭베이트 제목(예: '10가지 이유로...')과 너무나 모호한 제목에서 어려움을 겪었으며, 이 경우 답변이 비연속적인 텍스트 세그먼트에 걸쳐야 했다.
- 사용자가 생성한 답변에 노이즈나 불필요한 세부 정보가 포함되어 있어 데이터 품질의 변동성이 발생하였고, 이는 모델 일반화 능력과 평가 신뢰성에 악영향을 미쳤다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.