Skip to main content
QUICK REVIEW

[논문 리뷰] Manga109Dialog: A Large-scale Dialogue Dataset for Comics Speaker Detection

Yingxuan Li, Kiyoharu Aizawa|arXiv (Cornell University)|2023. 06. 30.
Natural Language Processing Techniques인용 수 5
한 줄 요약

이 논문은 132,692개의 캐릭터-텍스트 쌍을 포함한 세계 최대 규모의 만화 대사 주인공 검출 데이터셋인 Manga109Dialog을 소개하고, 프레임 읽기 순서를 통합한 시각적 관계 추론 기반의 딥러닝 기법을 제안하여 정확도를 향상시켰다. 제안된 방법은 75% 이상의 정확도를 달성하여, 특히 캐릭터와 텍스트가 동일한 프레임에 있지 않은 어려운 케이스에서 규칙 기반 기반선보다 뛰어난 성능을 보였다.

ABSTRACT

The expanding market for e-comics has spurred interest in the development of automated methods to analyze comics. For further understanding of comics, an automated approach is needed to link text in comics to characters speaking the words. Comics speaker detection research has practical applications, such as automatic character assignment for audiobooks, automatic translation according to characters' personalities, and inference of character relationships and stories. To deal with the problem of insufficient speaker-to-text annotations, we created a new annotation dataset Manga109Dialog based on Manga109. Manga109Dialog is the world's largest comics speaker annotation dataset, containing 132,692 speaker-to-text pairs. We further divided our dataset into different levels by prediction difficulties to evaluate speaker detection methods more appropriately. Unlike existing methods mainly based on distances, we propose a deep learning-based method using scene graph generation models. Due to the unique features of comics, we enhance the performance of our proposed model by considering the frame reading order. We conducted experiments using Manga109Dialog and other datasets. Experimental results demonstrate that our scene-graph-based approach outperforms existing methods, achieving a prediction accuracy of over 75%.

연구 동기 및 목표

  • 일본 만화를 위한 대규모 고품질의 캐릭터-텍스트 주석 데이터셋 부족 문제를 해결한다.
  • 공간적 거리에만 의존하는 규칙 기반 방법의 한계를 극복하여, 복잡한 만화 레이아웃에서의 성능을 향상시킨다.
  • 시각적 관계와 만화의 구조적 특징(예: 읽기 순서)을 활용한 딥러닝 기반 대사 주인원 검출 프레임워크를 개발한다.
  • 난이도 수준에 따라 분류된 테스트 세트와 특화된 평가 지표를 통해 방법 간 공정한 비교를 위한 새로운 평가 기준을 설정한다.
  • 미래의 NLP 기법 통합을 위한 기반을 마련하기 위해, 시각적 정보만을 사용하는 대사 주인원 검출의 잠재력을 입증한다.

제안 방법

  • Manga109 데이터셋을 기반으로 한 132,692개의 캐릭터-텍스트 주석을 포함하는 새로운 대규모 데이터셋인 Manga109Dialog을 구축하였다.
  • 캐릭터(주어), 텍스트(목적어), 그리고 그들의 공간적 관계를 탐지하기 위해 시각적 관계 추론 기반 모델(SGG)을 제안하였다.
  • 복잡한 레이아웃에서의 예측 성능 향상을 위해, 읽기 순서를 구조적 사전 지식으로 통합하여 SGG 모델을 개선했다.
  • 만화 대사 주인원 검출에 특화된 새로운 평가 지표를 설계하여, 페이지당 텍스트 수 기준의 재현율을 중심으로 평가하였다.
  • 예측 난이도에 따라 테스트 세트를 '쉬움'과 '어려움'으로 분할하였으며, 특히 캐릭터와 텍스트가 동일한 프레임에 있는지 여부를 기준으로 하였다.
  • 객체 검출과 관계 예측에 대한 병합된 교차 엔트로피 손실을 사용하여 모델을 훈련시켰다.
Figure 1: An example of speaker detection. ©Akamatsu Ken.
Figure 1: An example of speaker detection. ©Akamatsu Ken.

실험 결과

연구 질문

  • RQ1딥러닝 기반의 시각적 관계 추론 모델은 기존의 규칙 기반 방법보다 만화 대사 주인원 검출에서 뛰어난 성능을 보일 수 있는가?
  • RQ2읽기 순서를 통합함으로써 대사 주인원 검출 정확도가 얼마나 향상되는가? 특히 복잡한 레이아웃에서의 성능 향상 여부는?
  • RQ3제안된 방법의 성능는 다양한 난이도 수준에서 어떻게 변화하는가? 특히 캐릭터와 텍스트가 동일한 프레임에 있지 않은 경우에 대한 성능는?
  • RQ4제안된 평가 지표는 기존의 지표보다 만화 대사 주인원 검출에 더 신뢰성 있고 정보적인가?
  • RQ5시각적 정보만을 사용하는 방법이 강력한 성능을 달성할 수 있는가? 이는 향후 NLP 기반 접근법의 기초가 될 수 있는가?

주요 결과

  • 제안된 SGG 기반 방법은 전체 테스트 세트에서 75.69%의 정확도를 달성하여, 최고의 규칙 기반 방법(71.53%, 프레임 거리 기반)을 뛰어넘었다.
  • 캐릭터와 텍스트가 동일한 프레임에 있지 않은 '어려움' 세트에서는 제안된 방법이 30.65%의 재현율을 기록하여, 프레임 거리 기반 규칙 기반 방법의 22.06%보다 뚜렷이 높았다.
  • 읽기 순서를 통합함으로써 전체 세트에서 0.12% 향상되었고, '어려움' 세트에서는 1.10% 향상되어, 순차적 만화 구조를 모델링하는 데서의 가치를 입증했다.
  • 모델은 '쉬움'과 '어려움' 세트 양쪽에서 규칙 기반 방법보다 뛰어난 성능를 보였으며, 특히 가장 가까운 캐릭터가 실제 주인공이 아닌 경우에 두드러진 성능 향상을 보였다.
  • 새로운 평가 지표는 성능 차이를 효과적으로 포착하여, 규칙 기반 방법과 딥러닝 방법 간의 공정한 비교를 가능하게 하였다.
  • 비록 성능 향상이 있었지만, 교대로 대화하는 캐릭터와 비접근 캐릭터의 경우 여전히 도전 과제로 남아 있어, 향후 NLP 기반 통합의 여지를 시사한다.
(a) Abe’s annotations (character-to-text).
(a) Abe’s annotations (character-to-text).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.