Skip to main content
QUICK REVIEW

[논문 리뷰] The DIDI dataset: Digital Ink Diagram data

Philippe Gervais, Thomas Deselaers|arXiv (Cornell University)|2020. 02. 20.
Handwritten Text Recognition Techniques참고 문헌 12인용 수 9
한 줄 요약

DIDI 데이터셋은 안드로이드 기기와 크롬북을 사용해 유도된 데이터 수집 과정을 통해 확보한 58,655건의 디지털 잉크 다이어그램 그림을 포함한다. 이 중 22,287건은 텍스트 레이블이 있으며, 36,368건은 레이블이 없다. 이 데이터셋은 동적 스트로크 및 타임스탬프 정보를 갖춘 다이어그램의 데이터 기반 모델링을 가능하게 하여 상호작용적 그래픽 기호 이해 연구를 지원하며, 머신러닝 프레임워크 통합을 위한 예제 코드와 함께 크리에이티브 커먼즈 라이선스로 배포된다.

ABSTRACT

We are releasing a dataset of diagram drawings with dynamic drawing information. The dataset aims to foster research in interactive graphical symbolic understanding. The dataset was obtained using a prompted data collection effort.

연구 동기 및 목표

  • 텍스트와 수동으로 그린 도형을 모두 포함하는 상호작용 다이어그램 이해 모델을 훈련하기 위한 대규모이고 다양한 데이터셋의 부족을 보완하기 위해.
  • 시간적 및 공간적 정보를 갖춘 동적 디지털 잉크 데이터를 제공함으로써 머신러닝 및 인간-컴퓨터 상호작용 분야의 연구를 촉진하기 위해.
  • 의미적으로 관련된 손글씨 텍스트, 도형, 다이어그램의 데이터 기반 모델링을 가능하게 하여 다이어그램 작성 및 편집을 위한 지능형 도구 개발을 지원하기 위해.
  • 기존 데이터셋이 작고 딥러닝에 적합하지 않다는 한계를 극복하기 위해 대규모이고 다양한 구성이며 잘 정리된 데이터셋을 공개하기 위해.
  • 실제 사용자가 생성한 데이터를 활용하여 복잡한 다중 모odal 다이어그램 콘텐츠의 엔드 투 엔드 인식 및 이해 연구를 가능하게 하기 위해.

제안 방법

  • 참가자들이 화면에 겹쳐진 흐름도를 다시 그리도록 유도하는 Android 앱을 크롬북과 모바일 기기에서 사용하여 데이터를 수집하였다.
  • 무작위로 생성된 dot 파일로부터 GraphViz를 사용해 다이어그램을 생성하였으며, 노드의 형태, 레이블, 엣지 구조를 총 161개의 고유한 구성으로 다양화하였다.
  • 각 그림은 고유한 키, label_id, split(학습/검증/테스트), 쓰기 가이드(캔버스 크기) 및 x, y, 타임스탬프 좌표를 포함한 스트로크 배열을 내포한 NDJSON 형식으로 저장된다.
  • 학습, 검증, 테스트 세트 간의 겹침이 없도록 참가자 기반으로 데이터셋을 분할하였으며, 총 데이터의 6/8는 학습용, 각각 1/8는 검증용 및 테스트용으로 사용하였다.
  • 원본 dot 파일, PNG 프롬프트 이미지, 렲시 렌더링용 확장된 xdot 파일 등 보조 파일은 크리에이티브 커먼즈 저작자 표시 4.0 라이선스로 배포된다.
  • 시각화 및 일반 머신러닝 프레임워크로의 변환을 위한 예제 코드는 Colab 노트북에서 제공된다.

실험 결과

연구 질문

  • RQ1대규모이고 동적 디지털 잉크 데이터를 효과적으로 수집하고 정렬하여 그래픽 기호 이해 연구를 지원할 수 있는가?
  • RQ2다이어그램에 텍스트 레이블을 포함시키는 것이 사용자가 생성한 그림의 복잡성과 다양성에 어떤 영향을 미치는가?
  • RQ3시간적 및 공간적 스트로크 정보를 갖춘 대규모이고 다양한 사용자 그림 데이터셋이 다이어그램 인식 및 이해 작업의 성능 향상에 기여할 수 있는가?
  • RQ4참가자 기반의 분할 방식이 DIDI 데이터셋으로 훈련된 모델의 일반화 능력에 어떤 영향을 미치는가?
  • RQ5기존 머신러닝 프레임워크가 이 데이터셋을 활용하여 엔드 투 엔드 다이어그램 이해 작업을 효과적으로 수행할 수 있는가?

주요 결과

  • DIDI 데이터셋은 364명의 참가자로부터 확보한 58,655건의 고유한 다이어그램 그림을 포함하며, 이 중 22,287건은 텍스트 레이블이 있으며, 36,368건은 레이블이 없다.
  • 전체 6,555개의 고유한 레이블 ID를 포함하고 있으며, 각 레이블은 1회에서 169회까지 사용되었으며, 중앙값은 4회이다.
  • 그림의 스트로크 수는 1~161개(중앙값 14개)이며, 점의 수는 2~17,980개(중앙값 1,559개)로 사용자 입력의 높은 다양성을 반영한다.
  • 학습(43,995), 검증(7,330), 테스트(7,330) 세트로 분할되었으며, 참가자 신원이 상이하도록 분할되어 평가의 강건성을 확보하였다.
  • 크리에이티브 커먼즈 저작자 표시 4.0 국제 라이선스 하에 배포되었으며, 전체 소스 코드와 시각화 및 머신러닝 통합을 위한 예제 노트북이 함께 제공된다.
  • 데이터 수집 과정에서 다양한 실생활 흐름도 프롬프트를 생성하기 위해 GraphViz로 생성된 dot 파일을 사용하여 다이어그램의 구조적 및 의미적 다양성을 확보하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.