Skip to main content
QUICK REVIEW

[논문 리뷰] Facilitating Access to Multilingual COVID-19 Information via Neural Machine Translation

Andy Way, Rejwanul Haque|arXiv (Cornell University)|2020. 05. 01.
Natural Language Processing Techniques참고 문헌 21인용 수 4
한 줄 요약

이 논문은 영어와 독일어, 프랑스어, 이탈리아어, 스페인어의 4개 주요 유럽어를 오가는 8종의 신경 기계 번역(NMT) 시스템을 제안한다. 이는 코로나19 관련 다국어 건강 정보에의 접근을 향상시키기 위한 것이다. 최신 NMT 기법을 사용해 무료로 이용 가능한 데이터로 훈련된 이 시스템들은 구글 번역기나 빙 번역기와 같은 상용 엔진과 비교해 성능이 유사하거나 뛰어나며, 개인 정보 보호를 고려해 공개적으로 온라인으로 배포되어 의료 전문가와 일반 대중이 패닉 상황과 관련된 중요한 콘텐츠를 신속하고 안전하게 접근할 수 있도록 지원한다.

ABSTRACT

Every day, more people are becoming infected and dying from exposure to COVID-19. Some countries in Europe like Spain, France, the UK and Italy have suffered particularly badly from the virus. Others such as Germany appear to have coped extremely well. Both health professionals and the general public are keen to receive up-to-date information on the effects of the virus, as well as treatments that have proven to be effective. In cases where language is a barrier to access of pertinent information, machine translation (MT) may help people assimilate information published in different languages. Our MT systems trained on COVID-19 data are freely available for anyone to use to help translate information published in German, French, Italian, Spanish into English, as well as the reverse direction.

연구 동기 및 목표

  • 팬데믹 기간 동안 시의적절하고 정확한 다국어 코로나19 건강 정보에 접근하는 데서 발생하는 언어 장벽을 해결하기 위해.
  • 출현한 감염병에 영향을 받은 주요 유럽어를 대상으로 고품질의 공개 접근이 가능한 신경 기계 번역(NMT) 시스템을 개발하기 위해.
  • 사용자 개인정보 보호를 유지하면서도 상용 시스템과 동등하거나 뛰어난 번역 품질을 확보하기 위해.
  • 의료 전문가와 일반 대중이 다국어 공중보건 콘텐츠에 신속하고 확장 가능한 방식으로 접근할 수 있도록 하기 위해.

제안 방법

  • 신문사 및 보건 당국 등의 다양한 출처에서 확보한 무료로 이용 가능한 다국어 코로나19 텍스트 데이터만을 사용해 엔드 투 엔드 NMT 모델을 훈련시키기 위해.
  • 토크나이제이션, 문장 분할, 문자 정규화, 철자 검사, URL 및 태그와 같은 특수 요소 처리를 포함한 모듈식 전처리 파이프라인을 활용하기 위해.
  • 8개의 언어 쌍 각각에 전용 GPU 서버를 배치해 저지연, 반응성이 뛰어난 온라인 번역 서비스를 확보하기 위해 분산 아키텍처를 구현하기 위해.
  • 웹서버를 통해 사용자 요청을 관리하고 적절한 번역 서버에 작업을 분배하며, 적절한 후처리를 거쳐 번역 결과를 반환하기 위해.
  • 서브워드 분할, 트루케이싱, 복합어 재결합(특히 독일어에 특화)과 같은 고급 NMT 기법을 적용해 유창성과 정확도를 향상시키기 위해.
  • 실제 팬데믹 관련 문장에 대해 구글 번역기와 빙 번역기와의 성능을 자동 평가 지표와 인간 평가를 통해 검증하기 위해.

실험 결과

연구 질문

  • RQ1영어, 프랑스어, 독일어, 이탈리아어, 스페인어 간에 다국어 코로나19 콘텐츠를 신속하게 번역할 수 있는 고품질의 저비용 NMT 시스템을 개발할 수 있는가?
  • RQ2이러한 커스터마이징된 NMT 시스템의 성능은 구글 번역기나 빙 번역기와 같은 선도적인 상용 MT 플랫폼과 비교해 어떤가? 특히 자연스러움과 적합성 측면에서.
  • RQ3위기 상황에서 다양한 언어 쌍에 대해 모듈식 다국어 전처리 파이프라인은 번역 품질을 얼마나 향상시킬 수 있는가?
  • RQ4공개 배포된 개인정보 보호를 고려한 MT 시스템은 비전문가 사용자가 언어 장벽을 넘어 중요한 건강 정보에 효과적으로 접근하는 데 기여할 수 있는가?
  • RQ5민감하고 급변하는 공중보건 콘텐츠에 적용했을 때, 커스터마이징된 NMT 시스템의 주요 강점과 약점은 무엇인가?

주요 결과

  • 자동 평가 결과, 커스터마이징된 NMT 시스템은 동일한 테스트 세트에서 구글 번역기 및 빙 번역기와 유사하거나 뛰어난 점수를 기록했다.
  • 인간 평가 결과, 특히 의학 용어와 맥락 처리에서 상용 플랫폼보다 더 정확하고 자연스러운 번역 결과를 생성함을 확인했다.
  • 복잡한 공중보건 메시지, 예를 들어 증상 식별, 예방 조치, 치료 지침 등에 대해 뛰어난 성능을 보였다.
  • 모듈식 전처리 파이프라인은 문장 부호, 특수 문자, URL, 복합어 처리(특히 독일어에서 뚜렷하게)를 정확히 다루어 번역 품질을 크게 향상시켰다.
  • 분산형 개인정보 보호 웹 아키텍처를 통해 시스템을 구축함으로써, 데이터 泄漏 위험 없이 전 세계 사용자가 저지연, 실시간으로 접근할 수 있었다.
  • 독일의 데어 벨트 신문(2020년 3월 20일)의 뉴스 헤드라인과 같은 고영향력의 시의적절한 콘텐츠를 성공적으로 번역함으로써, 실제 위기 상황에서의 실용성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.