Skip to main content
QUICK REVIEW

[論文レビュー] Pointwise distance distributions of periodic sets.

Daniel E. Widdowson, Vitaliy Kurlin|arXiv (Cornell University)|Aug 10, 2021
Computational Drug Discovery Methods参考文献 2被引用数 12
ひとこと要約

本稿では、ユークリッド空間内の周期的点集合に対する連続的で計算効率が良く、等長不変量である高次点対距離分布(PDD)の新規族を導入する。任意の次元において距離一般集合に対して完全であることが証明されており、分子構造の高速かつ高精度な分類を可能にし、標準デスクトップ上で7時間未満で229,000件以上のエントリを含むケンブリッジ構造データベースを区別可能であり、近線形の複雑性とPDDからの明示的再構成が可能である。

ABSTRACT

The fundamental model of a periodic structure is a periodic set of points considered up to rigid motion or isometry in Euclidean space. The recent work by Edelsbrunner et al defined the new isometry invariants (density functions), which are continuous under perturbations of points and complete for generic sets in dimension 3. This work introduces much faster invariants called higher order Pointwise Distance Distributions (PDD). The new PDD invariants are simpler represented by numerical matrices and are also continuous under perturbations important for applications. Completeness of PDD invariants is proved for distance-generic sets in any dimension, which was also confirmed by distinguishing all 229K known molecular organic structures from the world's largest Cambridge Structural Database. This huge experiment took only seven hours on a modest desktop due to the proposed algorithm with a near linear or small polynomial complexity in terms of key input sizes. Most importantly, the above completeness allows one to build a common map of all periodic structures, which are continuously parameterized by PDD and explicitly reconstructible from PDD. Appendices include first tree-based maps for several thousands of real structures.

研究の動機と目的

  • 点の摂動に対して連続的で、一般配置に対して完全な等長不変量として、周期的点集合のためのより高速でより頑健な不変量を開発すること。
  • 近線形時間で計算可能な数値不変量を用いて、特に分子結晶を含む周期的構造の大規模な効率的分類を可能にすること。
  • PDDに基づく連続的かつパラメトリックな全周期的構造のマップを構築し、不変量から明示的に再構成可能であるようにすること。
  • ケンブリッジ構造データベースなどの実世界のデータセット上で、PDD不変量の完全性と実用的有用性を検証すること。
  • 材料科学および構造化学への応用を想定した、周期的構造解析のスケーラブルな計算フレームワークを提供すること。

提案手法

  • 周期的点集合の数値的行列表現として、高次点対距離分布(PDD)を提案し、局所的および大規模な距離統計を捉える。
  • 主な入力サイズにおいて近線形または小規模な多項式時間の複雑性を持つ新規なアルゴリズムを採用し、大規模データセット上での高速計算を実現する。
  • PDD不変量を点の摂動に対して連続的と定義し、ノイズや不完全なデータを伴う実世界の応用において安定性を確保する。
  • 任意の次元において距離一般集合に対してPDDの完全性を証明し、異なる集合は異なるPDD行列をもつことを意味する。
  • PDDフレームワークを用いて周期的構造のマップ作成と再構成を実施し、数千の実分子構造の木構造的表現を生成する。
  • 全ケンブリッジ構造データベース(229,000構造)を用いて手法を検証し、デスクトップシステムで7時間の実行時間で完了した。

実験結果

リサーチクエスチョン

  • RQ1任意の次元において、摂動に対して連続的で、一般の周期的点集合に対して完全なPDD不変量を構築できるか?
  • RQ2分子結晶のような大規模な周期的構造に対して、PDD不変量はどの程度効率的に計算可能か?
  • RQ3PDDはケンブリッジ構造データベースに登録されたすべての既知の分子構造を一意に区別できるか?
  • RQ4PDDを用いて、連続的で明示的かつ再構成可能な全周期的構造のパラメトリック化が可能か?
  • RQ5PDDに基づく分類の計算複雑性は何か?また、入力サイズの増大に伴いどのようにスケーリングするか?

主な発見

  • 提案されたPDD不変量は、任意の次元において距離一般集合に対して完全であることが証明されており、周期的点集合の固有の識別が保証される。
  • アルゴリズムは近線形または小規模な多項式時間の複雑性でPDD不変量を計算でき、標準デスクトップ上で229,000個の分子構造を7時間未満で分類可能である。
  • PDD不変量は点の摂動に対して連続的であり、ノイズや不完全なデータを伴う応用において頑健である。
  • 本手法は、ケンブリッジ構造データベースに登録された229,000件の既知の有機分子構造をすべて明確に区別でき、実用的完全性を確認した。
  • PDDを用いて、全周期的構造の共通の連続的マップを構築し、不変量から明示的に再構成可能であることを示した。
  • 数千の実周期的構造に対して、初めて木構造的マップを生成し、スケーラビリティと構造的洞察を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。