Skip to main content
QUICK REVIEW

[論文レビュー] Modeling assembly bias with machine learning and symbolic regression

Digvijay Wadekar, Francisco Villaescusa-Navarro|arXiv (Cornell University)|Nov 30, 2020
Image Processing and 3D Reconstruction参考文献 103被引用数 15
ひとこと要約

本稿では、IllustrisTNG流体力学的シミュレーションを用いて、ハローの中性水素(H i)含有量におけるアセンブリバイアスをモデル化する機械学習フレームワークを提案する。環境依存性—ハロー質量以外の要因—がH iパワー スペクトルに顕著に影響することを示しており、記号的回帰とランダムフォレストを組み合わせることで、模擬カタログの精度を向上させる解析的式を導出している。環境依存性を無視した場合、k ≳ 0.05 h Mpc⁻¹で21-cmパワー スペクトルの低予測が10%以上増加する。

ABSTRACT

Upcoming 21cm surveys will map the spatial distribution of cosmic neutral hydrogen (HI) over unprecedented volumes. Mock catalogues are needed to fully exploit the potential of these surveys. Standard techniques employed to create these mock catalogs, like Halo Occupation Distribution (HOD), rely on assumptions such as the baryonic properties of dark matter halos only depend on their masses. In this work, we use the state-of-the-art magneto-hydrodynamic simulation IllustrisTNG to show that the HI content of halos exhibits a strong dependence on their local environment. We then use machine learning techniques to show that this effect can be 1) modeled by these algorithms and 2) parametrized in the form of novel analytic equations. We provide physical explanations for this environmental effect and show that ignoring it leads to underprediction of the real-space 21-cm power spectrum at $k\gtrsim 0.05$ h/Mpc by $\gtrsim$10\%, which is larger than the expected precision from upcoming surveys on such large scales. Our methodology of combining numerical simulations with machine learning techniques is general, and opens a new direction at modeling and parametrizing the complex physics of assembly bias needed to generate accurate mocks for galaxy and line intensity mapping surveys.

研究の動機と目的

  • ハロのH i含有量が質量以外の二次的ハロ特性、特に局所的環境にどのように依存するかを調査すること。
  • 高精度な流体力学的シミュレーションから複雑で非線形なアセンブリバイアス効果を捉える機械学習手法を開発すること。
  • 記号的回帰を用いて、シミュレーションデータから解釈可能な解析的式を導出し、大規模な模擬カタログ生成に効率的に応用できることを目的とする。
  • 環境に起因するアセンブリバイアスを無視した場合の21-cmパワー スペクトルに与える影響を定量化し、標準的なHODモデルに顕著な系誤差が生じることを示すこと。
  • シミュレーションと機械学習の統合を用いて、銀河および強度マッピング調査におけるアセンブリバイアスを一般化可能な手法でモデル化すること。

提案手法

  • IllustrisTNGシミュレーションを用いて、H i質量、質量、環境(δ₂.₅)、濃度、スピン、準ハロー質量分率などのハロ特性を抽出する。
  • ランダムフォレスト回帰を用いて、実際のH i質量とHOD予測H i質量の比を、二次的ハロ特性の関数としてモデル化する。
  • PySRを用いた記号的回帰を用いて、和と乗算演算子のみを用いて過剰適合を回避する解析的式を導出し、H i質量比の関数としての表現を得る。
  • HODモデルをフルフィジックス(FP)シミュレーションデータでキャリブレーションし、ハロ質量の不一致に起因する影響を評価するために、ダークマターのみ(DMO)N体シミュレーションでその性能をテストする。
  • 真のH iパワー スペクトルと比較して予測を検証し、質量のみのHOD、機械学習強化モデル、シミュレーションの結果を照合する。
  • 記号的回帰の実行可能性を高めるために、環境や準ハロー分率などの主要な二次パラメータを選択し、高次元入力空間を低次元化する。

実験結果

リサーチクエスチョン

  • RQ1ダークマターのハローにおけるH i含有量は、質量以外の局所的環境にどのように依存するか?
  • RQ2ランダムフォレストや記号的回帰といった機械学習モデルは、この環境依存性を正確に捉え、パラメータ化できるか?
  • RQ3環境に起因するアセンブリバイアスを無視した場合、大スケール調査における21-cmパワー スペクトルに及ぼす定量的影響は何か?
  • RQ4記号的回帰は、標準的なHODモデルよりも効果的にアセンブリバイアスをモデル化するシンプルで解釈可能な解析的式を生成できるか?
  • RQ5ハロ質量の不一致を伴うDMOシミュレーションに応用した場合、機械学習ベースの模擬カタログの性能は、標準的なHODモデルと比べてどうなるか?

主な発見

  • IllustrisTNGにおけるハローのH i含有量は、局所的環境(δ₂.₅)に強く依存しており、高い密度異常(overdensity)とH i質量の増加が相関している。
  • 二次的ハロ特性を用いて訓練されたランダムフォレストモデルは、質量のみのHODと比較して、k ≳ 0.05 h Mpc⁻¹でH iパワー スペクトル予測の乖離を最大で約10%まで低減する。
  • 記号的回帰により、環境と準ハロー分率の関数としてH i質量比をモデル化するコンactな解析的式(例:式6)が成功裏に導出され、模擬カタログの精度が向上した。
  • 環境に起因するアセンブリバイアスを無視すると、k ≳ 0.05 h Mpc⁻¹で実空間21-cmパワー スペクトルが10%以上低予測されることが判明し、今後の調査の期待精度を上回る。
  • フルフィジックスシミュレーションでキャリブレーションしたHODモデルは、ハロ質量の不一致によりDMOシミュレーションに応用した場合に著しく性能が低下し、環境に配慮した補正の必要性が浮き彫りになった。
  • 記号的回帰で導出した式は、シミュレーションデータと強く一致しており、残差は期待される散乱内に収まっており、物理的妥当性と予測能力が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。