[论文解读] Active learning for seismic processing parameterisation, with an application to first break picking
本文提出了一种用于地震初至拾取的主动学习方法,通过智能选择最具信息量的炮集供人工标注,显著减少了人工标注的工作量。该方法采用基于委员会的查询策略,结合多个拾取算法,在仅使用约一半标注炮集的情况下,实现了与随机采样相当的准确率,尤其聚焦于地质不连续性等初至时间发生突变的区域。
Parameter values for seismic processing steps are often chosen on a regular grid of samples and interpolated. Active learning instead attempts to optimally select the samples on which parameter values are chosen. For parameters that do not vary smoothly, this often reduces the number of samples that need to be labelled in order to achieve a desired accuracy on the whole dataset. In regression tasks this is typically achieved using a query by committee strategy that selects the samples on which a committee of models is most uncertain. I implement such a strategy for the first break picking task, where the parameters to be chosen are the centre and width of the picking window for each trace. For the committee members I use the centre of the picking window and three popular picking algorithms. Applying this to a real dataset, and with samples corresponding to shot gathers, the active learning approach primarily selects gathers near a jump in the first breaks, and achieves similar levels of accuracy on the whole dataset with about half the number samples picked as when the samples are randomly selected.
研究动机与目标
- 减少地震处理参数化中常规网格采样或随机采样带来的手动劳动和低效问题。
- 解决地震数据中参数非平滑变化的挑战,特别是在初至时间跳跃等突变区域。
- 通过优先标注最不确定和最具信息量的炮集,提升初至拾取的准确性。
- 将主动学习无缝集成到现有地震处理工作流中,无需依赖深度学习的黑箱模型。
- 证明主动学习可显著减少所需的人工拾取次数,同时保持高准确率。
提出的方法
- 该方法采用基于委员会的主动学习策略,由一组模型(包括拾取窗口中心及三个成熟拾取算法)对未标注数据估计不确定性。
- 不确定性通过委员会成员间预测结果的方差来量化,选择最不确定的样本进行人工标注。
- 算法根据此不确定性度量选择炮集进行人工拾取,重点关注预测结果差异最大的区域。
- 该过程迭代执行,优先标注最具信息量的炮集,更新模型并重新评估不确定性,直至达到期望的准确率。
- 每一步考虑数据集的10%子集,以在计算成本与选择质量之间取得平衡。
- 该方法用有针对性的选择策略替代常规网格或随机采样,优先关注初至行为复杂或突变的区域。
实验结果
研究问题
- RQ1主动学习能否显著减少实现高精度初至拾取所需的标注炮集数量?
- RQ2基于模型不确定性的炮集选择是否优于地震参数化中的随机采样或常规网格采样?
- RQ3在地震数据集中,最具信息量的炮集位于何处?主动学习是否能自然识别出这些区域?
- RQ4委员会在选择过程中考虑的候选炮集数量如何影响最终的准确率与效率?
- RQ5主动学习能否有效检测并优先处理初至时间发生突变的区域,例如由近地表非均质性引起的区域?
主要发现
- 主动学习方法在仅使用约一半标注炮集的情况下,达到了与随机采样相当的准确率。
- 该方法主要选择了在炮点200附近(初至时间因地质复杂性发生跳跃)的炮集。
- 与随机选择相比,主动学习在早期迭代中预测拾取的平均绝对误差下降得更快。
- 在委员会选择过程中仅考虑1%的数据集子集即足以实现最优性能,超过10%后无显著提升。
- 主动学习方法成功识别并优先处理了高不确定性区域,如初至时间发生突变的区域,这些区域对准确处理至关重要。
- 通过限制每一步考虑的候选炮集数量,该方法保持了适中的计算成本,使其在实际地震工作流中具有可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。