返回
Optimized Rainfall Imputation Using ERA5-Land and Tree-Based Machine Learning: A Scalable Framework for Data-Sparse Regions
DOI:10.1007/s41748-025-00787-9.png)
摘要
En 中文
水文专家在获取可靠数据插补方面面临重大挑战,这主要归因于许多地区降雨数据的缺失现象普遍存在。本研究提出了一种创新性系统框架,通过整合ERA5-Land数据与观测数据,利用基于树的机器学习算法优化每日降雨插补。在泰国南部流域(TSB)中,该框架分为五个主要步骤:数据收集、区域化(聚类和均一性分析)、特征选择、模型开发(超参数优化和模型训练与测试)以及性能比较。关键发现表明,作为初步特征选择步骤的区域化,增强了数据均一性,并通过Fligner–Killeen和Brown–Forsythe检验验证,识别出TSB数据集的三个聚类。ERA5-Land显著高估了降水,尤其是在高降雨期间,但分位数变换(QT)有效纠正了这些偏差,使ERA5-Land分布与观测值对齐,并提高了精度,特别是在较低分位数处。特征选择比较显示,遗传算法(GA)保留了更多特征,而BorutaShap识别了关键特征,减少了冗余并实现了略优的性能,尤其是在随机森林(RF)中。超参数调优表明,简单模型如RF和极端树(ET)即使在默认设置下也表现良好,而极端梯度提升(XGBoost)需要精确调优以实现最佳性能。模型性能评估显示,经QT校正的ERA5-Land数据显著提高了插补精度,且ET在缺失数据较高的情况下优于RF和XGBoost。本研究强调了整合偏差校正数据集和先进机器学习(ML)模型对于数据稀缺地区降雨插补的关键作用。所提出的框架提供了一种可扩展且可复现的方法,可适应其他面临类似挑战的区域,为全球科学界提供增强水文数据可靠性并改善水资源管理策略的实用解决方案。本图示摘要展示了通过整合ERA5-Land再分析数据和地面观测值在TSB中插补缺失降雨数据的稳健且系统性框架。首先使用QT对ERA5-Land数据进行偏差校正,然后将其纳入特征选择中,比较BorutaShap和GA。同时,观测降雨数据通过KM和FCM进行区域化和聚类。利用Brown–Forsythe和Fligner–Killeen检验验证所得聚类的空间均一性,为后续模型开发奠定坚实基础。为评估框架,在MCAR场景下引入多个水平(10%、30%和50%)的缺失数据。随后使用选定特征和GA优化的基于树的ML模型(RF、ET和XGBoost)进行训练。通过MAE、OI、NSE和PBIAS评估模型性能,以确定最有效的插补策略。该可扩展框架整合了ERA5-Land与基于树的ML模型用于降雨插补。区域化通过统计检验证实增强了数据均一性。QT纠正了ERA5-Land偏差,提高了插补精度。BorutaShap在特征选择中优于GA,减少了冗余。ET模型在高度缺失数据条件下实现了最佳的插补精度。
Keyword:
BorutaShap
ERA5-Land
Genetic algorithm optimization
Quantile transformation
Rainfall imputation
Regionalization
Tree-based machine learning
期刊
E
IF:
4.7
论文数:
1.3K
被引数:
2.1K
机构
引用论文
Comparison of different methodologies for rainfall-runoff modeling: machine learning vs conceptual approach
NATURAL HAZARDS
IF3.7
Regionalización de la precipitación, su agresividad y concentración en la cuenca del río Guayas, Ecuador
La Granja
IF0
Assessing Machine Learning Models for Gap Filling Daily Rainfall Series in a Semiarid Region of Spain
Atmosphere
IF0
Applications of XGBoost in water resources engineering: A systematic literature review (Dec 2018–May 2023)XGBoost在水资源工程中的应用: 系统文献综述 (2018年12月-2023年5月)

