4.1 算法性能比较
我们的综合评估确定日尺度RF模型是跨不同生态系统露水估算的最稳健框架,显著优于SVR和ANN算法以及月尺度方法。
日尺度方法的优越性根植于其对露水形成基本物理的保真度——该过程由亚日尺度的夜间辐射冷却和瞬态相变动态驱动。此外,RF算法的优越性能源于其对涡动相关数据特有噪声和复杂性的内在韧性。虽然参数丰富的ANN在有限站点数据上出现过拟合,SVR受限于刚性核函数,但RF的集成结构自然处理了共同决定露水产量的复杂、非线性微气象交互。正如我们的残差分析所证明的,RF非常擅长捕捉凝结的物理截断阈值,例如极端风速抑制。
这种物理对齐与先前主要依赖月度聚合数据的区域研究形成鲜明对比。通过将瞬时凝结事件与广泛的季节性气候趋势混淆,月度模型有效地掩盖了关键的机制驱动因素。这种错配表现出不稳定的性能和负R²值,解释了为什么月尺度模型尽管显示出欺骗性的高训练拟合,却学习了虚假相关,并在严格的时间外样本测试中频繁失败。
因此,这些发现表明,为了跨异质气候的可靠大规模应用,未来的生态水文模型必须优先考虑高频(日尺度或亚日尺度)、阈值敏感的机器学习框架,而非传统的临时聚合方法。
4.2 露水的生态水文意义
基于日尺度RF模型的时空重建揭示了11个不同生态系统中露水形成的显著异质性,年露水贡献了年降水的0.98%–6.72%。
从地理上看,年降水量丰富的生态系统(如亚热带季风混交林DHS)由于低边界层大气水汽可用性持续较高,表现出较高的绝对露水量。然而,露水的生态水文意义在缺水或高海拔环境中具有不成比例的关键性。例如,在高寒湿地站点(HBW),露水占总降水的 substantial 6.72%。在这些脆弱的生态系统中,露水作为一种至关重要的非降雨水补贴。即使是最小的每日凝结也可以被浅根系和叶面直接吸收,有效缓解短期植物水分胁迫,降低叶片温度,并缓冲生态系统免受严重干旱期的影响。
这些发现为现有的站点特定文献贡献了宏观尺度视角。先前在干旱环境中的局部研究(如内盖夫沙漠或黑河流域)报告的露水贡献范围为年降水的2%到偶尔超过10%。我们的多站点大规模估计0.98%–6.72%涵盖了更广泛气候连续体,通常与这些全球观测的保守下限一致。
与一些极端沙漠估计相比,我们研究中观察到的上限略微更保守,这归因于我们严格的方法约束。通过严格筛选晴天、无降水夜间时段,并依赖未校正的负潜热通量而没有人为能量平衡强迫。因此,我们的结果提供了对真实表面凝结的高度保守、物理纯净的量化,避免了简化间接模型中常见的过高估计。
最终,这些空间格局强调露水不仅仅是可忽略的微气象异常,而是普遍存在的、功能性的生态水文缓冲区。随着全球气候变化加剧跨不同气候带的短期干旱频率,将准确的、高频的露水量化纳入宏观尺度水文模型和水资源管理框架,对于全面评估陆地生态系统韧性至关重要。
4.3 碳通量在露水形成中的作用
尽管SHAP分析确定生态系统碳通量(RE/NEE)为多个站点最具主导性的预测特征,但我们后续的滞后和偏相关分析明确拒绝了直接因果关系。相反,我们得出结论:RE和NEE充当露水形成的综合代理变量,而非机制驱动因素。
这种同步关系可以从代理机制理论上解释。在小时分辨率上,露水形成和生态系统呼吸都是对同一稳定夜间气象条件的并发物理和生物响应。在晴朗、静稳的夜晚,稳定边界层同时驱动强烈的辐射冷却并限制湍流混合。
这一发现与众多当代数据驱动的生态水文研究相比提供了关键修正。在近期的机器学习文献中,表现出高预测重要性的变量经常被——有时是错误地——解释为直接因果路径。尽管传统微气象研究已经充分记录了夜间CO₂积累现象,但其与凝结的人工、数据驱动联系在当前机器学习应用中很少被系统解耦。
碳通量的高预测能力与其缺乏物理因果关系之间的明显差异在于算法学习的根本性质。机器学习模型(如RF)优先选择最能综合复杂环境状态以最小化损失函数的变量。因为RE和NEE在数学上封装了大气稳定性、逆温和近地表湿度的综合效应,它们作为算法的高效"捷径",尽管缺乏露水形成的物理先后性。
因此,这种代理现象暴露了纯粹数据驱动的生态水文建模中的关键漏洞。严重依赖此类非因果代理变量风险将生物症状与气象驱动混淆,这人为夸大了预测精度,但最终损害了模型的物理可靠性和空间可转移性。因此,旨在构建稳健的、物理知情的露水估算机器学习模型的未来研究应极端谨慎地对待间接生物代理。理想情况下,此类非因果变量应从预测特征空间中排除,迫使算法从直接气象机制中学习。
4.4 不确定性与局限性
尽管本研究利用物理约束的机器学习框架量化了露水动态,但以下方面的不确定性值得考虑:
i) 数据与测量不确定性。本研究的露水量测量基于晴天夜间排除霜冻事件的负LE值。然而,负LE值也可能源于雾沉积以及冠层/土壤表面内水分的相变和再分配过程的贡献。此外,通量站的涡动相关测量系统存在能量闭合问题。在稳定夜间边界层期间,涡动相关仪器的能量平衡残差达到10-30%,可能引入露水量测量的系统偏差。
ii) 模型不确定性。系统的残差分析揭示了日尺度RF模型的边界行为。首先,关于露水量级,模型表现出集成树算法常见的"回归到均值"局限性:它倾向于轻微高估微露事件并低估极端高露事件。其次,关于风动力学,模型成功捕捉了露水抑制的物理阈值,在高风速下残差紧密收敛到零。然而,在中高风的过渡区域,残差方差增加。
iii) 因果推断不确定性。尽管滞后相关等分析加强了对碳通量RE/NEE"代理变量"假设的支持,但这仍然是基于观测数据的统计推断。最严格的因果验证需要受控实验——例如操纵RE/NEE以观察露水变化——这在野外尺度上难以实施。
本研究有几个局限性,为未来研究提供了方向,主要在三个方面:空间代表性、方法边界和过程特定量化。
i) 11个生态站点的观测数据缺乏足够的空间代表性。
ii) 依赖负潜热通量可能将露水与其他凝结形式混淆。
本研究利用来自11个不同ChinaFLUX站点的长期连续涡动相关数据,建立了可解释的机器学习模型用于露水估算。通过将不同时间尺度上的多算法比较与可解释人工智能技术耦合,我们系统地解耦了凝结的气象和生物驱动因素。主要结论如下:
时间分辨率显著决定阈值驱动的凝结建模。日尺度模型优于存在严重过拟合的月尺度模型,日尺度随机森林模型在气候带上实现了最高的准确性和稳定性(性能:RF > SVR > ANN)。
机器学习反演说明了露水生态水文贡献的明显空间异质性。露水贡献了年降水的0.98%–6.72%,尽管在湿润地区绝对量更大,但在缺水环境中重要性更大。
可解释人工智能有效分离了露水动态中的统计预测能力与物理因果关系。虽然RE/NEE是主导预测因子,但它们仅充当夜间微气候的代理而非因果驱动因素,因此不应作为核心输入特征使用,以确保稳健的跨站点泛化。
未来研究应优先将树结构算法与多源遥感数据集成,同时强调特征工程和验证的野外实验。
本文来源:https://doi.org/10.1016/j.ejrh.2026.103584