气候-社会系统是气候过程与人类社会活动相互影响、动态反馈的复杂耦合系统。传统综合评估模型多依赖预设情景,难以根据系统演化及其反馈效应及时调整治理策略。如何在行星边界约束下实现基于系统状态反馈的自适应治理,仍是地球系统科学服务于全球治理面临的重要挑战。
针对上述挑战,中国科学院青藏高原研究所三极观测与大数据中心李新研究员团队提出了面向气候-社会耦合系统的自适应治理框架。其以马尔可夫决策过程为基础,将深度强化学习(Deep Reinforcement Learning,DRL)与简化的地球系统模型(Integrated Socio-Energy-Ecologic-Climate model,ISEEC)相耦合,以行星边界界定气候-社会系统的安全运行空间,将社会临界要素转化为可调节、可组合的治理行动,并依据气候、能源和社会经济状态响应及其累积回报,动态调整干预时机、强度与组合,使治理策略能够随系统演化持续更新和优化。
研究发现通过协同调节能源补贴、社会规范、气候教育三类治理行动,能够有效抑制全球升温,同时显著缩短行星边界越界持续时间。其中,最优策略组合呈现“前期强干预—中期适度调节—后期针对性强化”的阶段性自适应特征:前期同步加大能源补贴、提升社会规范并加强气候教育,中期稳定社会规范并维持能源补贴,后期进一步强化气候教育。与默认情景相比,该策略将行星边界越界持续时间由70年缩短至15年,将大气二氧化碳浓度峰值由431 ppm降至407 ppm,并使峰值年份由2040年提前至2026年;同时将温升峰值由1.75 ℃降至1.53 ℃,峰值年份由2045年提前至2040年。
当前,地学人工智能主要聚焦于分类和预测问题。该研究将人工智能的另一个重要方向——强化学习,与地学调控问题创新性地结合了起来。作为一种通过主体与系统环境持续交互、依靠反馈信号不断试错与优化决策的机器学习方法,强化学习为解决动态复杂系统的管理难题提供了全新思路。基于此,该研究将强化学习与地球系统模型深度融合,构建了“系统状态表征—治理行动选择—系统响应反馈—策略迭代更新”的闭环序贯决策机制,通过最大化长期累积回报持续优化治理策略;推动治理范式由静态情景推演转向动态反馈调节,促使地学人工智能由传统的特征识别与趋势预测拓展至对复杂地球系统的主动治理调控,为后续面向青藏高原及周边地区开展水资源协调、生态保护与资源开发等多目标权衡的自适应治理研究奠定了理论与方法基础。
相关成果以“Realizing adaptive governance of coupled climate-social systems: A deep reinforcement learning framework”为题,在线发表于国际学术期刊《Geography and Sustainability》。中国地质大学(武汉)与我所联合培养硕士生林鑫为论文第一作者,我所李新研究员与原世伟特别研究助理为共同通讯作者;我所郑东海研究员,中国地质大学(武汉)孙自永教授、陆易博士生,河海大学杜二虎教授,以及兰州大学孟真硕士生为论文共同作者。本研究获得国家自然科学基金(42430112、42301545)与中国博士后科学基金(2023M733606)资助。
论文链接:https://doi.org/10.1016/j.geosus.2026.100519

图1 面向气候-社会耦合系统的自适应治理框架

图2 气候-社会系统状态演化及其对应的自适应治理策略