策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] .
[1]
SHALEV-SHWARTZ S, SHAMMAH S, SHASHUA A. Safe, multi-agent, reinforcement learning for autonomous driving [EB/OL]. (2016-10-11). https://arxiv.org/pdf/1610.03295.
[本文引用: 1]
[2]
DEISENROTH M P, NEUMANN G, PETERS J, et al A survey on policy search for robotics
[J]. Foundations and Trends in Robotics , 2013 , 2 (1/2 ): 1 - 142
DOI:10.1561/9781601987037
[本文引用: 1]
[3]
SILVER D, SCHRITTWIESER J, SIMONYAN K, et al Mastering the game of go without human knowledge
[J]. Nature , 2017 , 550 (7676 ): 354 - 359
DOI:10.1038/nature24270
[本文引用: 1]
[4]
WANG W Y, LI J W, HE X D. Deep reinforcement learning for NLP [C]// Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics: Tutorial Abstracts. Melbourne: ACL, 2018: 19–21.
[本文引用: 1]
[5]
SUTTON R S, MCALLESTER D, SINGH S, et al. Policy gradient methods for reinforcement learning with function approximation [C]// Advances in Neural Information Processing Systems . Vancouver: MIT Press, 2000, 12: 1057–1063
[本文引用: 2]
[6]
WILLIAMS R J Simple statistical gradient-following algorithms for connectionist reinforcement learning
[J]. Machine Learning , 1992 , 8 : 229 - 256
DOI:10.1023/A:1022672621406
[本文引用: 1]
[7]
BAXTER J, BARTLETT P L Infinite-horizon policy-gradient estimation
[J]. Journal of Artificial Intelligence Research , 2001 , 15 : 319 - 350
DOI:10.1613/jair.806
[本文引用: 3]
[8]
SCHULMAN J, MORITZ P, LEVINE S, et al. High-dimensional continuous control using generalized advantage estimation [EB/OL]. [2015-06-18]. https://arxiv.org/pdf/1506.02438.
[本文引用: 1]
[9]
SCHULMAN J, WOLSKI F, DHARIWAL P, et al. Proximal policy optimization algorithms [EB/OL]. (2017−07−20)[2017−08−28]. https://arxiv.org/pdf/1707.06347.
[本文引用: 1]
[10]
郭振华, 闫瑞栋, 邱志勇, 等 基于随机采样的方差缩减优化算法
[J]. 计算机科学与探索 , 2025 , 19 (3 ): 667 - 681
[本文引用: 1]
GUO Zhenhua, YAN Ruidong, QIU Zhiyong, et al Variance reduction optimization algorithm based on random sampling
[J]. Journal of Frontiers of Computer Science and Technology , 2025 , 19 (3 ): 667 - 681
[本文引用: 1]
[11]
HUANG Feihu, GAO Shangqian, HUANG Heng. Bregman gradient policy optimization [EB/OL]. (2021−06−23)[2021−03−16]. https://arxiv.org/pdf/2106.12112.
[本文引用: 1]
[12]
王爽 基于随机镜像下降对称交替方向乘子法的非凸优化问题研究
[J]. 应用数学进展 , 2025 , 14 (3 ): 176 - 191
DOI:10.12677/aam.2025.143104
[本文引用: 1]
WANG Shuang Research on non-convex optimization problems based on stochastic mirror descent symmetric alternating direction multiplier method
[J]. Advances in Applied Mathematics , 2025 , 14 (3 ): 176 - 191
DOI:10.12677/aam.2025.143104
[本文引用: 1]
[13]
JOHNSON R, ZHANG Tong. Accelerating stochastic gradient descent using predictive variance reduction [C]// Advances in Neural Information Processing Systems. Lake Tahoe: Curran Associates, 2013, 26: 315-323
[本文引用: 2]
[14]
NGUYEN L M, LIU J, SCHEINBERG K, et al. SARAH: a novel method for machine learning problems using stochastic recursive gradient [C]// International Conference on Machine Learning . Sydney: PMLR, 2017: 2613–2621.
[本文引用: 2]
[15]
FANG C, LI C J, LIN Z C, et al. Spider: near-optimal non-convex optimization via stochastic path-integrated differential estimator [C]// Advances in Neural Information Processing Systems . Montreal: Curran Associates, 2018, 31: 689-699
[本文引用: 1]
[16]
CUTKOSKY A, ORABONA F. Momentum-based variance reduction in non-convex SGD [C]// Advances in Neural Information Processing Systems . Vancouver: Curran Associates, 2019, 32: 15210–15219
[本文引用: 1]
[17]
LI Z Z, BAO H Y, ZHANG X L, et al. PAGE: a simple and optimal probabilistic gradient estimator for nonconvex optimization [C]// International Conference on Machine Learning . Virtual Event: PMLR, 2021: 6286–6295.
[本文引用: 2]
[18]
PAPINI M, BINAGHI D, CANONACO G, et al. Stochastic variance-reduced policy gradient [C]// International Conference on Machine Learning . Stockholm: PMLR, 2018: 4026–4035.
[本文引用: 2]
[19]
XU P, GAO F, GU Q Q. Sample efficient policy gradient methods with recursive variance reduction [EB/OL]. (2019–09–18) [2021–08–01]. https://arxiv.org/pdf/1909.08610.
[本文引用: 2]
[20]
YUAN H Z, LIAN X R, LIU J, et al. Stochastic recursive momentum for policy gradient methods [EB/OL]. (2020–03–09). https://arxiv.org/pdf/2003.04302.
[本文引用: 3]
[21]
GARGIANI M, ZANELLI A, MARTINELLI A, et al. PAGE-PG: a simple and loopless variance-reduced policy gradient method with probabilistic gradient estimation [C]// International Conference on Machine Learning . Baltimore: PMLR, 2022: 7223–7240.
[本文引用: 2]
[22]
SALEHKALEYBAR S, KHORASANI S, KIYAVASH N, et al. Momentum-based policy gradient with second-order information [EB/OL]. (2022–05–17) [2023–09–26]. https://arxiv.org/pdf/2205.08253.
[本文引用: 1]
[23]
胡磊, 李永强, 冯宇, 等 海森辅助的概率策略梯度方法
[J]. 模式识别与人工智能 , 2025 , 38 (2 ): 177 - 191
DOI:10.16451/j.cnki.issn1003-6059.202502006
[本文引用: 1]
HU Lei, LI Yongqiang, FENG Yu, et al Hessian-aided probability strategy gradient method
[J]. Pattern Recognition and Artificial Intelligence , 2025 , 38 (2 ): 177 - 191
DOI:10.16451/j.cnki.issn1003-6059.202502006
[本文引用: 1]
[24]
LIAO S C, LIU Y, HAN C Y, et al Momentum-based variance-reduced stochastic Bregman proximal gradient methods for nonconvex nonsmooth optimization
[J]. Expert Systems with Applications , 2025 , 266 : 125960
DOI:10.1016/j.eswa.2024.125960
[本文引用: 3]
[25]
KOVALEV D, HORVÁTH S, RICHTÁRIK P. Don’t jump through hoops and remove those loops: SVRG and Katyusha are better without the outer loop [C]// Algorithmic Learning Theory . San Diego: PMLR, 2020: 451–467.
[本文引用: 1]
[26]
FURMSTON T, BARBER D. A unifying perspective of parametric policy search methods for Markov decision processes [C]// Advances in Neural Information Processing Systems . Lake Tahoe: Curran Associates, 2012, 25: 2726−2734
[本文引用: 1]
[27]
PIROTTA M, RESTELLI M, BASCETTA L Policy gradient in Lipschitz Markov decision processes
[J]. Machine Learning , 2015 , 100 : 255 - 283
DOI:10.1007/s10994-015-5484-1
[本文引用: 1]
1
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
A survey on policy search for robotics
1
2013
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
Mastering the game of go without human knowledge
1
2017
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
1
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
2
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
... 式中:$ L({\bf\textit{θ}}) $ 为目标函数, 分布$ p $ 依赖于参数$ {\bf\textit{θ}} $ 且在优化过程中不断变化, 因此,公式(3)是一个非静态优化问题, 与传统监督学习的固定分布不同. 为解决该问题, Sutton等[5 ] 提出策略梯度算法, 通过计算目标函数$ L({\bf\textit{θ}}) $ 的梯度来进行优化,计算式为 ...
Simple statistical gradient-following algorithms for connectionist reinforcement learning
1
1992
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
Infinite-horizon policy-gradient estimation
3
2001
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
... 式中:$ t $ 为参数更新的迭代次数;$ {\bf\textit{θ}}_{t} $ 为第$ t $ 次迭代后的策略参数,每次参数更新对应处理一批轨迹数据;$ \eta $ 为学习率. 估计器即为REINFORCE梯度估计器,主要缺点是梯度估计方差会随情节长度累计. 为了进一步降低方差,Baxter等[7 ] 提出改进后的梯度估计器GPOMDP,仅考虑当前时刻之后的累计奖励(reward-to-go)而非整个轨迹奖励,同时在实际应用中引入基线$ b(s) $ ,利用性质$ {E}[{\nabla }_{\bf\textit{θ}}\log {\pi }_{\bf\textit{θ}}(a|s)b(s)]=0 $ ,进一步减小方差. 采用的GPOMDP估计器为 ...
... Examples of complexity of partial algorithms for finding
$ \epsilon - $ stable solutions
Tab.1 方法 VR技术 样本复杂度 小样本复杂度 GPOMDP[7 ] — $ \mathcal{O}({\epsilon }^{-4}) $ — SVRPG[18 ] SVRG[13 ] $ \mathcal{O}({\epsilon }^{-10/3}) $ $ \mathcal{O}({\epsilon }^{-4/3}) $ STORM-PG[20 ] SARAH[14 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $ PAGE-PG[21 ] PAGE[17 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $ SVRRM-PG SVRRM[24 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $
证明 由定理2的式(30)可得 ...
1
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
1
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
基于随机采样的方差缩减优化算法
1
2025
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
基于随机采样的方差缩减优化算法
1
2025
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
1
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
基于随机镜像下降对称交替方向乘子法的非凸优化问题研究
1
2025
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
基于随机镜像下降对称交替方向乘子法的非凸优化问题研究
1
2025
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
2
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
... Examples of complexity of partial algorithms for finding
$ \epsilon - $ stable solutions
Tab.1 方法 VR技术 样本复杂度 小样本复杂度 GPOMDP[7 ] — $ \mathcal{O}({\epsilon }^{-4}) $ — SVRPG[18 ] SVRG[13 ] $ \mathcal{O}({\epsilon }^{-10/3}) $ $ \mathcal{O}({\epsilon }^{-4/3}) $ STORM-PG[20 ] SARAH[14 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $ PAGE-PG[21 ] PAGE[17 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $ SVRRM-PG SVRRM[24 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $
证明 由定理2的式(30)可得 ...
2
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
... Examples of complexity of partial algorithms for finding
$ \epsilon - $ stable solutions
Tab.1 方法 VR技术 样本复杂度 小样本复杂度 GPOMDP[7 ] — $ \mathcal{O}({\epsilon }^{-4}) $ — SVRPG[18 ] SVRG[13 ] $ \mathcal{O}({\epsilon }^{-10/3}) $ $ \mathcal{O}({\epsilon }^{-4/3}) $ STORM-PG[20 ] SARAH[14 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $ PAGE-PG[21 ] PAGE[17 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $ SVRRM-PG SVRRM[24 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $
证明 由定理2的式(30)可得 ...
1
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
1
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
2
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
... Examples of complexity of partial algorithms for finding
$ \epsilon - $ stable solutions
Tab.1 方法 VR技术 样本复杂度 小样本复杂度 GPOMDP[7 ] — $ \mathcal{O}({\epsilon }^{-4}) $ — SVRPG[18 ] SVRG[13 ] $ \mathcal{O}({\epsilon }^{-10/3}) $ $ \mathcal{O}({\epsilon }^{-4/3}) $ STORM-PG[20 ] SARAH[14 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $ PAGE-PG[21 ] PAGE[17 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $ SVRRM-PG SVRRM[24 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $
证明 由定理2的式(30)可得 ...
2
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
... Examples of complexity of partial algorithms for finding
$ \epsilon - $ stable solutions
Tab.1 方法 VR技术 样本复杂度 小样本复杂度 GPOMDP[7 ] — $ \mathcal{O}({\epsilon }^{-4}) $ — SVRPG[18 ] SVRG[13 ] $ \mathcal{O}({\epsilon }^{-10/3}) $ $ \mathcal{O}({\epsilon }^{-4/3}) $ STORM-PG[20 ] SARAH[14 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $ PAGE-PG[21 ] PAGE[17 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $ SVRRM-PG SVRRM[24 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $
证明 由定理2的式(30)可得 ...
2
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
... 引理1 [19 ] 根据假设2, 有$ g({\bf\textit{τ}}|{\bf\textit{θ}}) $ 是可微的, 即 ...
3
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
... 引理2 [20 ] ...
... Examples of complexity of partial algorithms for finding
$ \epsilon - $ stable solutions
Tab.1 方法 VR技术 样本复杂度 小样本复杂度 GPOMDP[7 ] — $ \mathcal{O}({\epsilon }^{-4}) $ — SVRPG[18 ] SVRG[13 ] $ \mathcal{O}({\epsilon }^{-10/3}) $ $ \mathcal{O}({\epsilon }^{-4/3}) $ STORM-PG[20 ] SARAH[14 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $ PAGE-PG[21 ] PAGE[17 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $ SVRRM-PG SVRRM[24 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $
证明 由定理2的式(30)可得 ...
2
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
... Examples of complexity of partial algorithms for finding
$ \epsilon - $ stable solutions
Tab.1 方法 VR技术 样本复杂度 小样本复杂度 GPOMDP[7 ] — $ \mathcal{O}({\epsilon }^{-4}) $ — SVRPG[18 ] SVRG[13 ] $ \mathcal{O}({\epsilon }^{-10/3}) $ $ \mathcal{O}({\epsilon }^{-4/3}) $ STORM-PG[20 ] SARAH[14 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $ PAGE-PG[21 ] PAGE[17 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $ SVRRM-PG SVRRM[24 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $
证明 由定理2的式(30)可得 ...
1
... 策略梯度(policy gradient, PG)是强化学习(reinforcement learning, RL)中一种经典的策略优化方法,已在自动驾驶[1 ] 、机器人操作[2 ] 、围棋游戏[3 ] 和自然语言处理[4 ] 等多类序列决策任务中取得显著成果. 在RL典型框架——马尔可夫决策过程(Markov decision process, MDP)中,智能体依据与环境交互获得的奖励信号来学习最优策略. 该方法核心思想是将与累计奖励相关的函数作为策略的目标函数, 并通过优化该目标函数获得最优策略[5 ] ,在形式上与传统随机优化问题相似. REINFORCE[6 ] 、GPOMDP[7 ] 等早期经典策略梯度方法,依赖蒙特卡洛梯度估计,普遍存在方差过高影响收敛性能的问题. 对此,提出2类解决思路. 1)设计替代目标函数,引入基线以减小梯度估计方差. Schulman等[8 ] 提出广义优势估计(generalized advantage estimation, GAE),在控制偏差的同时有效减小方差. 在优化过程中引入约束,通过加入Kullback-Leibler散度惩罚项限制策略更新幅度,或采用近端策略优化(proximal policy optimization,PPO)[9 ] 中的裁剪机制以隐式实现该约束. 基于小批量随机采样的双循环结构方差缩减算法可用来解决凸和非凸问题[10 ] . Huang等人[11 ] 提出基于Bregman散度的策略优化框架,通过镜像下降方法进一步降低策略梯度方差. 随机镜像下降对称交替方向乘子法[12 ] 通过引入随机方差缩减算子,在非凸非光滑问题中进一步提升了效率. 2)通过引入方差缩减的梯度估计器来降低梯度估计方差,借鉴监督学习中的梯度估计器, 并结合强化学习的特点进行改进. 常用的监督学习梯度估计器包括:随机方差缩减梯度(stochastic variance reduced gradient, SVRG)[13 ] 、随机递归梯度(stochastic recursive gradient algorithm, SARAH)[14 ] 、随机路径集成差分估计器(stochastic path integrated differential estimator, SPIDER)[15 ] 、随机递归动量(stochastic recursive momentum, STORM)[16 ] 、概率梯度估计器(probabilistic gradient estimator, PAGE)[17 ] . 这些估计器通过引入历史梯度信息进行更新, 在监督学习任务中成功降低了梯度估计方差. 然而, 监督学习中的目标函数通常是“无记忆”的,即损失函数的随机性不依赖于待优化参数,而在强化学习中,轨迹分布是非平稳的,且随着策略参数更新而变化. 因此, 学者们通常将监督学习中的梯度估计器与重要性采样(importance sampling, IS)或海森辅助的概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG)结合,构造出更适用于强化学习的梯度估计器. 例如:随机方差缩减策略梯度(stochastic variance reduced policy gradient, SVRPG)[18 ] 、随机递归方差缩减策略梯度(stochastic recursive variance reduced policy gradient, SRVRPG)[19 ] 、随机递归动量策略梯度(stochastic recursive momentum policy gradient, STORM-PG)[20 ] 、概率梯度估计策略梯度(probabilistic gradient estimation for policy gradient, PAGE-PG)[21 ] 、随机海森辅助递归策略梯度(stochastic Hessian aided recursive policy gradient, SHARP)[22 ] . ...
海森辅助的概率策略梯度方法
1
2025
... SVRPG和SRVRPG是最早引入历史梯度信息的强化学习估计器,需要交替使用大批量和小批量样本(重启机制). STORM-PG通过指数移动平均替代重启机制来持续抑制方差积累,PAGE-PG则采用概率切换机制避免重启. 然而, STORM-PG随机梯度估计项存在方差较大的问题,PAGE-PG的复杂结构增加了实现难度. SHARP将STORM-PG中的IS技术替换为海森辅助技术,胡磊等[23 ] 提出海森辅助概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG),将二阶信息与方差缩减思想进行结合,但存在较大的计算开销. 虽然IS方法在新旧策略差异较大时可能导致权重方差增大,但这一问题可通过截断、归一化等技术缓解. 由于梯度估计器保留历史信息, 实践中新旧策略差异通常不会过大,使得IS方法仍具有实用价值. ...
海森辅助的概率策略梯度方法
1
2025
... SVRPG和SRVRPG是最早引入历史梯度信息的强化学习估计器,需要交替使用大批量和小批量样本(重启机制). STORM-PG通过指数移动平均替代重启机制来持续抑制方差积累,PAGE-PG则采用概率切换机制避免重启. 然而, STORM-PG随机梯度估计项存在方差较大的问题,PAGE-PG的复杂结构增加了实现难度. SHARP将STORM-PG中的IS技术替换为海森辅助技术,胡磊等[23 ] 提出海森辅助概率策略梯度方法(Hessian aided probabilistic policy gradient method,HAPPG),将二阶信息与方差缩减思想进行结合,但存在较大的计算开销. 虽然IS方法在新旧策略差异较大时可能导致权重方差增大,但这一问题可通过截断、归一化等技术缓解. 由于梯度估计器保留历史信息, 实践中新旧策略差异通常不会过大,使得IS方法仍具有实用价值. ...
Momentum-based variance-reduced stochastic Bregman proximal gradient methods for nonconvex nonsmooth optimization
3
2025
... 为解决上述估计器存在的问题, 提出基于随机方差缩减的递归动量策略梯度(stochastic variance reduced recursive momentum policy gradient,SVRRM-PG)算法. SVRRM估计器[24 ] 是在STORM估计器的基础上对随机梯度估计部分进行更精确的建模. 具体而言,引入无环随机方差缩减梯度(loopless stochastic variance reduced gradient, L-SVRG)[25 ] ,在估计随机梯度时,结合参考点随机梯度估计与大批量梯度估计,提升STORM中随机梯度估计项的精度,使得估计过程更加稳健,参考点以一定概率更新或保持不变. ...
... 方差缩减技术与RL结合,有助于降低梯度估计带来的方差,进一步提升任务与环境交互中高成本数据的利用率. 本研究提出SVRRM-PG算法,基于SVRRM监督学习估计器[24 ] ,保持动量更新机制的同时融合L-SVRG思想处理随机梯度部分,从而进一步降低方差并加快收敛速度. ...
... Examples of complexity of partial algorithms for finding
$ \epsilon - $ stable solutions
Tab.1 方法 VR技术 样本复杂度 小样本复杂度 GPOMDP[7 ] — $ \mathcal{O}({\epsilon }^{-4}) $ — SVRPG[18 ] SVRG[13 ] $ \mathcal{O}({\epsilon }^{-10/3}) $ $ \mathcal{O}({\epsilon }^{-4/3}) $ STORM-PG[20 ] SARAH[14 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $ PAGE-PG[21 ] PAGE[17 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $ SVRRM-PG SVRRM[24 ] $ \mathcal{O}({\epsilon }^{-3}) $ $ \mathcal{O}(1) $
证明 由定理2的式(30)可得 ...
1
... 为解决上述估计器存在的问题, 提出基于随机方差缩减的递归动量策略梯度(stochastic variance reduced recursive momentum policy gradient,SVRRM-PG)算法. SVRRM估计器[24 ] 是在STORM估计器的基础上对随机梯度估计部分进行更精确的建模. 具体而言,引入无环随机方差缩减梯度(loopless stochastic variance reduced gradient, L-SVRG)[25 ] ,在估计随机梯度时,结合参考点随机梯度估计与大批量梯度估计,提升STORM中随机梯度估计项的精度,使得估计过程更加稳健,参考点以一定概率更新或保持不变. ...
1
... 方差缩减技术在监督学习中的成功实践, 使得大量研究学者开始探索其在RL中的应用潜力. 然而, 该研究领域面临诸多挑战. 其一是强化学习任务具有动态性和不确定性,无法直接使用全梯度下降法更新参数,只能依赖大批量数据进行近似估计,但在RL中大批量数据采样成本较高;其二是目标函数的非凸性导致难以验证算法是否能收敛到全局最优解;其三是RL具有非遗忘性, 样本数据($ {\boldsymbol{x}}_{i},{\boldsymbol{y}}_{i} $ )所对应的轨迹$ {\bf\textit{τ}} $ 并非来自稳定的采样分布,而是随着策略参数$ {\bf\textit{θ}} $ 不断变化. 针对上述问题, 已提出相应的解决方案. 1)采用类似于式(5)的方法对梯度进行近似估计, 并尽可能使用小批量样本以降低采样成本;2)从梯度数值有界性出发,证明算法能够收敛到一个$ \epsilon $ - 稳定解. 当RL任务采用高斯策略或Softmax策略时,目标函数$ L({\bf\textit{θ}}) $ 满足Lipschitz平滑性,从而具备梯度有界性质[26 , 27 ] ;3)针对策略更新引起的分布偏移,引入重要性采样技术进行校正,计算式为 ...
Policy gradient in Lipschitz Markov decision processes
1
2015
... 方差缩减技术在监督学习中的成功实践, 使得大量研究学者开始探索其在RL中的应用潜力. 然而, 该研究领域面临诸多挑战. 其一是强化学习任务具有动态性和不确定性,无法直接使用全梯度下降法更新参数,只能依赖大批量数据进行近似估计,但在RL中大批量数据采样成本较高;其二是目标函数的非凸性导致难以验证算法是否能收敛到全局最优解;其三是RL具有非遗忘性, 样本数据($ {\boldsymbol{x}}_{i},{\boldsymbol{y}}_{i} $ )所对应的轨迹$ {\bf\textit{τ}} $ 并非来自稳定的采样分布,而是随着策略参数$ {\bf\textit{θ}} $ 不断变化. 针对上述问题, 已提出相应的解决方案. 1)采用类似于式(5)的方法对梯度进行近似估计, 并尽可能使用小批量样本以降低采样成本;2)从梯度数值有界性出发,证明算法能够收敛到一个$ \epsilon $ - 稳定解. 当RL任务采用高斯策略或Softmax策略时,目标函数$ L({\bf\textit{θ}}) $ 满足Lipschitz平滑性,从而具备梯度有界性质[26 , 27 ] ;3)针对策略更新引起的分布偏移,引入重要性采样技术进行校正,计算式为 ...